这两年开源多模态大模型的变化说实话比我预想的快得多。2023年那会儿想找几个开源的SOTA多模态模型翻来覆去大多还是学术Demo跑起来效果一言难尽到了2024年下半年到2025年初局面完全变了算得上“开源模型质变”——Qwen、InternVL、MiniCPM、Molmo这些选手陆续放出权重开源模型在不少基准上已经能正面硬刚GPT-4o和Claude这一类闭源模型。这篇文章把我自己反复筛选过的13个开源多模态模型整理成一份完整清单从模型定位、参数量、核心能力到论文、代码、权重的获取路径再到我实际部署跑模型遇到的坑一次性说清楚。内容适合正在做多模态技术选型的工程师、做AI产品原型验证的创业者以及想找研究方向复现的在校学生。1. 为什么2024年之后开源多模态才真正“能打”先说一个很多人忽略的事实两年前开源多模态模型和闭源模型的差距不是“差一点点”而是“差一个代差”。当时常见的做法是拿一个CLIP或BLIP做图像编码再接一个语言模型拼凑起来理解能力勉强能描述图片内容但一到文档解析、数学推理、视频理解这些真实需求就露馅。这几年情况改变的底层原因有这么几个。架构路线收敛了。现在做得好的开源多模态模型基本都验证了“预训练视觉编码器 大语言模型主干 多模态对齐模块”这套组合是可行的而且逐渐演进为原生多模态训练——不是冻结视觉塔只训投影层而是让视觉编码器和大语言模型一起继续训练。InternVL2.5、Qwen2.5-VL、Molmo这些模型视觉理解能力能上去靠的就是这种更彻底的对齐训练。架构收敛带来的直接好处是新人上手理解成本低复现路径清晰社区贡献的工具链也通用。数据配方开始公开了。这个点很多文章不会强调但实际非常关键。大家都有视觉编码器和语言模型真正拉开差距的是训练数据——尤其是图文交错数据、OCR数据、视频帧数据的配比。LLaVA系列公开了视觉指令微调数据的构建方法NVLM直接开源了训练数据NVLM-Instruct-1MMolmo更是把整个PixMo训练集都放了出来。数据一公开等于把闭源模型最核心的“秘方”摊开在桌面上后来者可以直接站在肩上起跑。评测基准倒逼质量。OCRBench、MMMU、MathVista、Video-MME这些细分基准出来以后模型的短板被清晰量化。开源社区的目标变得非常明确哪项分数低就去补哪项数据。这比过去笼统的“看图说话”评测要残酷也更有效。所以2024年之后的模型在文档OCR、图表理解、多图推理上进步明显和评测体系的精细化有直接关系。用一句话概括我的判断现在的开源多模态模型不是“勉强能用”而是“挑对模型、选对场景完全可以直接上生产”。但在具体选型前你需要理解一个基本概念——不同模型走的路线不完全一样。主流开源多模态模型大致分三类一类是拼接派用现成的CLIP或SigLIP视觉编码器接语言模型训练成本低LLaVA、Phi-3.5-vision都属于这类一类是混合派骨干是稀疏MoE或者混合注意力视觉token和文本token在模型内部深度融合DeepSeek-VL2是代表还有一类是原生多模态派从头设计视觉和语言的统一表征训练成本最高但上限也最高Qwen2.5-VL、InternVL2.5本质上都在往这个方向走。搞懂这个分类你再回头看我下面13个模型的分组思路就通了。2. 13个模型速览大小、定位、亮点一张表看清直接给总表。整理维度是模型名、所属机构、参数量、输入与核心能力、最适合的场景。具体每一项的细节在后面各章展开。模型机构参数量输入与核心能力最适合场景Qwen2.5-VL阿里巴巴3B / 7B / 72B图像、长视频、GUI操作定位OCR与文档解析极强通用SOTA、智能体、视频理解InternVL2.5上海AI实验室等1B / 2B / 4B / 8B / 26B / 38B / 78B图像、多图、视频、PDF、网页截图原生多模态预训练综合榜单、文档密集场景NVLM 1.0NVIDIA72B图像、OCR、图表数学推理提升显著训练数据公开数学与推理、模型研究Llama 3.2 VisionMeta11B / 90B图像、视觉推理、文档QA128K长上下文多模态Agent、Llama生态MiniCPM-V 2.6面壁智能8B图像、视频、音频三模态单卡可跑端侧部署边缘部署、多模态AgentPhi-3.5-vision微软4.2B图像、多帧、图表轻量高效128K上下文低资源端侧应用Gemma 3Google4B / 12B / 27B图像输入140语言单GPU友好消费级显卡本地部署DeepSeek-VL2深度求索Tiny 3.4B / Small 16.6B / 27.5B图像、文档、视频、视觉定位MoE稀疏激活效率敏感、定位与文档场景LLaVA-OneVisionUW-Madison等0.5B / 7B / 72B图像、多图、视频统一理解训练配方公开学术复现、多模态研究MolmoAI21B / 7B / 72B图像视觉指向能力强权重数据代码全开放对接真实世界的开放研究GLM-4V-9B智谱AI9B图像、OCR中文理解与指令跟随稳定中文场景、中文文档Yi-VL-34B零一万物6B / 34B图像中英双语对话中文图文能力强中文视觉对话、定制化部署CogVLM2智谱AI19B图像、文档OCR、视觉定位视觉专家机制文档密集型、中文OCR这张表怎么用我的建议是先看你的硬件预算和部署环境确定参数量范围再看你的核心任务落在哪一列把候选缩小到2到3个最后用你自己的业务数据跑一轮不要只看榜单。榜单上高一分不一定代表在你真实场景里更好用后面我会专门讲怎么快速验证选型。3. 旗舰型选手冲SOTA榜单先从这四个下手这一组模型的共同点是参数量大、训练充分、在多个公开权威评测里排开源阵营第一梯队如果你追求“效果天花板”优先从这组里挑。3.1 Qwen2.5-VL目前最全面的六边形选手Qwen2.5-VL在2025年1月发布提供3B、7B、72B三个尺寸是目前开源多模态里综合能力最均衡、社区热度最高的模型之一。它的架构延续了Qwen2.5语言模型加Visual Encoder的方案但对视觉编码部分做了不少优化最值得关注的是M-RoPE也就是多模态旋转位置编码。这个机制让模型在超长视觉输入上还能保持稳定的位置感知能力所以它才能做到“小时级别长视频理解”而不丢失画面细节。我实际体验下来Qwen2.5-VL几个能力点印象深刻。一是文档OCR和版面解析无论是扫描件、复杂表格还是多栏排版都能比较准确地还原结构和文字顺序二是GUI操作理解它能看懂屏幕截图并输出坐标这意味着你可以拿它做手机或电脑上的UI自动化Agent三是数学图表混合推理比如图表题、几何题这类需要“看图再推理”的任务稳定性明显强于多数开源模型。论文和代码获取在GitHub搜QwenLM/Qwen2.5-VL就有官方仓库README里包含了论文预印本链接、Hugging Face和ModelScope的权重地址。72B版本建议用多卡或高显存服务器7B版本在24G显存下用4bit量化就能跑得动。3.2 InternVL2.5原生多模态路线的标杆上海AI实验室主导的InternVL系列一直是我心中“能打”二字的代名词。InternVL2.5发布于2024年12月一口气放出从1B到78B的多个尺寸覆盖了几乎所有硬件条件。它采用的是原生多模态预训练路线视觉编码器与大语言模型不是简单的拼接冻结关系而是联合训练这让它在视觉特征提取和语言理解之间的衔接非常顺滑。InternVL2.5在多个基准上的表现长期占据开源榜首位置尤其是OCRBench、MathVista、MMMU这些硬核榜单。它对超长图像的支持也是一大亮点——可以直接输入一整张网页长截图或者PDF论文页面而不需要提前切图。我拿它处理过一份几十页的中文扫描合同版面识别和关键信息抽取的准确率比我之前用的拼接式模型高了不止一个档次。代码和权重获取GitHub搜OpenGVLab/InternVL仓库权重同样挂在Hugging Face。注意InternVL2.5的规格非常多下载前先想清楚自己的部署资源从8B或26B版本上手比较合适。3.3 NVLM 1.0数学推理和OCR双强的大块头NVIDIA在2024年9月发布的NVLM 1.0最吸引人的是它同时开源了三个架构变体Decoder-only的NVLM-D、Cross-attention的NVLM-X以及混合版的NVLM-H三个版本都是72B。这套开源不仅给用户提供了模型更给研究者提供了一个对照实验——你可以直接看到不同融合架构对效果的影响。NVLM 1.0在数学推理方面的提升非常明显MathVista上的分数从基线的几十个点直接拉到了67%左右这在当时的开源模型里相当亮眼。OCR和图表理解同样不弱官方还顺手开源了约117万条指令微调数据NVLM-Instruct-1M这些数据覆盖了OCR、图表问答、数学推理、多图对话等多种任务。如果你关注的是“模型怎么才能学好数学和文档”这个模型的论文和训练数据值得反复研究。官方仓库在GitHub的nvlm-project/NVLM下权重则在Hugging Face开放。这是典型的“学术资源拉满”型选手适合有研究需求或者想深入理解多模态架构差异的读者。3.4 Llama 3.2 VisionLlama生态里的多模态入口Meta的Llama 3.2系列在2024年9月发布其中11B和90B的Vision版本是Llama家族首次官方支持图像输入。它的做法是在Llama 3.1文本模型基础上引入交叉注意力机制的视觉编码器图像特征通过交叉注意力层融合进语言模型每一层而不是简单地把图像token拼在文本前面。这种设计的优势是知识遗忘更少指令跟随和推理能力接近同规模纯文本模型。它支持128K的长上下文单图理解、文档QA、图表分析都做得不错。我更看重的是它在Llama生态里的位置——配合Llama Stack、Agent工具链这类周边组件可以比较方便地搭建多模态Agent应用。不过要注意Llama 3.2 Vision的许可条款有月活用户限制商用前需要仔细读协议如果需要完全自由的商用授权建议优先考虑前面几个Apache或MIT许可的模型。4. 效率派和端侧选手小参数也有大用处不是所有人都有一块H100。这一组的共同特点是参数量小或者稀疏激活消费级显卡甚至CPU推理都能跑同时能力并不弱。如果你的首要矛盾是“显卡不够、成本敏感”重点看这里。4.1 MiniCPM-V 2.6单卡跑视频多模态的异类面壁智能的MiniCPM-V 2.68B参数量官方定位是“端侧多模态大模型”。它用SigLIP做视觉骨干Qwen2-7B做语言骨干但厉害之处在于同时打通了图像、视频、音频三种模态输入。在8B这个量级能做到这种多模态覆盖的开源社区里很少见。实测体验上最让我惊艳的是它的视频理解能力。你可以直接喂一段几分钟的短视频进去它能持续跟踪画面内容、理解镜头变化并能回答“这个人一开始穿了什么颜色的外套后来换成了什么”这种需要跨帧推理的问题。官方宣传说是端侧首个能在实时视频流上做对话的模型我自己的测试虽然没有跑到实时帧率但基本逻辑是成立的。OCR能力也很强官方对齐GPT-4V级别实际跑中文截图、菜单、发票这类场景效果确实能打。部署上8B模型在单张24G显卡上可以直接跑量化到int4之后显存占用只有6GB左右甚至部分高配手机和迷你主机都有机会运行。仓库在GitHub搜OpenBMB/MiniCPM-V文档和示例很全是我的端侧首选。4.2 Phi-3.5-vision4B小钢炮适合资源受限场景微软的Phi-3.5-vision只有4.2B参数但支持多帧图像输入和128K上下文这在同类小模型里非常少见。架构上是Phi-3.5语言模型加CLIP视觉编码器走的是轻量的拼接式路线训练成本不高但效果在4B这个级别里属于第一梯队。我用它做过一个比较粗的图纸理解原型把多张工程截图按顺序喂进去它能根据前后帧判断位置关系这在空间理解类任务里很实用。文档OCR和图表情景也稳定虽然能力上限肯定不如Qwen2.5-VL 72B但胜在部署太轻松了一张8G显存的卡就能跑16G内存的Mac也能通过llama.cpp这类框架推理。如果你要做的是嵌入式设备、边缘盒子、离线小工具这类场景Phi-3.5-vision是性价比极高的选择。权重在Hugging Face的microsoft/Phi-3.5-vision-instruct仓库下MIT许可商用友好。4.3 Gemma 3消费级显卡上的Google级多模态Gemma 3是Google在2025年3月发布的开放模型其中4B、12B、27B三个版本支持视觉输入。它把SigLIP视觉编码器和Gemma文本模型打通虽然官方没有特别强调多模态但实际效果很能打——尤其考虑到27B是可以在单张RTX 4090上跑的量级这就让它在“本地部署体验前沿模型”这个场景里非常有吸引力。Gemma 3的另一个优势是语言覆盖极广官方宣称支持140多种语言特别适合做多语言的视觉问答。实际测试里它对中文图片的理解也还算不错毕竟底子够好。它的许可协议叫Gemma Terms of Use免费可用但有一些使用条款限制商用前同样要过一遍协议。如果想快速跑起来Hugging Face上直接搜google/gemma-3-27b-it就行。4.4 DeepSeek-VL2MoE架构把成本打下来的效率标杆DeepSeek-VL2发布于2024年12月最大版本总参数量27.5B但用的是MoE稀疏激活架构实际激活参数不到4B训练和推理成本都远低于同等体积的稠密模型。这一点在推理成本敏感的工程场景里几乎是降维打击。它使用SigLIP作为视觉编码器并采用了一种视觉和文本token的深度混合注意力机制在文档图表理解、视觉定位和grounding方面表现很强。我特别推荐做文档类业务的团队关注它的视觉定位能力——你能让模型输出“第几行第几个词”这种细粒度定位这在实体抽取、版面还原任务里非常实用。DeepSeek-VL2的代码在GitHub搜deepseek-ai/DeepSeek-VL2权重在Hugging Face开放但注意它的模型许可和商用条款比MIT要严格需要申请确认。5. 学术研究型模型公开配方最好复现如果你不是直接上生产而是要做研究、做实验、复现SOTA方法这个分组的价值最高。它们共同的特点是训练配方在论文和文档里写得极其细致数据也大概率公开你可以照着流程从零开始训练一个不错的多模态模型。5.1 LLaVA-OneVision视觉指令微调的教科书LLaVA系列在整个多模态领域的影响力不需多讲OneVision版本发布于2024年8月尺寸覆盖0.5B、7B、72B。它的架构总结起来就是一套标准的“SigLIP视觉编码器 Qwen2语言模型 投影层”但把数据配比和处理策略打磨到了极致。它最核心的贡献是实现了“一个模型同时处理图像、多图和视频”并在三个任务维度上都达到当时的领先水平。我建议每一个想入门多模态视觉指令微调的人都把LLaVA-OneVision的论文当第一份必读材料。它对图像token怎么采样、多图怎么拼接、视频帧怎么抽帧都有详细的实验对比你不需要再去猜那些“玄学”参数。整个训练代码和数据构建流程都是公开的GitHub上搜LLaVA-VL/LLaVA-NeXT就能找到完整工程。5.2 Molmo连训练数据都摊开的完全开放模型AI2艾伦人工智能研究所的Molmo发布于2024年10月是我见过“开放程度最高”的多模态模型之一——模型权重、训练代码、训练数据全部公开没有藏着掖着。它的参数量覆盖1B、7B、72B还有一个MoE版本MolmoE-1B。Molmo最大的特色是用了大量人工点击标注的视觉指向数据PixMo数据集。简单说训练时人类会框出图片里的目标位置模型不仅学“图上有什么”还学“目标具体在哪儿”。这让它的视觉grounding能力非常突出能指认目标、圈定位置。在官方评测的客观指标里7B版本已经能和不少超大闭源模型掰手腕。如果你做的应用需要模型跟真实世界交互比如机器人、视觉Agent、图像编辑器Molmo值得优先研究。仓库在GitHub搜allenai/Molmo。5.3 研究型模型和工程型模型的取舍思路选研究型模型本质上是在买“透明度”。拿LLaVA-OneVision和Molmo这类模型上生产你获得的不是纸面最高的分数而是对模型行为最完整的掌控力——数据是什么、怎么训练的、中间层长什么样全都清楚。出了问题你能从原理层面定位而不是只能调Prompt。不过也要看清代价这类模型的配套工程化工具链往往不如阿里、谷歌这些大厂维护的模型完善部署文档偶尔要自己踩坑。我的建议是研究阶段用研究型模型打底一旦原型验证通过再根据推理成本、延迟、社区活跃度切换到对应的工程型模型这个流程最稳。6. 中文场景特化OCR、文档和多语言本地化中文多模态场景有自己独特的难点中文字符密度高、版面结构复杂、古文或手写变体多通用模型经常在中文细节上失真。这一组模型在中文数据和中文场景上有专项优化如果你的业务面向国内用户优先考虑。6.1 GLM-4V-9B中文图文理解里的老实人智谱AI在2024年7月发布的GLM-4V-9B参数量约9B基于GLM-4语言模型加视觉模块定位于中文场景的高效图文理解。它的中文OCR表现非常稳不仅认字准对中文表意、成语、俗语的理解也明显比同规模的国外模型好。在CMMMU等中文多模态评测基准上GLM-4V-9B是开源阵营里表现最好的模型之一。实际用下来它在中英文混合文档、网页截图、表格识别这些任务上都很可靠幻觉率控制得也不错。智谱的方式务实模型不仅能用而且中文语感自然这来源于他们一直以来的中文数据积累。部署上9B的体量也比较友好一张24G显卡跑全精度没压力。GitHub搜THUDM/GLM-4能找到下载入口不过权重许可有使用登记要求商用需要确认清楚条款。6.2 Yi-VL-34B中文视觉对话的稳健选择零一万物的Yi-VL-34B在2024年1月发布基于Yi-34B语言模型和CLIP视觉编码器采用LLaVA式架构中英文双语视觉对话能力均衡。它的中文能力和英文能力都比较稳尤其在中文图像描述、中文视觉问答场景能把图片里的文化细节——比如国画中的题字、中文菜单里的菜名——理解得比较到位。34B版本的部署门槛不算低但你也可以选择6B版本做轻量验证。Yi-VL家族的优势在于它继承了Yi系列在中文数据上的训练积累对中文语料的理解深度比很多通用模型好。如果你需要一个可以私有化部署、中文拟人感强的视觉对话模型Yi-VL-34B值得纳入候选。6.3 CogVLM2视觉专家机制打出的中文文档处理利器智谱AI的CogVLM2发布于2024年5月19B参数量。它的技术亮点是“视觉专家”机制——在语言模型的每一层加入可训练的视觉专家模块通过改进的QKV矩阵把图像信息注入模型这样做的好处是视觉能力增强的同时尽量避免破坏语言模型原有的推理能力。在中文文档处理上CogVLM2是我用过最顺手的那一个。无论是表格、票据、公章共存的中文扫描件还是结构复杂的论文首页它都能比较准确地输出结构化结果。同时它还支持视觉定位能框出“这个结论出现在图片哪个区域”。19B的量级在单卡24G上正好跑得动属于“一顿饭钱的显卡就够”的模型。仓库在GitHub搜THUDM/CogVLM2注意部分权重要在Hugging Face上同意条款后才能下载。7. 论文、代码、权重去哪拿资源获取与避坑这里直接给一套我每天在用的检索路径少走弯路。先说论文。现在多模态模型的论文一般先挂在arXiv上搜索时优先搜“模型名 Technical Report”这类报告会把训练细节、评测方法、失败案例分析都写出来信息量远超发布会式论文。比如“Qwen2.5-VL Technical Report”“InternVL2.5 Technical Report”直接能搜到。再看代码。开源模型的代码仓库基本都以组织名模型名的格式命名。GitHub搜不到的时候先确认一下组织名阿里的组织名是QwenLM智谱是THUDM上海AI实验室是OpenGVLab面壁是OpenBMBDeepSeek是deepseek-aiAI2是allenai。这些组织下通常还挂着同系列的其他工具找到主仓库后看README里面一般会列清楚预训练代码、微调脚本、评测脚本、权重地址、官方示例比自己人肉翻找高效得多。权重获取主要看Hugging Face和ModelScope两个渠道。国内用户下载Hugging Face模型经常遇到速度问题我建议优先用ModelScope它是阿里通义实验室做的国内模型社区速度稳定Qwen、InternVL、MiniCPM这些主流模型都有同步权重。如果一定要从Hugging Face拉可以用huggingface-cli等工具的镜像配置具体设置方法社区文档已经很全这里不展开。最后下载前必须养成的习惯先看License。这里专门列一下常见的坑MIT / Apache 2.0商用最省心Phi-3.5、MiniCPM-V、LLaVA-OneVision基本属于这类。自定义开放协议Qwen、GLM、DeepSeek、Llama、Gemma、Molmo各有自己的条款常见限制包括大厂商用要申请、月活用户超过一定数量要授权、部分国家地区不可用等等。我的建议是把License页面保存成PDF存档真到了商业落地阶段这是你的合规凭证。还有两个具体的下载坑也提一下。第一GitHub仓库带LFS权重时直接git clone经常失败建议单独下载LFS文件或者用网盘转存脚本第二Hugging Face部分模型页面点“下载全部”会因为网络中断而失败稳妥做法是按需只下载必要文件比如safetensors分片文件加config.json、tokenizer等不要一次拉全仓。8. 部署实测经验与选型建议模型选完了最后一步是把它跑起来。这里分享一些我踩坑踩出来的经验。8.1 显存估算别只看参数量的计算公式很多人以为显存需求 参数量 × 2字节。这个公式只对全精度FP16推理有效实际跑起来还要算上KV Cache、激活值、CUDA上下文的开销。我的经验公式是FP16推理按参数量 × 3到4估算显存INT4/INT8量化后按参数量 × 1到1.5估算。举例7B模型FP16推理大约需要21-28G显存量化到INT4大约需要7-10G13B模型FP16需要40G上下量化后13-18G72B模型FP16基本要220G以上int4量化也要50-60G单张卡基本不可能跑舒服。如果你的显存刚好卡在边界上优先做两件事一是开启KV Cache量化比如8bit缓存能省不少显存二是限制输入图像的最大分辨率视觉模型的显存占用和输入分辨率强相关把分辨率从1024压到640显存占用能降一半效果损失通常不明显。8.2 部署框架怎么选哪些场景用哪个我按场景给一套比较实用的参考配置都是自己跑通过的组合快速实验、功能验证用Transformers库直接加载模型代码量最小适合第一次接触模型时做API调用和效果检查。高并发生产服务用vLLM支持多模态模型后吞吐量提升非常明显但注意vLLM对新模型的支持有一个适配周期先查文档确认你要用的模型是否被官方支持和社区测试覆盖。本地私有化轻量部署Ollama上手最快一条命令拉起模型适合个人电脑和Demo但Ollama对多模态模型的支持和模型更新速度不如vLLM快做产品时还是要评估清楚。端侧极致压缩用llama.cpp或MLC LLM可以把模型量化到极小体量跑在CPU或手机上MiniCPM-V和Phi-3.5-vision都有对应的端侧适配。部署时最容易踩的坑是版本不匹配。Transformers库和vLLM版本更新很频繁而模型官方仓库的示例代码往往是基于旧版本写的直接跑经常报“某某参数不存在”之类的错误。我的习惯是第一次跑模型严格按照官方README给的requirements.txt装环境不要图省事用全局环境。装完之后锁版本再做后续升级哪怕只升一个patch版本也要先测几个关键case。8.3 我的选型决策树直接抄走根据我自己的经验给你一套快速决策逻辑要冲榜单效果、做智能体或视频理解首选Qwen2.5-VL 72B或InternVL2.5 78B看预算和硬件选这两个选哪个都不会错。显卡紧张但还想体验顶尖效果用Gemma 3 27B或DeepSeek-VL2前者稠密模型部署简单后者MoE更省推理资源。做端侧、边缘盒子、移动端MiniCPM-V 2.6和Phi-3.5-vision二选一小视频理解选MiniCPM-V极致轻量选Phi。做中文文档、中文OCR最多的业务CogVLM2、GLM-4V-9B都能打前者文档理解更强后者中文对话更自然。做研究、复现、训练方法探索直接看LLaVA-OneVision和Molmo数据和方法都公开踩在别人肩膀上改比你从零撸省太多事。8.4 最后提醒两句实话模型白嫖之前先想清楚你的端到端场景。多模态模型只是识别理解这一步后面通常还跟着结构化抽取、知识库检索、业务规则引擎这些环节。开源模型选得再好如果上下游链路没设计好效果一样出不来。我在实际项目里最花时间的反而不是模型本身而是数据清洗和Prompt工程这种“脏活”。再一个就是不要迷信榜单。所有公开评测基准都有人在刷榜单和真实业务差距很大。我的做法是每次选型都先准备20到50条自己的真实样本跑一遍看错误模式重点观察三个维度OCR误识别率、指令跟随的稳定度、对长文本的忠实度。这三个维度过关了模型基本就能用。如果不过关再好的榜单排名也和你无关。