过去,多模态模型常被拿来与「看图说话」的能力对标;但在 Agent 场景里,真正重要的不只是识别图片,而是能否把视觉信息转化为连续、稳定的工具调用。DeepSeek 近期开源的 DeepSeek-V4-Flash-Vision-Exp,正是在这一维度上给出了新的参照系。该模型在多个多模态 Agent 基准测试中逼近 Opus 4.8,其中 DeepSWE 得分 59.3,超过 Opus 4.8 的 58.0;Terminal Bench 2.1 得分 83.9,距离 Opus 4.8 的 85.0 仅差 1.1 分。
从榜单数据看:差距缩小,但仍有明确短板
如果只看单一指标,这次开源模型的进展相当显著。Toolathlon-Verified 上,DeepSeek-V4-Flash-Vision-Exp 得到 75.9 分,Opus 4.8 为 76.2 分,两者相差仅 0.3 分。这说明在工具调用的准确性和调用顺序层面,国产开源模型已经与头部闭源旗舰非常接近。
但在更复杂的任务中,差异仍然存在。Chartography 项目上,DeepSeek 得分为 64.3,Opus 4.8 为 65.0;而在 NL2Repo 上,差距被明显拉大:DeepSeek 为 57.7,Opus 4.8 为 69.7。后者更偏向仓库级导航和跨文件推理,这意味着模型不仅要「看懂」截图,还要结合代码结构进行长链路判断。
- DeepSWE:DeepSeek 59.3,Opus 4.8 58.0
- Terminal Bench 2.1:DeepSeek 83.9,Opus 4.8 85.0
- Toolathlon-Verified:DeepSeek 75.9,Opus 4.8 76.2
- Chartography:DeepSeek 64.3,Opus 4.8 65.0
- NL2Repo:DeepSeek 57.7,Opus 4.8 69.7
这组数据传递出一个清晰信号:视觉理解能力的差距并不主要体现在「识别」本身,而是在复杂推理与系统级任务执行上。对于 Agent 而言,看懂一张图表并不难,难的是基于图表趋势进一步推断风险、触发工具调用,并在多轮交互中保持一致性。
评测条件需要被认真对待
值得注意的是,素材中提到的 DeepSWE 成绩,是在 DeepSeek Harness 极简模式下测得,参数设置为 temperature=1.0、top_p=0.95。这样的配置更偏向生成多样性,而非严格精确输出。对于代码修复类任务,这种设置可能放大模型在某些场景下的优势,因此不能简单将榜单分数等同于生产环境表现。
相比之下,Terminal Bench 2.1 更强调多轮交互中的系统状态遵循能力。DeepSeek 在该项上落后 Opus 4.8 约 1.1 分,说明在需要严格理解环境反馈、连续执行命令并维持上下文一致性的任务中,开源模型仍有稳定性上的提升空间。
这也提醒开发者:基准测试的价值在于提供能力坐标,而不是直接替代真实业务验证。尤其是在视觉 Agent 场景里,图片分辨率、上下文长度、工具调用次数、异常输入和长尾任务,都会影响最终效果。
多模态 Agent 的关键不在模型分数,而在链路设计
素材中提到,一张截图进入多模态 Agent 后,通常要经过视觉编码、语义理解和工具调度三个阶段。视觉编码器将图片切分为最多 384 个 token 的序列,再通过 Aligner 投射到语言模型的 embedding 空间;随后由推理层结合历史上下文做出工具调用决策。单请求最多支持 600 张图片,但实际消耗仍取决于分辨率、内容复杂度和编码方式。
在工程落地中,Token 预算往往是最容易被低估的问题。一张截图最多占用 384 个 token 是静态上限,但如果后续需要连续调用多个工具,上下文窗口会被迅速消耗。素材给出的例子是:如果一张截图解析后需要连续调用 5 个工具,每个工具平均消耗 150 token,那么首轮视觉输入就已经占据相当大的上下文空间。
围绕这一问题,素材总结了三种典型架构:
- 传统 Pipeline:图片先由视觉模型提取特征并生成结构化描述,再交给语言模型做工具决策。优点是链路清晰、模块可独立替换,缺点是「图片转文字」过程中可能损失信息。
- 原生多模态:图片直接作为 token 参与推理,视觉信息与文本上下文共享同一推理空间。优点是信息保真度更高、端到端能力更强,缺点是对上下文窗口和推理效率要求更高。
- 混合路由:简单图片走轻量视觉编码器,复杂图片走原生多模态链路。工程上更灵活,但路由策略本身会成为新的成本中心。
换句话说,模型能力提升只是第一步。对于真实业务而言,是否选择原生多模态、是否需要压缩图片、是否引入混合路由,都取决于任务分布。若业务以 OCR 和简单描述为主,传统 Pipeline 仍有价值;若涉及多步推理和工具链联动,则需要更谨慎地评估原生多模态方案的 token 成本与稳定性。
开源模型的意义:把选择权交回工程侧
DeepSeek-V4-Flash-Vision-Exp 的开源,带来的不只是「国产模型逼近闭源旗舰」这一叙事,更重要的是让开发者可以重新审视 Agent 系统的边界。过去,多模态能力往往被封装在闭源 API 中,开发者难以控制模型行为、推理配置和上下文策略;而开源版本上线后,团队可以围绕自己的业务场景做更细粒度的测试与调优。
不过,素材也明确提示:Vision-Exp 仍属于实验版模型,其 Benchmark 数据来自特定评测设置,生产环境需要额外考虑长尾 case 和边界输入。如果涉及关键业务链路,建议先在同等场景下做小规模 AB 测试,用真实请求验证模型表现,而不是直接依据榜单分数做选型决策。
对行业而言,这次发布的真正意义在于:多模态模型竞争正在从「能力追赶」进入「工程验证」阶段。分数接近只是入场券,能否在复杂工具链、真实交互和成本控制中稳定运行,才会决定模型能否成为 Agent 基础设施的一部分。
原创文章,作者:点点,如若转载,请注明出处:https://www.dian8dian.com/deepseek-shi-jue-xin-mo-xing-bi-jin-opus-4-8-duo-mo-tai