深度求索宣布,多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp 已上线 DeepSeek API 平台。该模型目前为实验性质,开发者可通过将 model 参数设置为 deepseek-v4-flash-vision-exp 进行调用。此次更新的核心,在于将视觉理解能力接入 API 服务,使多模态输入成为 Agent 工作流中可直接调用的一项基础能力。
从文本到视觉,V4-Flash-Vision-Exp 补齐 Agent 场景
从官方披露的信息看,DeepSeek-V4-Flash-Vision-Exp 并不是一个孤立的视觉模型,而是建立在 V4-Flash 能力体系上的多模态扩展版本。在纯文本能力方面,包括 Agent、推理和世界知识等方向,该模型与 DeepSeek-V4-Flash 正式版处于同一水平。
变化主要体现在视觉理解相关的 Agent 任务上。官方称,在需要视觉理解的 Agent Benchmark 中,V4-Flash-Vision-Exp 相比 DeepSeek-V4-Flash 有明显提升,其多模态 Agent 能力已接近 Opus-4.8。这意味着该模型的价值并不只是“识别图片内容”,而是进一步面向能够读取图像、理解上下文并执行任务的 Agent 应用。
- 纯文本能力与 DeepSeek-V4-Flash 正式版持平
- 视觉理解相关 Agent Benchmark 表现提升
- 多模态 Agent 能力接近 Opus-4.8
- 当前为实验性质模型
API 调用方式更完整,图片计费与 V4-Flash 一致
在调用层面,DeepSeek 为 V4-Flash-Vision-Exp 提供了较完整的 API 接入方式。该模型支持 Chat Completions、Messages、Responses 三种格式调用,便于开发者接入现有系统,也更容易嵌入不同类型的 Agent 工具中。
输入方面,模型支持图文混合输入,并提供三种图片传入方式:base64 内联、外部 URL 以及 Files API。其中,Files API 现已开放且不收费,用户可以先把图片上传到平台,再通过 file_id 在请求中引用。对于同一张图片需要在多个请求中使用的场景,这一方式可以减少重复上传,节省请求带宽。
计费方面,官方表示图片会转换成 token 后按 token 计费,单张图片最多占 384 tokens,计费价格与 V4-Flash 模型一致。对于已经在使用 DeepSeek API 的开发者来说,这一规则降低了评估新模型接入成本时的不确定性。
多模态能力进入 Agent 工具链,实际价值在于工作流扩展
这次上线值得关注的一点,是 DeepSeek 并未只强调模型本身的视觉能力,而是把重点放在 Agent 框架内的适配能力上。官方表示,V4-Flash-Vision-Exp 在各类 Agent 框架内展现出了较好的多模态适配能力,能够支持用户借助多样化的 Agent 工具解锁更多实用工作场景。
这一表述反映出当前多模态模型竞争的新方向:视觉能力不只是单点识别,而是要进入工具链,成为 Agent 执行任务时可调用的感知层。对于开发者而言,如果视觉输入可以与文本推理、工具调用和任务规划顺畅衔接,模型的应用范围就不再局限于问答或图片描述,而可以延伸到更复杂的自动化流程中。
由于该模型目前仍为实验版本,其后续稳定性、效果变化和正式发布时间仍需观察。但从 API 能力、图片传入方式和多模态 Agent 定位来看,DeepSeek 正在推动视觉理解从展示能力走向可集成的工程能力。
原创文章,作者:点点,如若转载,请注明出处:https://www.dian8dian.com/deepseek-duo-mo-tai-api-xin-mo-xing-shang-xian