ARTICLE GUIDE

正文阅读指引

页面依次展示文章标题、发布时间、完整正文和延伸阅读。

所想新闻网 · 资料整理

DeepSeek-V4-Flash-Vision-Exp 上线后,用户可通过特定模型参数访问多模态 API 服务

深度求索官方宣布 DeepSeek-V4-Flash-Vision-Exp 模型已上线至 DeepSeek API 平台。该模型支持图文混合输入,并在视觉理解的 Agent Benchmark 上表现出接近 Opus-4.8 的能力。用户可通过设置 model=' deepseek-v4-flash-vision-exp ' 来调用此服务,并可利用 Files API 进行图片预上传以优化带宽使用。

所想新闻网 · 资料整理

深度求索官方宣布 DeepSeek-V4-Flash-Vision-Exp 模型已上线到 DeepSeek API 平台,这标志着其多模态视觉理解能力通过 API 服务对外开放。该模型的设计目标之一是增强 Agent 的实用性,使其能够有效支持用户借助多样化的 Agent 工具解锁更多实用的工作场景。

从技术接入的角度来看,用户可以通过设置 model=' deepseek-v4-flash-vision-exp ' 来访问 DeepSeek-V4-Flash-Vision-Exp 模型。API 服务层面提供了多模态 API 支持,具体包括 Chat Completions、Messages 和 Responses 三种格式调用方式,这使得模型可以方便地接入各类 Agent 工具使用,并支持图文混合输入。

在能力对标方面,DeepSeek-V4-Flash-Vision-Exp 在需要视觉理解的 Agent Benchmark 上实现了相比 DeepSeek-V4-Flash 的大幅跃升,其多模态 Agent 能力已接近 Opus-4.8。值得注意的是,尽管模型增加了视觉处理能力,但在纯文本能力(如 Agent、推理和世界知识等)方面,DeepSeek-V4-Flash-Vision-Exp 与 DeepSeek-V4-Flash 正式版保持了持平的水平。

关于使用成本和效率的优化,API 服务对图片的处理方式进行了明确规定:图片会先转换成 token 后按 token 计费,其中一张图片最多占用 384 tokens,且计费价格与 V4-Flash 模型一致。此外,为了提升用户体验并节省请求带宽,平台同时开放了 Files API,该 API 不收费,允许用户先将图片上传到平台,然后在后续的请求中通过 file_id 进行引用。

从背景和应用场景分析,此次上线极大地拓宽了模型在实际工作流中的应用边界。以往的模型调用可能侧重于文本逻辑推理,而 DeepSeek-V4-Flash-Vision-Exp 的加入,使得系统能够原生处理包含图像信息的复杂任务,这对于需要结合视觉证据进行决策的自动化 Agent 场景具有重要意义。

时间线和后续影响方面,此次上线意味着用户在构建依赖多模态输入的应用时,可以直接通过标准化的 API 调用流程实现能力升级。开发者可以利用 Files API 进行预处理,再调用支持图文混合输入的 Chat Completions 等接口,从而构建出更健壮、更全面的 Agent 解决方案。

影响边界的界定在于,虽然 DeepSeek-V4-Flash-Vision-Exp 在视觉理解方面表现突出,但其纯文本能力与 DeepSeek-V4-Flash 持平这一信息,提示用户在设计任务时,需要根据核心需求(是侧重视觉增强还是纯文本推理)来选择最合适的模型版本。

对于计划使用该模型的开发者而言,建议关注 API 的调用细节,特别是如何结合 Files API 进行图片预上传和后续的请求引用流程,以确保最佳的性能表现和成本控制。所有关于 DeepSeek-V4-Flash-Vision-Exp 上线的具体信息均来源于公开资料。

信息来源

本文基于上述公开资料整理,未使用来源页面的图片、视频或嵌入媒体。