热点资讯

  1. 首页
  2. Our Projects
  3. DeepSeek-V4-Flash-Vision-Exp多模态模型正式发布

DeepSeek-V4-Flash-Vision-Exp多模态模型正式发布

近日,DeepSeek公司于8月21号在其API平台上推出了新一代实验性多模态模型DeepSeek-V4-Flash-Vision-Exp。开发者只需将model参数设置为deepseek-v4-flash-vision-Exp,即可轻松调用该模型。这一版本不仅保留了V4-Flash的所有文本处理能力,还在视觉理解能力上进行了增强,使其在多模态应用中表现接近Claude Opus-4.8的旗舰水平。在纯文本方面,新模型在推理能力、知识库及文本Agent的功能上与正式版V4-Flash保持一致,Terminal Bench 2.1、DeepSWE、DSBench-Hard等文本评测的得分也没有变化,继续能够胜任代码编写、工具调用、以及长文档处理等任务。

在视觉相关的Agent基准测试中,新版相比于原有的V4-Flash模型有了显著提升。通过ApexBench、Agents'Last Exam、Chartography等多模态测试,模型的评分显著上升,能够完成截图解析、界面识别、图表读取和图文混合任务的切换。这使其适应于GUI智能体、屏幕操作以及图文数据分析等多个开发场景。

在计费方面,该模型沿用了V4-Flash的定价标准,图片输入将被转化为token进行计费,每张图片最高计384个tokens,而不会单独收取视觉相关的费用。百万token的输入在缓存未命中情况下收费为1元,输出费用为2元,而在缓存命中的情况下,费用可低至每百万token 0.02元,从而降低多模态Agent开发的调用成本。同时,模型继续支持100万token的超长上下文窗口,具有思考模式的选项,可调节推理强度为high或max,对于复杂的多模态智能体任务,建议使用max档位。此外,它兼容Harness智能体框架,支持工具调用和Function Call,能够结合图片理解来执行调研、数据提取和自动化任务编排等多个链路工作。

官方指出,该产品为实验预览版,不建议直接应用于生产环境,并将在后续根据实际使用反馈进行优化迭代,持续调整模型的稳定性和输出效果,关于正式版本的上线时间仍未对外公布。