DeepSeek 日前上线了新的多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp。从命名到定位,它就是在让 DeepSeek 的“理解”不止停留在文本上。

视觉理解补齐后:文本能力仍保持,Agent任务接近对标水平
根据发布信息,V4-Flash-Vision-Exp 在纯文本能力上与现有 DeepSeek-V4-Flash 基本持平,包括 Agent 任务、推理能力与世界知识等。
在加入视觉理解后,官方提到该模型在需要视觉理解的多模态 Agent 基准测试中,多模态 Agent 能力已经非常接近 Opus-4.8。

多模态Agent能做哪些事?给图/给链接直接产出结果
更实用的变化在于:它把“看得懂”和“会执行任务”放到同一套多模态流程里,减少你把工具链拼起来的时间。
官方演示的典型场景包括:
商业PPT一键生成:输入需求描述后,直接输出完整PPT,并包含摄影风格配图与多种定价方案。
网站风格二次创作:给网页链接并指定如“黑蓝深海、玻璃UI”等风格,经过多轮对话得到重构后的开发者网站。
前端动态特效制作:用一句创意描述生成可运行的前端特效 Demo(示例为“3D黏土小怪物在复古舞池派对”)。
原先如果要做类似工作,往往需要先用文生图模型,再把结果交给大模型二次处理;现在更倾向于由一个模型在端到端流程中完成。
计费怎么来?与V4 Flash一致,图片按尺寸折算Token
价格方面,官方给出的信息是:DeepSeek-V4-Flash-Vision-Exp 的 API 价格与 V4 Flash 完全一致,并采用峰谷定价。
高峰时段(北京时间): 9:00-12:00、14:00-18:00;其余为空闲时段,空闲价格为高峰时段的一半。
具体价格如下:

(图片来源:DeepSeek)
图片不会按张单独计费,而是会根据图片尺寸折算成 Token,并与文本 Token 一起计入输入费用。
单张图片最多折算 384 个 Token。
另外,DeepSeek 还提供了免费的 Files API:你可以先上传图片得到 file_id,后续请求中直接引用该 file_id,同一张图片在多次调用里无需重复上传。
怎么调用API?用OpenClaw部署助手按四步走
如果你想快速跑起来视觉模型相关能力,可以考虑使用 OpenClaw部署助手 来简化环境与接入步骤。
步骤1:下载与安装
点击下方按钮下载 OpenClaw 部署助手最新版。
步骤2:一键部署环境
打开软件,在主界面点击 「开始部署」。它会自动检测本地环境、下载核心依赖并配置运行参数,按进度完成即可。

步骤3:接入DeepSeek V4(两种方式任选)
部署成功后,进入左侧菜单 「AI模型」 进行配置。接入方式共有两种:
方式①:内置AI模式(推荐新手)
如果不想折腾 API Key,可以启用 内置AI。该模式已预置多款模型(包含 DeepSeek 等在内),通常无需额外填写密钥即可使用。
选择内置AI后,在列表中挑选你要用的模型(示例可选 DeepSeek V4-Flash-Vision-Exp)。然后根据预估使用量购买合适的 Token 包;视觉相关的图片 token 费用会一并包含在内。


方式②:使用自己的API Key接入DeepSeek
如果你已有 DeepSeek 的 API Key,并希望使用自己的密钥,就选择 「DeepSeek」 选项卡,将 API Key 粘贴到对应输入框,同时填写模型名称(示例为 deepseek-v4-flash-vision-exp),最后点击 保存并应用。


步骤4:验证运行状态
回到软件主界面,确认状态显示为 「服务运行中」,然后点击 「打开聊天」。
你可以先发一句测试消息(例如“请介绍一下你自己”),或上传一张图片让模型描述内容。只要能正常生成回复,就说明接入成功。


这次上线可以理解为:DeepSeek 正在把能力从文本推理进一步延伸到多模态视觉理解与 Agent 执行上。想要亲自验证效果的话,建议从上传图片或给出明确任务描述开始,观察它在“看图+输出结果”上的稳定性。