刚刚,多模态版DeepSeek「长眼」了!1000张图只要1块钱
名字叫DeepSeek-V4-Flash-Vision-Exp,API现在就能调。
更狠的是,一张图片最多占384个token,计费价格与V4-Flash完全一致。
在别家要单独算钱的多模态能力,在DeepSeek这里直接变成了赠品。
而且,还是满配版的。

V4-Flash,现在有眼睛了!
纯文本方面,加了视觉的V4-Flash-Vision-Exp反而更强了。
在七项Agent评测里,有六项都超过了V4-Flash-0731。
多模态方面,更是一度干掉了硅谷顶流模型。
有了如此强大的能力,对开发者来说,再也不用为看图去接第二个模型了。

上手试一把
我们也在Agent框架里直接调了DeepSeek-V4-Flash-Vision-Exp。
首先,丢给它一张OpenAI官网的截图,让它1:1复刻。
Prompt是这么写的:
把这张截图1:1复刻成一个可运行的单文件HTML(内联CSS/JS,不许用任何外部依赖)。
要求:
1. 先逐块描述你看到的布局结构、字体族猜测、主色值(给hex)、间距节奏,再写代码;
2. 所有文案照抄截图里的原文,不要自己编;
3. 复刻交互:hover态、滚动渐入、按钮质感都要还原;
4. 响应式,窄屏375px下不能崩。
这活儿难就难在,它不只是「认出图里有什么」。还要把一张图拆成布局、色值、间距、字重,再一行行翻译成代码。
从结果来看,V4-Flash-Vision-Exp复刻出的网站简直一模一样!

接着,我们又出了一道完全不同的题:让它做一个精品咖啡烘焙工坊的B端合作PPT。
帮我做个精品咖啡烘焙工坊的B端合作PPT,我们只做浅烘单品豆,不做拼配不做商用豆,一次最小起订量只要五公斤。核心调性:手作、较真、有点固执——不谈第三波咖啡浪潮这种行业黑话,谈的是每一支豆子我们烘了几遍才定下曲线。视觉风格要粗粝、有材质感、像一本印刷品而不是PPT,拒绝性冷淡北欧风、拒绝ins风构图。PPT发给独立咖啡馆主理人,他们比我懂豆子,所以专业细节一个都不能虚,最后给到三档真实的供货合作方案,配图用烘焙车间和生豆特写质感。
这次,V4-Flash-Vision-Exp交出来的是一份11页的B端提案。浅烘单品豆、五公斤起订、三档供货方案,一样不落。
更难得的是分寸:全篇没往行业黑话上靠,也没有一句是写给外行看的科普。
一句模糊的需求进去,一份能直接发给客户的东西出来。

文本拉满,视觉起飞
一厘钱是什么概念。
根据TokenMix的视觉API横评,同一张1024×1024的图,Claude Sonnet 4.6要吃掉1334个token,一千张图收你4美元;GPT-5.4 Vision则是765个token,1.9美元;Gemini 3.1 Pro为258个token,0.5美元。
折成人民币,最贵那档接近29块。
相比之下,DeepSeek这边给的是一个封顶值:384。
外加V4-Flash的输入价只要3块/百万token,低谷时段再打五折。
也就是说,同样一千张图,DeepSeek的输入成本只有1.15 元,谷时更是不到6毛。
29块和1块1,差了25倍;挪到谷时,直接差了50倍。
毫不夸张地说,一千张图三十块和一千张图一块钱,是两种产品设计。
前者你得想清楚「这一步到底要不要看」,后者你可以让Agent每跑一步都截个屏。
八天,补上最后一环
8月13日,DeepSeek Harness开源,原生支持Responses API——Agent的运行时,铺好了。
8月21日,视觉上线,同样支持Chat Completions、Messages、Responses三种格式调用——模型的输入端,也铺好了。
同一天,Harness跟着发了0.1.1,开箱即支持新模型,适配代码一行不用写。
图怎么进来,也备了三条路:base64内联、外部URL、Files API。
其中Files API今天同步开放,不收费。传一次,之后用file_id引用,同一张图不用重复上传。
对于要反复看同一张设计稿、同一份报表、同一个页面截图的Agent来说,这省下的是每一轮的往返成本。
参考资料:
https://x.com/deepseek_ai/status/2090730032574631962
编辑:摩西 所罗门
声明:本文转载自新智元,转载目的在于传递更多信息,并不代表本社区赞同其观点和对其真实性负责,本文只提供参考并不构成任何建议,若有版权等问题,点击这里查看更多信息!
AI 中文社