尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

DS终于有眼睛了?我测出了它“看不清“的证据 | DeepSeek-V4-Flash-Vision-Exp

DS终于有眼睛了?我测出了它“看不清“的证据 | DeepSeek-V4-Flash-Vision-Exp 大家好我是王不二。前两天还在吐槽 DeepSeek 没眼睛专门给它写了个插件补视觉能力让 DeepSeek 支持多模态结果话音没落DeepSeek-V4-Flash-Vision-Exp 就来了。DS 官方终于把眼睛装上了。网上的评分看着挺漂亮官方口径是纯文本能力与 V4-Flash 正式版持平视觉 Agent 能力大幅跃升。但评分是评分实际用起来怎么样我第一时间上手跑了 5 个实验发现了一些很有意思的事~30 秒了解 DeepSeek-V4-Flash-Vision-Exp8 月 21 日DeepSeek 在 API 平台上线了 V4 系列首个支持图片输入的视觉模型deepseek-v4-flash-vision-exp注意名字里的Exp——官方明说这是实验性质。文本能力不降视觉能提提升官方口径是纯文本能力推理、Agent、知识与 V4-Flash 正式版持平在需要视觉理解的 Agent Benchmark 上大幅跃升比如 ApexBench 从 26.2 涨到 36.5官方称多模态 Agent 能力接近 Opus-4.8。规格很标准上下文 100 万 token单次最多输出 38 万 token支持思考模式off/low/high/max 四档和工具调用。唯一缺席的是 FIM 代码补全普通聊天和 Agent 场景不受影响。价格一分没涨与 V4-Flash 完全同价图片按尺寸折算 token 计费单张图片最多只占 384 tokens——记住这个数字后面的实验里它很重要。简单说DS 用 Flash 的价格把眼睛装上了。但一张图上限只使用 384 tokens 的描述也让人好奇这双眼睛的分辨率到底怎么样。这正是我后面想测的。先让它做个 Game Boy开开胃既然是视觉模型我就想了一个能同时测看图和干活的任务让它用 HTML 复刻一个复古掌机红白机玩俄罗斯方块那种。第一轮纯文字描述不给图。指令下去效果大概是下面这样。乍一看还行但按钮布局明显不对劲。靠嘴说是说不清了于是我上网找了张 Game Boy 实机图让它照着做。模型对照着图改了一版出来效果还行吧和实机图放一起看看。大体结构有了屏幕、十字键、AB 键都在但细节差点意思。而且屏幕上的菜单文字溢出错位“SELECT GAME愣是显示成了LECT GA”按钮的质感也比较平。我让它对照着实机图继续改。第二版的效果还不错方向键的质感确实好了不少按钮下方的阴影也补上了。但就是这处阴影让我心里咯噔了一下。一处歪掉的椭圆阴影让我开始怀疑你仔细看上图中按钮下面的阴影椭圆的方向是错的。质感上来了方向却不对。这给我一种很奇怪的错觉就好像有个人告诉它按钮下面有椭圆阴影但没说椭圆该朝哪个方向转于是它随便画了一个。不是看见更像是听见。为了验证这个感觉我做了一件更直接的事。把页面截图在图上用画笔标注了三处修改作为需求丢给 DS。红色按钮下面的阴影 → 移到我画红圈的位置白色按钮下面的阴影 → 移到我画黄圈的位置画黑色 ×的那个阴影 → 直接去掉结果更诡异了。黑 × 处的阴影确实删掉了——说明它至少读到了三条指令。但红圈和黄圈两处阴影的位置纹丝不动它只是把原来那两个椭圆阴影改成了我标注用的颜色。仔细品品这个逻辑。红圈黄圈是我用画笔圈出来的目标位置颜色只是区分标记。如果它真看见了我的标注图不可能把圈理解成换颜色。但如果是有个人跟它说按钮那有两处阴影一处改成红色、一处改成黄色那它这么改就完全说得通了。这一刻听见的假设在我脑子里越来越清晰。换个思路分类测一测一个 case 说明不了问题。我设计了一组对比实验把任务分成两类A 类用语言描述就能解决的任务如果模型是听见的这些应该能做对B 类必须真正看见图才能解决的任务如果模型是听见的这些应该翻车A 类实验能说清楚的任务实验 1食物链排序。给了一张图上面有 ABCD 四个选项。A 是青蛙B 是草C 是蚂蚱D 是蛇要求按 X→X→X→X 的格式排出食物链。这个任务的本质是认出四个生物分别是什么然后排个序。完全可以靠语言描述完成。“B是草C是蚂蚱A是青蛙D是蛇”排就是了。DS 答对了B→C→A→D还顺手把生产者→初级消费者→次级消费者→三级消费者的能量传递解释了一遍。实验 2五子棋胜负判断。给了一张五子棋棋盘问黑棋和白棋谁更接近赢。严格说棋类任务介于两类之间——要用第X行第Y列有几颗子逐个坐标描述其实挺啰嗦但好歹能描述清楚所以归为 A 类。DS 也答对了判断黑棋占优不过它思考了 44 秒。两个 A 类实验全过符合听见假设的预期。B 类实验说不清楚的任务实验 3数矩形。我画了几个有重叠的矩形问题是大大小小的矩形一共有多少个重叠产生的小矩形也算。这个任务就不好用语言描述了。你得把每个矩形的位置、重叠关系、边界在哪都说清楚文字描述几乎不可能完整表达。果然 DS 翻车了。它答 12正确答案是 9。但比答错更离谱的是过程细节它说图里有4 个大矩形——可图上明明只有 3 个。连大矩形的个数都数错了后面的推理自然是全错。而且这一轮它想了整整1146 秒19 分钟。对于一个 Flash 级别的模型来说这个思考时长本身就很不对劲。说明一下这个实验我只跑了一次。实在是等不了它一次就想了 19 分钟。感觉上它在反复推理一张它其实看不清的图。所以结果是单次实测的体感仅供参考但这个时长本身我觉得已经很能说明问题了。同一个问题丢给 Qwen 3.8-Max同样是单次同题对比答对了甲乙丙三个大矩形、三处两两重叠、一处三者重叠枚举得清清楚楚还快得多。实验 4马里奥 HTML 复刻。顺着这个思路继续。我找了一张马里奥像素图要求用 HTML 复刻。这个任务如果真能看见像素图的颜色、位置、比例一目了然照着写 HTML 就行。但如果是听见的……你可以试试用文字把这张图描述出来几乎不可能。DS 第一次给出的结果脸上黑乎乎一大坨看不出是个什么东西。我又给了它一次机会明确让它认真看图、认真对比、重新调整。第二版好了一点至少有个形了但脸还是糊的离可用还差得远。两次机会但结果还是不满意。到这里我开始怀疑是不是题出得太难了于是我拿同一道题丢给 K3。我滴妈满分啊挑不出一点毛病。我都怀疑 K3 是不是直接把图片嵌进 HTML 里了。特意打开代码看了一眼结果真的是纯代码画出来的。它先是把整张图转成了一个18×16 的字符点阵R红、S肤、B蓝、N棕……再用 div 一个像素一个像素上色。这个思路本身就很视觉先把每个像素的坐标和颜色看清楚了再动笔。这跟 DS 的黑乎乎一大坨差的不是代码能力是视力。看见了但是看不清做完这几轮实验我的感受是这样的。DeepSeek-V4-Flash-Vision-Exp 确实拥有了视觉能力食物链、五子棋这类可描述的任务它做得不错。但一旦遇到描述不出来的视觉任务重叠矩形的空间关系、像素图的全局布局它就明显吃力了。3 个大矩形能数成 4 个马里奥的脸能画成一坨黑的。这种感觉让我想到一个很合适的比喻。就像一个盲人旁边坐着一个视力正常的人给他描述画面。能说清楚的东西盲人也能理解说不清楚的东西盲人就只能猜。从实测结果上看DS 的视觉更像是看图说话的效果。图片进来后能概括的信息这是什么、什么颜色留下了而空间细节朝向、位置、像素级布局大量丢失剩下的只能靠语言推理去补。当然它内部到底是怎么实现的目前官方没有公布架构是不是先转文本再推理大家可以分析看看。另外还有一个官方细节我觉得特别值得琢磨。图片按尺寸折算 token 计费单张图片最多只占 384 tokens。一张 Game Boy 截图、一张像素马里奥信息被压进几百个 token 里颜色和类别这种好概括的东西容易留下椭圆朝向、像素坐标这种说不清的东西最先被挤掉。这个工程上的信息瓶颈和我实验里看到的现象严丝合缝。如果这个方向成立那它和我们期待的AI 的眼睛中间还隔着一层压缩。当然这只是我个人实测的感受不代表技术上的严谨结论。但作为一个每天跟模型打交道的人我觉得这个发现挺值得拿出来聊聊的。毕竟“看见和听见别人描述”是两件完全不同的事。话说回来干活还是能干的当然了前面说的都是视觉理解层面的问题。换个角度如果再配合上 prompt 引导、一步步喂清楚需求DS 还是能把活干出来的。后面我又花时间一轮一轮地调 prompt包括屏幕文字、按钮质感、阴影位置一点点抠最终把那个 Game Boy 调到了一个还不错、可用的状态。连之前溢出的菜单文字都修好了SELECT GAME显示得整整齐齐。整个游戏机实现了三个游戏贪吃蛇、打砖块、俄罗斯方块。写在最后总体体验下来DS 的多模态模型没有它的纯文本模型那么惊艳。就像我前面反复说的从行为上看它的多模态不像是真的看见了图片更像是有人帮它把图片描述成了文字它再基于文字干活。这个差距在处理说不清楚的视觉任务时暴露得最明显。想想那 19 分钟和那并不存在的第 4 个大矩形。但不管怎么说这是 DS 迈向多模态的第一步。大家之前一直吐槽鲸鱼是瞎的这下总算睁开眼睛了。虽然睁得不算大就是了。本文所有实验截图与代码均来自作者实测结论偏个人体感仅供参考。
返回列表