尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

DeepSeek 不能识图?装个开源 Skill,纯文本模型也能“睁眼“了

DeepSeek 不能识图?装个开源 Skill,纯文本模型也能“睁眼“了 大家好我是晓凡。一、DeepSeek 便宜好用偏偏“看不见”用DeepSeek的人是越来越多了。理由也简单便宜还越来越强。V4-Flash正式版一出来性能又往上蹿了一截就在前几天 V4-Pro 正式版也发布了。有平台披露DeepSeekToken 消耗已经冲到 8 万亿说明大家是真金白银在用不是嘴上说说。不过用久了的人多半都撞上过同一个坎它看不了图。你发张截图过去它是懵的直接告诉你“我无法处理图片”。这对聊天来说没多大影响但一到正经干活的时候就有点难受了。举个最常见的例子。代码报错了你想让它帮你看看截图发过去它读不了。你只能把报错信息一个字一个字复制粘贴成文字还得描述清楚是哪个文件、哪一行。碰到那种排版乱糟糟的报错堆栈复制粘贴能把自己绕晕。再比如做前端设计稿摆在眼前你想让它照着写界面。它看不见图你只能靠嘴描述左边一个按钮右边一个输入框颜色是蓝的……费半天劲描述出来还感觉跟自己脑子里想的不一样。这些场景说到底就是它没有“眼睛”不是多模态模型。其实不止DeepSeek很多主打文本的大模型都有这个短板。只是DeepSeek用的人多、价格又便宜大家特别愿意拿它来干活这个缺陷就被放大了。好在这块短板现在有现成的办法能补上成本低到可以忽略下面细说。二、一个开源 Skill 把事解决了这个能力不用等官方更新开源社区早有人把方案做好了名字叫claude-vision-skill。别被“Claude”这名字劝退了。它虽然是给 Claude 做的但能装到任何 Agent 上装好之后 Agent 会自己去适配。这 Skill 目前 star 也到了1.9k。GitHub 地址https://github.com/asuojun/claude-vision-skill它背后的原理挺简单先把图片发给一个会识图的模型让这个模型用文字把图里的内容描述出来再把这段文字喂回给 DeepSeek。DeepSeek 拿到的是文字自然就“看懂”了。说白了就是请一个看得见的模型当翻译把图片翻成文字再转述给 DeepSeek。它自己不用会看图只需要会读翻译结果就行。所以你得额外配一个会识图的模型。仓库默认推荐阿里千问的qwen3.5-omni-plus和qwen-vl-max。为什么是千问因为便宜。阿里云百炼给新用户送 100 万 Token 的免费额度折算下来识一次图大概两分钱跟不要钱差不多。当然你手上要是有别的支持 OpenAI 兼容接口的识图模型一样能用不挑。这个 Skill 干的其实就是个搬运的活儿中间的识图模型换成谁都可以。三、 安装直接把下面内容丢给 Codex剩下的它自己搞定不用你手动敲命令、改配置。按 https://github.com/asuojun/claude-vision-skill 的 README 帮我配置识图整个过程它自己会去拉代码、写配置你盯着看就行。装完之后还剩最后一步配识图模型的 API Key。默认走阿里千问需要到千问AI平台 https://platform.qianwenai.com/home/api-keys 去创建一个API Key。新用户那 100 万免费额度大概能识图 7000 次。就算你天天用也够顶好几个月。等免费额度用完了继续充也不贵一次两分钱日常用基本不心疼。有两个小地方值得留意。第一第一次用它识图时Agent 可能会弹一下让你确认要调用外部模型点个同意就行。第二API Key 别随便往外发千问是按量计费的虽然便宜但被有心人拿去刷就亏了。四、装上之后效果如何装完直接就能用不用重启不用再折腾一遍。我随手拿一张图试了试让它读图里的内容。结果它对得挺好文字、结构基本都识别出来了。我又把一张Ruoyi项目启动报错的截图丢给它。这么一搞DeepSeek 就算睁眼了。以后写代码碰到报错直接截图发过去界面长什么样一张图说明白。我现在基本把它当默认配置用了。改前端的时候截图丢过去它能把布局、配色、间距说得八九不离十照着写省不少来回。看文档截图、读报错、甚至翻译图片里的英文都能顺手干。原来需要我把文字复制进去现在一张图就搞定了。至于识图模型本身的准确度Qwen这套在中文场景下表现挺稳日常截图、文档、界面基本够用。真要碰到特别复杂的图偶尔也会翻车不过那属于个别情况不影响大局。总结给 DeepSeek 补上识图能力成本几乎可以忽略效果却立竿见影。原理不复杂就是借一个会看的模型把图片变成文字再转给它。装起来也就一句话的事前后几分钟。有需要的小伙伴值得一试。
返回列表