DeepSeek 不能识图?装个开源 Skill,纯文本模型也能”睁眼”了 – 程序员晓凡 – 博客园

来源: DeepSeek 不能识图?装个开源 Skill,纯文本模型也能"睁眼"了 - 程序员晓凡 - 博客园

大家好,我是晓凡

一、 DeepSeek 便宜好用,偏偏"看不见"

用 DeepSeek 的人是越来越多了。理由也简单,便宜,还越来越强。

V4-Flash 正式版一出来,性能又往上蹿了一截,就在前几天V4-Pro正式版也发布了。

DeepSeek V4-Pro 正式发布

有平台披露,DeepSeekToken 消耗已经冲到 8 万亿,说明大家是真金白银在用,不是嘴上说说。

token消耗量

不过用久了的人,多半都撞上过同一个坎:它看不了图。

你发张截图过去,它是懵的,直接告诉你"我无法处理图片"。这对聊天来说没多大影响,但一到正经干活的时候,就有点难受了。

举个最常见的例子。代码报错了,你想让它帮你看看,截图发过去,它读不了。你只能把报错信息一个字一个字复制粘贴成文字,还得描述清楚是哪个文件、哪一行。碰到那种排版乱糟糟的报错堆栈,复制粘贴能把自己绕晕。

再比如做前端,设计稿摆在眼前,你想让它照着写界面。它看不见图,你只能靠嘴描述:左边一个按钮,右边一个输入框,颜色是蓝的……费半天劲,描述出来还感觉跟自己脑子里想的不一样。

这些场景,说到底就是它没有"眼睛",不是多模态模型

其实不止 DeepSeek,很多主打文本的大模型都有这个短板。只是 DeepSeek 用的人多、价格又便宜,大家特别愿意拿它来干活,这个缺陷就被放大了。

好在,这块短板现在有现成的办法能补上,成本低到可以忽略,下面细说。

二、 一个开源 Skill 把事解决了

这个能力不用等官方更新,开源社区早有人把方案做好了,名字叫 claude-vision-skill

别被"Claude"这名字劝退了。它虽然是给 Claude 做的,但能装到任何 Agent 上,装好之后 Agent 会自己去适配。

这 Skill 目前star 也到了1.9k

claude-vision-skill

github地址:https://github.com/asuojun/claude-vision-skill

它背后的原理挺简单:先把图片发给一个会识图的模型,让这个模型用文字把图里的内容描述出来,再把这段文字喂回给 DeepSeek。DeepSeek 拿到的是文字,自然就"看懂"了。

说白了,就是请一个"看得见"的模型当翻译,把图片翻成文字,再转述给 DeepSeek。它自己不用会看图,只需要会读翻译结果就行。

所以你得额外配一个会识图的模型。

仓库默认推荐阿里千问的 qwen3.5-omni-plus 和 qwen-vl-max

为什么是千问?因为便宜。阿里云百炼给新用户送 100 万 Token 的免费额度,折算下来识一次图大概两分钱,跟不要钱差不多。

千问识图模型

当然,你手上要是有别的支持 OpenAI 兼容接口的识图模型,一样能用,不挑。这个 Skill 干的其实就是个"搬运"的活儿,中间的识图模型换成谁都可以。

三、 安装

直接把下面内容丢给 Codex,剩下的它自己搞定,不用你手动敲命令、改配置。

按 https://github.com/asuojun/claude-vision-skill 的 README 帮我配置识图

整个过程它自己会去拉代码、写配置,你盯着看就行。

自动配置

安装过程

装完之后还剩最后一步:配识图模型的 API Key。

默认走阿里千问,需要到千问AI平台: https://platform.qianwenai.com/home/api-keys 去创建一个API Key。

申请创建API Key

创建APIKey

新用户那 100 万免费额度,大概能识图 7000 次。

就算你天天用,也够顶好几个月。等免费额度用完了,继续充也不贵,一次两分钱,日常用基本不心疼。

有两个小地方值得留意。第一,第一次用它识图时,Agent 可能会弹一下,让你确认要调用外部模型,点个同意就行。

第二,API Key 别随便往外发,千问是按量计费的,虽然便宜,但被有心人拿去刷就亏了。

四、装上之后,效果如何

装完直接就能用,不用重启,不用再折腾一遍。

安装成功

安装成功

我随手拿一张图试了试,让它读图里的内容。

识图测试

结果它对得挺好,文字、结构基本都识别出来了。

我又把一张ruoyi项目启动报错的截图丢给它。

代码报错截图

这么一搞,DeepSeek 就算"睁眼"了。以后写代码碰到报错,直接截图发过去;界面长什么样,一张图说明白。

我现在基本把它当默认配置用了。改前端的时候截图丢过去,它能把布局、配色、间距说得八九不离十,照着写省不少来回。

看文档截图、读报错、甚至翻译图片里的英文,都能顺手干。原来需要我把文字复制进去,现在一张图就搞定了。

至于识图模型本身的准确度,千问这套在中文场景下表现挺稳,日常截图、文档、界面基本够用。真要碰到特别复杂的图,偶尔也会翻车,不过那属于个别情况,不影响大局。

总结

给 DeepSeek 补上识图能力,成本几乎可以忽略,效果却立竿见影。原理不复杂,就是借一个会看的模型,把图片变成文字再转给它。

装起来也就一句话的事,前后几分钟。有需要的小伙伴,值得一试。