DeepSeek Harness8 月 13 日刚公测开源,仅仅七天就迎来重要更新,一共做了 14 处优化,新增的识图功能,让国内外开发者都很兴奋。
它的看图方式很有意思,不全靠 AI 模型本身。如果用的是只能读文字的模型,碰到图片不会直接罢工。框架会先用 OCR 提取文字,再分析颜色、像素,把图片拆成一堆文字数据,再交给 AI 去解读。
PPT 截图、软件界面,它基本能看懂内容;但真实照片、复杂场景,识别效果就比较有限,和天生会看图的 AI 还有差距。
除此之外,现在可以图片文字一起发,常用指令也能附带图片,还能直接导入本地文件。Claude Code、Codex 也加入子代理,Windows 终端体验变好,之前大图报错、会话丢失、网关兼容等一堆 bug 也修好了。
在我看来,这次更新最大亮点,就是不靠升级大模型,用工具帮普通文本 AI 间接看懂图片,给开源 AI 代理提供了不一样的思路。


