神奇的哆啦z梦 (@anghunk)我用一个 skill 把视觉活外包了(模型看不了图) - 子舒的博客 中发帖

主力模型不支持多模态?不换模型也能识图——我把图片外包给了多模态 API,一个 skill 搞定。 

我目前使用的 AI 工具是 Zcode,然后搭配 Opencode Go 套餐里面的 deepseek-v4-flash 模型。性价比很高,速度和模型能力都非常棒,所以被我当成主力模型。
但是它存在一个巨大的问题就是不支持多模态,官网目前好像是支持视觉识别了,但是我是调用了 api 在第三方客户端。而我恰好非常需要这个场景,所以我就想了一个办法,如果能在不更改当前会话模型的情况下,进行图片识别,那就很完美。
首先我想到了利用 skills,调用多模态模型工具去识别图片,把识别到的结果返回给当前会话模型。
这个思路听着简单,但一开始我也有点拿不准:skill 这东西,说白了就是给模型的一份 Markdown 说明书,它本身不会"跑在别的模型上"。真正干活的是当前模型—...