SwiftUI (@MoeCaa)测试下几个便宜模型的极限识题+解题能力 中发帖

如图,拍了一个答辩画质但是真人肯定能认出来是啥的图 
[image]
以Gemini 3.8flash跑五次的答案为基准
得分分别如下
[image]
其中名字后面的是渠道(带O的是Opencode G是bigmodel D是deepseek官方 N是我自己反代的各种套餐比如antigravity和opencode还有commandcode)
模型分别是Gemini 3.8 flash/Qwen 3.8 flash next/GPT6 Astra/GPT5.6 Luna/GLM5.3 Flash/Deepseek v4.1/Muse Spark1.3
这么看qwen的视觉在文本识别方面还真的很nb 然后Gemini对于模糊文本的提取准确度还是很强