欣 郁 (@user1164)关于国产LLM的差距 中发帖

感觉还是要正视国产llm和国外的差距。 
[image]
客观事实:
1)deepseek v4 flash ga在8项agent相关评分都超过glm5.2;
2)deepseek v4 flash ga在agent评分上和gpt 5.6 luna互有胜负,整体小负;
3)deepseek v4 flash ga在agent评分上,全面落后opus-4.8;
结合主观感受(网上评测、个人体验),如下鄙视链基本是合理的:opus-4.8 > gpt 5.6 luna >= deepseek v4 flash=glm5.2。
好,那么让我们清理一下记忆,回到07-31之前:当时deepseek v4 flash ga尚未发布,国模声势最大的就是glm5.2和kimi-k3.
我截取了2026.6.1至2026.7.31之间的搜索结果(尤其是第一个链接,小蓝书问题下的回答)
[...