@xx_yy1 在 面对当前gpt和claude的使用困局 中发帖
现在 GPT 和 Claude 基本成了O/和A/了,很多人想知道还有什么模型可以拯救一下当下工作
我这边只额外推荐一个:Grok 4.6
(限 Grok Bot / Grok Build 渠道)
为什么只推它:
思维链风格和 Claude 很接近,不是只会堆答案;
能力不弱,能扛住下面这种加强压测;
DeepSeek、Gemini 这类,按我实测就先别指望了。
一、自己测:加强版「糖果博弈」
附件:candy-game.zip (1.8 KB)
专门测:
• 内部推理够不够深;
• 长任务 agent 会不会假完成、局部最优;
• 最坏情况下能不能给出可执行保证策略;
• 解题是全局分流,还是「有解就停」。
怎么看结果(别只看对错):
答案准不准;
解题思路像什么模型;
耗时(参考:Astra、Claude 能在约 15 分钟内做完且答对)。
二、第三问特...