linjinpeng 在 实测Openai内部有碾压fable和gpt-5.6-sol的模型 中发帖
在arena中测试题目:gpt-5令人失望
此题目虽然fable和gpt-5.6-sol等旗舰模型可以完全正确解出,但是需要消耗大量的时间进行内部推理
而实测一个未知的匿名模型在无需任何推理的情况下,仅简答调用三次python脚本作为辅助,即可在1分钟内解出此题,此模型经过识别为Openai提供
[image]