Martin D (@JoyIke) 在 分享一次 Codex 评审各个 Agent+LLM 模型在美股量化投资策略报告上的结果 中发帖
首先叠个甲,我没用于实际投资决策,只是 Codex 对各个 Agent+LLM 组合基于我已经订阅的美股数据和财报数据给出的决策进行的评分。只是一次有趣的测试,没有贬低任何模型的意思。
用统一 Prompt和同样的输入数据,执行多轮工具调用和报告编写的评分结果:
排名
组合
分数
耗时(分钟)
1
Cursor + Opus 5 Thinking High
97.262
90:15
2
grok-build + Grok-4.6 High
93.000
38:40
3
Cursor + Grok-4.6 xhigh-fast
92.546
10:24
4
Cursor + Composer 2.5
91.484
6:51
5
Codex + GPT-5.6-SOL High
87.197
25:09
Opus能跑这么多轮耗时这么久没想到,能拿第一...