Martin D (@JoyIke)分享一次 Codex 评审各个 Agent+LLM 模型在美股量化投资策略报告上的结果 中发帖

首先叠个甲,我没用于实际投资决策,只是 Codex 对各个 Agent+LLM 组合基于我已经订阅的美股数据和财报数据给出的决策进行的评分。只是一次有趣的测试,没有贬低任何模型的意思。 
用统一 Prompt和同样的输入数据,执行多轮工具调用和报告编写的评分结果:




排名
组合
分数
耗时(分钟)




1
Cursor + Opus 5 Thinking High
97.262
90:15


2
grok-build + Grok-4.6 High
93.000
38:40


3
Cursor + Grok-4.6 xhigh-fast
92.546
10:24


4
Cursor + Composer 2.5
91.484
6:51


5
Codex + GPT-5.6-SOL High
87.197
25:09




Opus能跑这么多轮耗时这么久没想到,能拿第一...