ylxmf (@ylxmf2005) 在 pi agent 能在一半的成本下,达到比codex/cc更好的效果?而 codex 是 5.6表现最差的 harness? 中发帖
之前看到 Benchmarking Coding Agents on Databricks’ Multi-Million Line Codebase
如图,有趣的是,opus 换成 Pi,单任务成本可以相差两倍以上,而任务通过率大体仍处于同一水平。gpt 5.5 的话价格是1.5倍。
[image]
而且我们有理由怀疑,换成 sol 和 fable,这个差距可能会拉大。正好刷到了另一个X的帖子 https://x.com/mattlam_/status/2079605387121049605:
以5.6为例子
[image]
[image]
测试集是 Databricks 自己的百万行生产代码库中提取真实任务,大部分是来自已经合并的工程师 PR,全面覆盖了不同语言和不同类型任务(前后端)
[image]
[image]