laokke (@laik) 在 现在模型都是one shot 测试. 感觉和实际工作场景越来越远了 中发帖
实际上大家工作的挑战在于怎么在一坨💩山上持续迭代,甚至无缝迁移升级。
现在的 coding agent 就缺一种这类在💩上雕花的benchmark
我估计现在市面上的模型的分估计都不高🤣
实际上大家工作的挑战在于怎么在一坨💩山上持续迭代,甚至无缝迁移升级。
现在的 coding agent 就缺一种这类在💩上雕花的benchmark
我估计现在市面上的模型的分估计都不高🤣