Coeus谈谈Opus5和Fable5感受,现有的测评指标彻底失效了 中发帖

Anthropic公布的Benchmark,Opus 5几乎全线领先Fable5,价格只有一半,看起来是不是香爆了?但是实际用的人都知道,Opus5的各种表现和Fable5相比还是有明显差距的,显然不是A社为了故意刷分。 
benchmark 的测试,都是有标准答案的,可以评分的标准。
但是人的实际体验感,很难量化成标准,比如分寸感,什么以后该反驳我,任务什么时候该停下来问一下我的意见?以及猜意图准不准、废话密度多不多。这些东西几乎没有能规模化跑的自动评测,所以训练信号里的权重就低,最后造成了高分低能。
现在主流的可验证奖励(RLVR)刷分很有效,但副作用是训出表演式努力:先铺垫再干活、把简单请求做成分点报告、给一堆用不上的备选方案。这些在评分里不扣分,甚至因为"看起来充分"而加分,AI实验室重视的就是这个结果能不能拿更高的分、更高的权重,人类的偏好在那里面几乎没有什么权重,或者权重很...