stone91 在 真的受不了现在的榜单风气了,有共鸣的佬嘛 中发帖
自从25年Agentic coding开始推行,模型在后训练的路上越走越远了,开始逐渐变得不说人话。
大概在26年初,opus 4.7之后,这件事情开始变得无法忍受了。
现在榜单,统一都是Agentic能力,Knowledge能力,拿最近经常参考的artificial analysis网站的intelligence index来举例子:
GDPval-AA v2(智能体, 真实业务与网页实操), 𝜏³-Banking(智能体, 银行交互与工具调用), Terminal-Bench v2.1(编程, 终端实操与系统运维),
SciCode(编程, 理科科学计算), Humanity's Last Exam(科学推理, 跨学科专家级学术), GPQA Diamond(科学推理, 博士级科学问答),
CritPt(科学推理, 前沿物理研究推导), AA-Omniscience(通用...