温州程序员劝退师 (@Das)模型能力验证彻底陷入死循环 中发帖

最近我正好有刷榜的任务,也正好有做题库的任务,突然觉得整件事有点扯 
怎么证明一个榜有权威性?业界通常是找一些专家来构建题目(虽然干活的都是科研牛马)那么如果他不公开题目,我们怎么确定他是否是好题?有些佬友可能会说看跑分。但跑分其实只能证明这些题有区分度,但不一定是贴合使用场景的题
那么题目如果公开呢?很快就会成为厂商特需花训练的养料,有效性立即进入倒计时
想想都头疼