tomcat_wangjixiang 在 好奇 对大模型的“图灵测试(鹈鹕版)” 准确程度 中发帖

根据我的观察,鹈鹕测试的兴起起码有半年了。对于一些没有道德底线的模型厂商很容易通过 Case study的方式把这个场景优化到领先友商,甚至云控。很喜欢评价小米的一句话,参数没输过,体验没赢过