@ERROZER 在 鹈鹕、LLM与benchmark 中发帖
从不知道什么时间开始,鹈鹕蹬自行车就成了L站新模型必测的一环,如同纽北之于赛车,安兔兔原神农活之于手机,不管什么新发的模型,都得过了鹈鹕这一关。我必须得说一下叠个甲,每个让模型画鹈鹕自行车的人心态是不一样的,有些人是想用这样一个固定任务去测试不同模型之间在某一个固定能力维度的差异他知道自己在干什么;有些人是想看看前端能力如何,也没想证明下“模型智力到底是不是真的变高了”;最后一波也是我感觉大多数鹈鹕自行车的群体,看见别人测自己也测,画得好就“卧槽新王登基辣”,画得不好就“烂完了,狗屎一坨,某公司要完蛋”。鹈鹕自行车这个东西诞生其实不是完全没道理的,就是为了测试模型的写svg代码的能力,而不是直接性的图像生成,能考核“自行车和鹈鹕的几何结构”“’骑‘的空间关系和动作”。
一言蔽之,这个svg画得再好,也只能证明
这个model在根据文字直接生成svg这个非常具体的任务上到底执行是怎么样的...