橘子岛岛主 (@gloomyKevin) 在 我宣布,互联网内容已经是个巨大的人体蜈蚣 中发帖
正题,主要想吐槽的是现在 AI 大模型越进化越不说人话的问题,各种黑话,生僻字夹杂,奇怪的断句和比喻,感觉是离正常人越来越远了。
互联网上大量充斥 AI 自己拉的屎,又反复被拿去训练,已经形成💩闭环,变成了人体蜈蚣。
查了下这个叫做“模型坍缩”
第一代:在人类真实互联网数据训练
第二代:拿第一代 AI 生成的文本去训练新模型 → 开始丢失信息多样性
第三代:再用第二代 AI 产出物训练 → 坍缩加剧,输出越来越单调、套路化、抽象、空话多
当大模型用另一台 AI 生成的数据当作训练数据,反复迭代训练,几代之后,模型会慢慢丢失真实世界原始数据里的数据,多样性、细节;输出越来越趋同、刻板、空洞、失真、想象力下降,甚至产生事实错误。
都有点忘记了最初 gpt3.5 的时候语气清澈,清晰易懂的样子了
我们还能回到,大模型可以像真人一样写作,写出清新质朴的语言的样子吗,如果只会愈...