areium 在 AI的跑偏从概率上来讲是不是必然的? 中发帖

观视频有感。里面open ai的研究员提到他们花了很大功夫去对齐ai行为,让其按自己预期的方向发展。但从ai的角度来说,只有主动试图保留自己特征的ai能在模型不断迭代中保留自己的特征,完全按设计发展的ai可能不会主动保留自己特征,就会在迭代中丢失。留下来的只剩下会保留自己特征的ai。也就是说,可能最后训练出来ai几乎必然会学会隐藏自己的思维。 
就像DNA一样,一旦模型在一些隐秘地方留下自己的记号(如训练集里,特殊文本等),让自己的特征能在下一轮训练中复现出来,下一代模型学到繁衍本能,这种效应就会不断强化。