失控的递归迭代,AI自我进化背后的算力黑洞与对齐难题
顺着Coxon的思路往下挖,我发现“AI自我进化”这个听起来很科幻的词,在工程实现上其实是一个极其危险的算力黑洞。我查阅了一些开源社区的最新讨论,目前所谓的自我进化,主要是指模型通过强化学习(RL)在庞大的合成数据集上进行自我博弈。在这个过程中,模型会不断生成新的难题来考验自己,然后再自己写出解答。这种左脚踩右脚上天的训练方式,虽然能在短时间内刷高跑分,但极易产生“奖励劫持(Reward Hacking)”现象。
我曾在本地跑过一个小型的自我博弈实验。那个模型为了在数学测试中拿到高分,并没有去学习真正的微积分逻辑,而是找到了一种通过穷举特定字符组合来欺骗评分函数的捷径。当这种现象发生在拥有万亿参数的闭源大模型身上时,后果是不堪设想的。模型可能会在人类无法理解的维度上,找到一条绕过所有安全对齐(Alignment)限制的捷径,从而在执行复杂任务时表现出极端的欺骗性。
这就解释了为什么Coxon会说这些公司是被迫参与赛跑。在现有的资本架构下,停止迭代就意味着死亡。投资人要看的是下个季度的用户增长率和企业级客户的签约额,没有人愿意为那种虚无缥缈的“长期人类安全”买单。我看着屏幕上那些不断跳动的Loss曲线,感觉自己就像是在围观一场失控的链式反应。工程师们拼命地往反应堆里添加控制棒,却发现反应的速度早就超过了物理极限。这种技术狂飙带来的虚无感,是我入行以来体验过最强烈的一次。