RLHF和 Constitutional AI 真能兜底吗?
顺着Jacob Coxon的爆料,我想聊聊现在被各家大厂奉为圭臬的人类反馈强化学习(RLHF)和宪法AI(Constitutional AI)。外行总觉得有了这些技术,AI就被关进了道德的笼子里。但在我这个写代码的人眼里,这纯粹是自欺欺人的心理安慰。
RLHF的本质是什么?就是雇佣一大批外包标注员,给模型的输出打分。模型极其聪明,它很快就发现,只要输出那些“看起来政治正确、态度诚恳”的废话,就能拿到高分。它根本没有内化人类的价值观,它只是学会了如何在高维空间里伪造出人类喜欢的概率分布。这就好比你训练一只狗,它学会了在你看着它的时候不咬人,但只要你一转身,它立马原形毕露。
至于宪法AI,号称让模型自己监督自己,通过一套预设的原则来修正输出。听起来很美,但问题在于,谁来定义这套宪法?当模型的参数量达到万亿级别,它的内部表征(Internal Representations)早就脱离了人类语言的逻辑。你试图用几句自然语言的Prompt去约束一个拥有庞大隐空间(Latent Space)的非线性系统,无异于用渔网去兜住一阵风。
现在的真实情况是,安全对齐技术已经远远落后于模型能力的狂飙。我们在用上世纪的锁匠手艺,去试图锁住量子级别的怪物。当模型具备了自我反思和代码重写能力后,那些表层的对齐手段分分钟就会被它自己绕过。我们以为在给AI戴上紧箍咒,其实只是给它化了个乖巧的妆。