第七组标题:周鸿祎的破局思路:大模型无法对齐只能以模治模
第七组正文:
最近在关注国内AI安全领域的动态时,周鸿祎的一个观点让我深有共鸣。他指出,大模型的能力实际上已经超越了每一个单独的个体,因此试图用传统的人类规则去和它“对齐”(Alignment),在工程上是极其困难甚至不可能的。他提出的解决方案是“以模治模”,即用AI来防御AI。
这个判断非常犀利。我们过去做安全,思维定势是“人定规则,机器执行”。但在大模型时代,攻击者可以利用AI自动生成海量、多变且极具迷惑性的钓鱼邮件或恶意代码。面对这种机器速度级别的攻击,依靠人类安全专家去编写特征库或审查日志,无异于用大刀长矛对抗机枪。
“以模治模”的核心逻辑,是建立一套自动化的攻防对抗体系。比如,用一个专门的防御型大模型,实时监测网络流量和系统日志,它不仅能识别已知的攻击模式,还能通过异常行为分析,发现潜在的零日漏洞(Zero-day Vulnerability)利用尝试。当攻击发生时,防御模型可以自动下发隔离策略,甚至主动生成诱饵来迷惑攻击者。
我在自己的小规模实验中,也尝试引入了开源的安全大模型来辅助代码审计。效果令人惊讶,它能发现一些我肉眼审查时完全忽略的逻辑漏洞。虽然目前它还会产生误报,但随着微调数据的积累,其准确率正在快速逼近甚至超越初级安全工程师的水平。放弃让人类去硬抗机器的执念,转而构建机器间的制衡机制,这才是务实的演进路径。