Claude接管近三成研发?Anthropic首次晒出AI自动化“硬核”成绩单
深夜,一条核心数据管道突然宕机。工程师没有熬夜盯着终端逐行排查,只是随手将报错日志丢进对话框,敲下一句:“把它修好。”
几分钟后,Claude 自主完成了日志读取、根因定位、补丁编写、单元测试与异常拦截。不仅原始流水线恢复运转,还顺带输出了一份结构化的复盘说明。这早已不是实验室里的概念验证,而是 Anthropic 内部正在规模化运转的日常。
9月17日,这家以“安全对齐”闻名的 AI 公司罕见地摊开家底,首次用严谨的量化指标揭示了自家研发体系的真实水位。截至今年8月,Claude 已实质性主导了公司内部 26% 的 AI 研发工作。而回看今年2月,这一比例还是一个不到 1% 的空白区。更令人侧目的规模底座是:系统任意时刻稳定运行着约 3万个 独立 AI Agent,仅在8月份就累计产出了超过 10亿次 任务决策。这组数据清晰地表明,曾被反复讨论的递归自我改进(RSI)范式,正加速跨越理论阶段,全面嵌入工程实战。
从“打辅助”到“挑大梁”,AI 到底自主到了什么程度?
Anthropic 引入独立研究机构 Epoch AI 提出的六级自动化框架(AL0至AL5),为 AI 的参与深度划定了明确刻度:AL0 代表纯人工,AL3 处于人机协作,AL4 迈入 AI 主导,而 AL5 则是完全无需人类干预的终极形态。
目前,已有 26% 的研发进度稳定驻扎在 AL4 档位。在此层级,人类角色发生根本性转移——从“执行者”退居为“架构师与审计官”。工程师只需下达高层目标,Claude 即可闭环完成端到端开发,人类仅保留关键节点的监督、复核与最终拍板权。与此同时,超过 90% 的研发环节至少达到了 AL3 协作水平。Anthropic 也毫不避讳地划下红线:截至目前,受测范围内尚未有任何研发工作触及 AL5 的完全自治状态。人机边界与人类兜底,仍是当前体系的核心特征。
三万数字军团协同,安全护栏如何兜底?
支撑这套自动化流水线的,是一套高度内聚且权责清晰的 Agent 矩阵。约 3 万名数字员工拥有独立于底层模型的身份标识,依托共享消息总线进行任务委派、交叉纠错与状态同步。
在安全与算力调度上,数据同样扎实。8月份那超 10 亿的决策洪流中,在线实时监控系统精准拦截了约 0.002% 的潜在风险操作;离线审查机制每周扫描约 10 万条交互记录,经智能分类器过滤误报并初步研判后,仅有约 50 条高优异常会升级至人工深度复核。算力配置方面,仅去年7月统计周期内,约 12% 的 AI 驱动研发算力直接倾斜至安全研究领域。Anthropic 亦坦言,AL3 与 AL4 的界定存在一定主观弹性,未来跨实验室对比需依赖统一方法论与第三方独立验证。
RSI 狂飙之下,巨头们卡在哪个环节?
将视野拉宽,递归自我改进已成全球 AI 基础设施竞赛的暗线。国内智谱团队披露,GLM-5.3 驱动的基建 Agent 已两周内跑完国产加速器全量部署,“模型优化系统、系统服务模型”的正向循环初步成型,但距离全自动仍有很长的爬坡期;OpenAI 虽宣布达成“自动化 AI 实习生”里程碑并锁定 2028 年推出全自动研究员的目标,却也直言当前系统的最大软肋在于“决定做什么”——任务一旦拖过 4 小时,高频的人类介入便无法回避;谷歌 DeepMind 则从算法进化破局,其 AI 生成的电路方案已无缝集成至下一代 TPU,被前首席科学家杰夫·迪恩誉为“TPU 的大脑正在设计下一代身体”。
正如 DeepMind 首席战略官贾吉特·塞洪此前所点透的商业逻辑:尽管短期营收尚难完全覆盖当前的巨额资本开支,但押注 RSI 已成为不可逆的战略共识。在下注与观望之间,后者往往意味着错失代际窗口。
透明,是试金石更是竞争杠杆
Anthropic 此次选择在此刻亮出数据底牌,并非单纯的技术炫技。在人类对模型迭代节奏仍握有定义权的关键窗口期,主动公开更像是一场面向公众与监管的风险校准实验。同时,这也是在行业十字路口立下一面标尺:当研发自动化占比、Agent 集群规模、算力反哺比例及安全拦截覆盖率全部置于阳光之下,透明度本身便转化为无形的竞争压力。不跟进数据披露,极易被市场解读为技术储备薄弱或刻意隐藏盲区。
AI 研发的自动化齿轮已经咬合。未来两三年,谁能在保持安全底线的前提下,将“人定方向、AI 落地”的比例优化到极致,谁就能率先摘下下一代智能体时代的第一批果实。