OpenAI史上最快模型“短命”内幕:为速度牺牲智能,仅7个月黯然退场
每秒生成 1200 个 Token,OpenAI 史上速度最快的 AI 模型,仅仅存活了 7 个月就迎来了生命的终点。
近日,OpenAI Codex 负责人 Tibo 宣布,GPT-5.3-Codex-Spark 将于下周正式退役。谈及关停原因,Tibo 显得十分直白:不仅使用量持续下滑,而且团队手里已经有了明显更强大的替代品,是时候给未来让路了。他甚至还忍不住吐槽了一句:“真不敢相信,我们居然发布过名字这么长的模型!”
曾经的“未来之星”:摆脱英伟达依赖的破局者
把时钟拨回今年 2 月 12 日,Spark 刚上线时可谓风光无两。作为 OpenAI 首个专为实时编程打造的模型,它支持 128k 上下文,每秒 Token 生成量突破 1000 大关。官方数据显示,它将往返开销降低了 80%,首 Token 延迟直接砍半。
更具里程碑意义的是,Spark 是 OpenAI 第一个跑在英伟达技术栈之外的生产级模型。它的底层算力来自 Cerebras 的晶圆级芯片 WSE-3,这也标志着那笔总价值超 200 亿美元、高达 750 兆瓦的算力大单交出了第一份答卷。
成也提速,败也“降智”
然而,流量的狂欢退潮比想象中快得多。Spark 的致命伤在于,受限于单块晶圆的容量,它无法装载完整的旗舰模型,本质上是一个为了极致速度而妥协的“蒸馏版小模型”。
数据不会撒谎。在 Terminal-Bench 2.0 评测中,Spark 的准确率仅为 58.4%,远低于完整版 GPT-5.3-Codex 的 77.3%;在 SWE-Bench Pro 测试中,Spark 虽然能把任务压缩到 1 至 2 分钟内完成,但准确率卡在 47% 至 51% 之间,而完整版虽然耗时从 3 分钟拉长到 16 分钟,准确率却能从 51% 提升至 57%。
此外,宣传中号称的“15 倍提速”也被现实戳破——在同等准确率下,它其实只快了 1.37 倍。开发者的抱怨接踵而至:捏造 API 端点、JSON 格式混乱。正如培训机构 Turing College 的评价一针见血:“没有智能的速度,只是更快地失败。”
真正的“催命符”:旗舰模型跑出极限速度
给 Spark 宣判死刑的,是 8 月 13 日 Cerebras 推出的 Ultrafast 模式。这一次,跑在晶圆上的不再是缩水版,而是旗舰模型 GPT-5.6 Sol 本尊。
通过将旗舰模型按层切分,并铺设在多台 CS-3 节点上形成流水线,Ultrafast 在“智能不缩水”的前提下,飙出了每秒 750 个 Token 的惊人速度。同一个任务,标准档平均需要 7.7 分钟,而 Ultrafast 仅需 83 秒,端到端速度提升了 5.6 倍。正如 Cerebras CEO Andrew Feldman 所言:“速度与智能,不再互斥。”
时代的更迭:速度从“专属模型”变成“付费档位”
事实上,Spark 只是 OpenAI 近期清理历史包袱的冰山一角。过去三个月里,OpenAI 的模型库经历了剧烈换血:6 月 2 日 GPT-5.2 与 GPT-5.3-Codex 退役;8 月 31 日 GPT-5.4 与 5.4 Mini 退场,用户整体迁移至 5.6 世代;最终在 9 月 11 日,轮到了 GPT-5.3-Codex-Spark。伴随旧世代的离去,Codex 迎来了 Sol、Terra、Luna、Astra 的全新命名纪元。
在这背后,隐藏着 AI 行业底层逻辑的更迭:“快”正在从一个独立的专用模型,演变为旗舰模型的一项标配档位。就像推理强度可以分为 Light 到 Max 一样,速度也衍生出了 Standard、Priority 到 Ultrafast 的不同档位,按档付费的商业模式已经跑通。
回过头来看,Spark 作为过渡期的探路者,成功证明了 Cerebras 晶圆足以扛住生产级流量,AI 推理任务完全可以脱离英伟达生态运行。当探路结束、大部队入驻,探路者的使命便自然终结。下一轮的竞赛,比拼的不再是谁能做出最快的阉割版模型,而是谁能把最强的旗舰模型跑出最极限的速度。