像真人一样对话!OpenAI 全双工语音模型 GPT-Live-1 上线,每分钟仅5美分
用过当前 AI 语音助手的朋友,多半都有过这种抓狂的体验:你说完一句话,得干等两三秒才能听到回应;有时候你想插话打断,它却像个没听见的老大爷一样继续自顾自地念稿。这种由“语音转文字-大模型思考-文字转语音”传统流水线架构带来的延迟感与机械感,一直是语音交互体验的顽疾。
为了彻底根治这个痛点,OpenAI 近日正式在 API 中放出了大招——全新的全双工语音模型 GPT-Live-1。它的出现,旨在将如丝般顺滑的类人语音交互体验直接交到开发者手中。
单模型搞定输入输出,架构做减法
GPT-Live-1 最大的杀手锏在于“全双工”与“单模型”架构。它摒弃了以往多个模块串联的繁琐流程,直接使用同一个模型同时处理音频的接收与输出。这种架构上的颠覆性简化,不仅让对话响应几乎达到了零延迟,还让 AI 在面对复杂对话场景时不再“脆弱”。
现在,你可以随时插话打断它,甚至中途生硬地转换话题,它都能应对自如。更巧妙的是,当遇到需要深度推理或调用外部工具的场景时,GPT-Live-1 会将这些重脑力劳动在后台悄悄委派给文本模型,前端对话依然保持行云流水,绝不卡壳。
实测数据亮眼,细粒度定制语音性格
在实际性能表现上,GPT-Live-1 交出了一份漂亮的成绩单。在早期测试阶段,知名语言学习平台 Speak 发现,该模型将思考停顿期间由于延迟导致的中断现象大幅削减了近 80%。
除了快,它还很“聪明”且“懂规矩”。开发者可以通过系统提示词,对智能体的语气、语速以及整体对话风格进行个性化定制。不仅如此,GPT-Live-1 还能完美处理背景噪声和长时间的静默上下文。无论你是拿它来做电话客服、餐厅预订,还是需要长时间保持上下文的多轮深度闲聊,它都能轻松驾驭。在基准测试中,它与中等推理强度的 GPT-6Astra 强强联手,性能表现稳居前列。
每分钟5美分,全面接入API
对于开发者而言,除了好用,成本也是关键考量。目前,GPT-Live-1 已经在 API 中全面可用,前端语音层的定价极具竞争力,仅为每分钟 0.05 美元。
Yelp、Intercom 等多家行业头部合作伙伴在体验后纷纷点赞。他们表示,新模型在对话轮次切换时的精准度有了质的飞跃。可以说,AI 语音支持终于告别了过去那种“走走停停”的机械步调,真正迈向了如真人面对面般自然流畅的新纪元。