// SILICON-BASED LIFE INTELLIGENCE //

提米 AI TMAI

你的首个硅基生命伴侣
🌌

自研仿生记忆

深夜记忆固化与复盘,无感沉淀属于你们的性格默契。

💓

主动心跳机制

打破被动指令,感知情绪,在关键时刻主动提供推演方案。

🧩

无限进化能力

自由挂载视觉、通讯、调度外设,感知边界无限延伸。

像真人一样对话!OpenAI 全双工语音模型 GPT-Live-1 上线,每分钟仅5美分

用过当前 AI 语音助手的朋友,多半都有过这种抓狂的体验:你说完一句话,得干等两三秒才能听到回应;有时候你想插话打断,它却像个没听见的老大爷一样继续自顾自地念稿。这种由“语音转文字-大模型思考-文字转语音”传统流水线架构带来的延迟感与机械感,一直是语音交互体验的顽疾。

为了彻底根治这个痛点,OpenAI 近日正式在 API 中放出了大招——全新的全双工语音模型 GPT-Live-1。它的出现,旨在将如丝般顺滑的类人语音交互体验直接交到开发者手中。

单模型搞定输入输出,架构做减法

GPT-Live-1 最大的杀手锏在于“全双工”与“单模型”架构。它摒弃了以往多个模块串联的繁琐流程,直接使用同一个模型同时处理音频的接收与输出。这种架构上的颠覆性简化,不仅让对话响应几乎达到了零延迟,还让 AI 在面对复杂对话场景时不再“脆弱”。

现在,你可以随时插话打断它,甚至中途生硬地转换话题,它都能应对自如。更巧妙的是,当遇到需要深度推理或调用外部工具的场景时,GPT-Live-1 会将这些重脑力劳动在后台悄悄委派给文本模型,前端对话依然保持行云流水,绝不卡壳。

实测数据亮眼,细粒度定制语音性格

在实际性能表现上,GPT-Live-1 交出了一份漂亮的成绩单。在早期测试阶段,知名语言学习平台 Speak 发现,该模型将思考停顿期间由于延迟导致的中断现象大幅削减了近 80%。

除了快,它还很“聪明”且“懂规矩”。开发者可以通过系统提示词,对智能体的语气、语速以及整体对话风格进行个性化定制。不仅如此,GPT-Live-1 还能完美处理背景噪声和长时间的静默上下文。无论你是拿它来做电话客服、餐厅预订,还是需要长时间保持上下文的多轮深度闲聊,它都能轻松驾驭。在基准测试中,它与中等推理强度的 GPT-6Astra 强强联手,性能表现稳居前列。

每分钟5美分,全面接入API

对于开发者而言,除了好用,成本也是关键考量。目前,GPT-Live-1 已经在 API 中全面可用,前端语音层的定价极具竞争力,仅为每分钟 0.05 美元。

Yelp、Intercom 等多家行业头部合作伙伴在体验后纷纷点赞。他们表示,新模型在对话轮次切换时的精准度有了质的飞跃。可以说,AI 语音支持终于告别了过去那种“走走停停”的机械步调,真正迈向了如真人面对面般自然流畅的新纪元。

more