OpenAI 推出 GPT-Live 语音模型:支持全双工即时交互,后台自动分配复杂任务
OpenAI 正式发布了新一代语音模型 GPT-Live,该模型采用创新的全双工(Full-Duplex)架构,彻底改变了以往人机语音交互的体验。以往的模型如原版 ChatGPT 采用“声码转换-LLM 推理-文本合成”的三层级联架构,或是像 Advanced Voice Mode 这样基于静音检测的单模型轮流交谈,均容易导致延迟和不自然的打断。而 GPT-Live 可以边听边说,支持实时打断、语气助词确认以及更自然的对话节奏,每秒做出多次交互决策。
GPT-Live 的另一大技术突破在于将语音交互层与后端深度推理层进行了分离。当用户提出需要计算、联网搜索或复杂逻辑处理的问题时,GPT-Live 会在后台将任务委派给 GPT-5.5 等前沿模型,同时维持前端与用户的口头交流而不中断。目前 GPT-Live 1 和 GPT-Live 1 mini 已向全球 ChatGPT 用户推送,并即将登陆 API 供开发者使用。












