正式推出 GPT-Live
正式推出 GPT-Live
OpenAI 正式推出 GPT-Live。这是一代新的语音模型,目标是让人与 AI 的对话更接近真实交流。
OpenAI 表示,GPT-Live 构建于全双工架构之上,因此能够一边听、一边说。它既可以用简短回应确认自己在跟上用户,也能应对快速来回的对话,或者在用户思考时安静等待,从而带来更自然的语音体验。
OpenAI 还将 GPT-Live 称为他们迄今最聪明的语音模型。对于需要网页搜索、更深层推理或更复杂执行的任务,GPT-Live 可以把工作委托给后台运行的前沿模型处理,再在继续与用户交谈的同时,把结果带回当前对话。OpenAI 表示,GPT-Live 在发布时由 GPT-5.5 提供后台支持。
OpenAI 表示,这些能力如今已构成新版 ChatGPT Voice 体验的核心,并且未来有望支持更复杂、运行时间更长、也更 agent 化的语音 workflow。
OpenAI 表示,他们将在 2026 年 7 月 8 日面向全球 ChatGPT 用户推出两个版本:GPT-Live-1 和 GPT-Live-1 mini,之后还计划把它们带到 API。
开启人机交互的新阶段
OpenAI 用一个更宏大的目标来定义这款产品:让人和 AI 的协作,像与另一个人共事那样流畅、灵敏;而推理与复杂任务执行则在后台完成。
过去的路线
OpenAI 将 GPT-Live 与此前两类语音系统做了对比。
级联式语音系统
较早期的级联式系统,会把语音转文本、语言模型和文本转语音串联在一起。OpenAI 表示,这种方式让前沿语音交互成为可能,但信息在模型切换之间容易丢失,响应往往也显得缓慢而生硬。
轮次式语音模型
像 ChatGPT Advanced Voice Mode 这样的轮次式语音模型,通过在单一模型内处理音频降低了延迟,但它仍依赖离散轮次。OpenAI 表示,模型必须等用户先说完才能接话,这让交互显得僵硬;而当静音检测误判停顿或背景噪音时,也会更容易出现打断。
新的方法
OpenAI 表示,GPT-Live 通过两项架构变化解决了这些限制。
持续交互
GPT-Live 在生成输出的同时会持续处理输入,而不是把对话视为一串彼此独立的消息。OpenAI 表示,这让模型能够每秒做出多次决策,判断自己是该开口、继续聆听、暂停、打断,还是调用工具。
公司表示,这带来了更快、更自然的来回交流、更好的时机把握,甚至还支持实时翻译。
将深度任务委托给后台
OpenAI 表示,GPT-Live 与更深层的任务执行是解耦的。当问题需要搜索、推理或更 agentic 的行为时,GPT-Live 可以把任务转交给 GPT-5.5 之类的其他模型,同时自己继续维持对话流畅进行。
OpenAI 表示,这也意味着 GPT-Live 能持续受益于更新的模型与 agents,而无需改动其对话层本身。
评测
OpenAI 表示,他们为愉悦感与对话流畅性构建了新的人工评测。在时长 5 到 10 分钟的配对对比对话中,公司称 GPT-Live-1 和 GPT-Live-1 mini 相较 Advanced Voice Mode 获得了明显更高的人类偏好。
文章列出了几项评测上的提升:
GPQA,用于专家级科学推理BrowseComp,用于 agentic 网页搜索和难以定位的信息查找τ³-Voice Telecom(内部变体),用于真实感较强的多轮电信客服任务
OpenAI 还表示,GPT-Live-1(Instant)和 GPT-Live-1 mini 在后台使用 GPT-5.5 Instant,而 GPT-Live-1 Medium 和 GPT-Live-1 High 则使用推理投入分别为 medium 和 high 的 GPT-5.5 Thinking。
全新的 ChatGPT Voice 体验
OpenAI 表示,每周有超过 1.5 亿人使用 ChatGPT 的语音功能。从 2026 年 7 月 8 日起,用户在 ChatGPT 中点击 Voice 按钮后,将进入由 GPT-Live 驱动的升级版体验。
更自然的对话
OpenAI 表示,用户现在可以随时插入追问、停下来整理思路,或者要求 ChatGPT 放慢语速。GPT-Live 还会通过简短确认语来表明自己在跟进用户内容;同时,OpenAI 表示,他们已经为 GPT-Live 重新制作了 ChatGPT 的九种声音。
更聪明的回答
OpenAI 表示,ChatGPT Voice 现在可以直接调用其最新的前沿模型。用户可以根据任务选择合适的推理等级:Instant 适合更快响应;Medium 和 High 则适合希望模型多花一些时间思考的场景。
更好的聆听能力
根据 OpenAI 的说法,ChatGPT Voice 现在会在短暂停顿时继续等待,而不是过快打断;在被要求保持安静时可以持续不出声;并且在有背景噪音时,更擅长聚焦用户的声音。
一眼看懂的可视化答案
OpenAI 表示,ChatGPT Voice 现在能够针对天气、股票、体育等主题展示更丰富的可视化卡片,同时仍支持搜索、记忆、图像和文件上传。
为语音而设计的安全机制
OpenAI 表示,GPT-Live 在设计上默认以安全为先。它建立在最新模型的安全进展之上,同时增加了专门面向语音的训练与防护措施。
扩展后的安全测试
OpenAI 表示,他们将测试范围扩展到了新的原生音频评测,以及合成生成音频评测,重点覆盖自残、精神病性症状与躁狂、对 AI 的情感依赖、暴力和性内容等领域。他们还表示,内部专家对模型进行了语音特有风险的 red-teaming。
公司称,在几乎所有被评估的安全领域中,GPT-Live 的表现都与 Advanced Voice Mode 相当或更好。
内置防护
OpenAI 表示,他们加入了可在模型说话过程中介入的防护机制。根据具体情况,系统可以把模型引导向更安全的回应、展示额外的安全提示或资源,或者在更高风险的情形下直接结束对话。
公司还表示,他们针对自残场景调整了支持流程,增加了面向青少年用户的保护,并且在某些更高风险的自残情形中,可以通知已关联的家长。
从真实使用中持续学习
OpenAI 表示,他们正在推出围绕情感依赖的长期测量与发布后监控;同时,GPT-Live 使用的是预定义语音集合,而不是尝试模仿真实人物。
可用性与限制
OpenAI 表示,GPT-Live 正在 iOS、Android 和 ChatGPT.com 上逐步推出。GPT-Live-1 将成为 Go、Plus 和 Pro 用户的默认语音模型,而 GPT-Live-1 mini 则成为 Free 用户的默认选择。
公司表示,他们已经针对 ChatGPT 中一些最常用的语言优化了 GPT-Live,但也提醒称,部分语言仍可能存在非母语口音或流畅度不足的问题。
在发布时,GPT-Live 还不支持 ChatGPT 中与视频或屏幕共享同时使用的语音体验。OpenAI 表示,这些能力已在计划中;与此同时,在需要这些功能的场景下,旧版 Standard Voice 和 Advanced Voice Mode 仍会继续提供。