本文目录 正在整理章节
事实核对日期:2026 年 8 月 4 日。OpenAI 在 2026 年 7 月 8 日发布 GPT-Live,并在 8 月 3 日进一步公开了支撑 ChatGPT Voice 的实时系统架构。本文把首发信息与当前帮助中心状态分开说明;套餐、额度、地区和工作区可用性以后仍可能变化,请以账号内显示为准。
先说结论:GPT-Live 不只是“把文字念出来”的新语音。它可以一边听、一边说,也能在后台把搜索、推理或工具任务交给更强的模型处理。付费计划主要使用 GPT-Live-1,Free 使用 GPT-Live-1 mini;如果你需要视频或屏幕共享,当前仍应切回 Advanced Voice。
GPT-Live 是什么?它改变了哪一步
传统语音助手通常按“语音转文字 → 大模型回答 → 文字转语音”的顺序工作。早期 Advanced Voice 已经能直接处理和生成音频,但仍要依赖“轮次检测”:系统先判断用户是否说完,再决定何时回答。短暂停顿、环境噪声或两个人同时说话,都可能让它过早插话或反应变慢。
GPT-Live 是 OpenAI 的第三代语音系统。它采用全双工架构,让模型持续接收和生成音频,并在每秒多次判断应该继续听、说话、暂停、接受打断还是调用工具。复杂问题则走另一条异步路径处理,因此语音对话不必一直等待后台任务结束。
- GPT-Live-1:当前主要面向付费计划,强调更强的语音理解和后台推理。
- GPT-Live-1 mini:Free 的默认 Live 模型,也是部分付费计划帮助页单独列出额度的轻量版本。
- 后台模型:首发时使用 GPT-5.5 处理搜索和更深推理;这不是永久绑定,OpenAI 表示会随前沿模型更新。
Live、Advanced 与 Standard Voice 有什么区别
| 模式 | 工作方式 | 适合场景 | 当前关键限制 |
|---|---|---|---|
| Live | 全双工,能同时听和说;可调用搜索与记忆,并在支持时结合文字、图片和视觉卡片 | 自然对话、语言练习、实时翻译、口头梳理复杂问题 | 暂不支持视频、屏幕共享、连接应用或插件 |
| Advanced | 上一代实时语音,按轮次交互 | 需要在支持的 iOS/Android 账号上使用视频或屏幕共享 | 对停顿和打断的处理不如 Live 连续 |
| Standard | 先把语音转成文字,再生成回答 | 更偏传统的一问一答;Live 不可用时备用 | 对话节奏更慢,不是全双工 |
选择很简单:日常连续对话优先 Live;要共享摄像头或屏幕时选 Advanced;只需要传统语音问答或其他模式不可用时选 Standard。
GPT-Live 套餐与时长:截至 2026 年 8 月 4 日
OpenAI 当前按滚动 24 小时计算 Live 用量,并明确说明额度可能变化。下表概括的是 Voice in Chat,不是 Work 或 Codex 的语音额度。
| 计划 | 当前帮助中心列出的额度 |
|---|---|
| Free | 有限的 GPT-Live-1 mini 用量,按滚动 24 小时计算 |
| Go / Plus | GPT-Live-1 Instant 最多 1 小时;Medium/High 最多 1 小时;mini 最多 2 小时 |
| Pro | 帮助中心同时列出不同 Pro 版本:200 美元/月版本为 GPT-Live-1 无限使用;100 美元/月版本为 Instant 12 小时、Medium/High 12 小时、mini 24 小时。不要把其中一种价格和额度当成所有地区统一方案 |
| Business | Instant 1 小时、Medium/High 1 小时;超出后当前费率为每分钟 5 credits |
| Enterprise / Edu / Healthcare | 灵活计价工作区当前为每分钟 5 credits;旧版 Enterprise/Edu 为 Live 1 小时、mini 2 小时 |
单次 Live 对话最长 2 小时。ChatGPT 会在达到额度时提示。不同地区、工作区设置、客户端版本和灰度进度都可能影响你实际看到的选项,所以发布后也应定期复核官方 ChatGPT Voice 帮助页。如果你还在比较套餐定位,可参考本站的ChatGPT Free、Go、Plus 与 Pro 对比。
怎么开启 GPT-Live
- 先把 ChatGPT iOS、Android 或桌面客户端更新到最新版;网页端直接登录 ChatGPT.com。
- 打开 Settings → Voice,查看是否出现 Live、Advanced 和 Standard。
- 选择 Live,然后在聊天输入框点语音图标;首次使用时允许麦克风权限并选择声音。
- 如果账号出现 Intelligence 选项,可在 Instant、Medium 或 High 之间选择。更高推理级别处理复杂问题更强,但可能回答更慢。
- 用一句明确指令开始测试,例如:“我思考时会停顿,请等我说‘现在回答’后再回答。”
设置里没有 Live 怎么办
- 确认应用已经更新,并重新打开 Settings → Voice。
- 检查当前计划、所在地区和账号是否处于逐步开放范围。
- 团队工作区还要检查管理员是否启用了 Voice;部分 Enterprise、Edu 和 Healthcare 工作区在早期开放阶段还需开启 Early Model Access。
- 如果仍看不到 Live,先使用 Advanced 或 Standard,不要通过非官方客户端绕过账号或地区限制。
三个真正适合 Live 的使用方法
1. 语言练习与双向翻译
你可以先指定两种语言、翻译方向和节奏,例如:“我说中文时翻成英文,对方说英文时翻成中文;不要解释,只在听完一句后翻译。”GPT-Live 支持实时翻译,但口音、专业名词和嘈杂环境仍可能导致错误,医疗、法律或合同沟通不应只依赖自动翻译。
2. 口头规划与头脑风暴
Live 适合边走边梳理行程、访谈提纲或内容框架。先让它复述目标和约束,再要求它搜索日期敏感信息并给出来源。语音模式也会犯错,涉及时间、地点、价格和规则时,应回到文字结果逐项核对。
3. 在桌面端协调 Work 或 Codex
在支持的 macOS 和 Windows ChatGPT 桌面应用中,Voice 可以开始任务、询问进度、调整优先级或协调多个代理;配对的 iOS 可作为远程入口。它和普通 Voice in Chat 使用不同额度与计费,不能直接套用上面的 1 小时或 2 小时规则。开始前可先阅读本站的ChatGPT、Work、Agent 与 Codex 区别以及ChatGPT 桌面版与 Codex 更新说明。
为什么 GPT-Live 听起来更“实时”
全双工取代独立轮次检测
GPT-Live 把“什么时候说、什么时候继续听”的判断放进语音模型本身,不再让独立的 turn detector 卡在音频路径上。因此它能在用户停顿时继续听,也能接受更自然的插话。不过,全双工不等于多人会议永远准确;重叠讲话和环境噪声依然会造成误判。
媒体快路径与异步推理分开
音频在客户端与语音模型之间走专用快路径,搜索、工具和业务逻辑则隔着异步 RPC 运行。慢工具调用可能推迟自己的结果,却不会直接堵住音频流。OpenAI 还把媒体前端和推理逻辑从 Python asyncio 重写为 Go;按其 8 月 3 日工程文章的第一方数据,新系统 p95 的音频帧交付表现达到旧系统 p50 水平。
WebRTC、WARP 与 Instant Connect
底层仍以 WebRTC 传输低延迟媒体。OpenAI 设计的 WARP(WebRTC Abridged Roundtrip Protocol)把媒体和数据启动从 6 次网络往返压缩到 1 次;配合预协商参数的 Instant Connect,客户端可以用首个 UDP 数据包启动会话。WARP 采用开放规范,相关提案正在 IETF TSVWG 推进,并已获得 libwebrtc 与 Pion 支持。
长对话中的无缝切换
语音会话持续变长时,模型上下文会增长,服务实例也可能需要切换。新系统会提前预热替代实例、填充当前上下文并并行运行,准备好后再切换。上下文压缩也在旁路完成,避免为了整理历史而中断正在播放的语音。
本站此前曾记录GPT-Realtime-2 与 WebRTC 文档语音方案。那篇是面向开发者实时音频能力的日期型摘要;本文关注 GPT-Live 如何成为当前 ChatGPT Voice 的交互层,两者共享实时传输背景,但不是同一个搜索意图。
使用限制、转录与隐私
- 不是多人会议转写工具:Live 更适合一对一交流;重叠说话、长停顿和背景音仍可能触发插话。
- 转录不是逐字稿:会话结束后会加入聊天历史,但可能和实际说法不同,尤其在语音重叠或环境嘈杂时。
- 自定义 GPT 暂不支持 Live:与 GPT 的语音对话继续使用 Advanced Voice;一次只能开启一个 Voice 会话。
- Live 暂不支持视频和屏幕共享:符合条件的移动端用户需要切换到 Advanced。
- 音视频有单独留存规则:Live/Advanced 音频及 Advanced 视频通常与转录一起保留 30 天。删除聊天后,相关片段原则上在 30 天内删除;“存档”不等于删除。
- 训练由数据控制决定:音频和视频默认不会用于训练,除非用户主动选择分享;转录和其他文件是否可用于改进模型,还取决于计划与“Improve the model for everyone”设置。
SynthID 水印意味着什么
OpenAI 在 2026 年 7 月 31 日更新称,通过 ChatGPT Voice 和 OpenAI API 生成的“受支持 GPT-Live 音频”会包含 SynthID 水印,并提供公开验证工具与验证 API。检测到来源信号,只能说明音频很可能来自 OpenAI,不能证明内容真实或未被编辑;没有检测到,也不能反向证明它不是 AI 生成。
常见问题
Free 用户可以使用 GPT-Live 吗?
可以。Free 当前使用 GPT-Live-1 mini,但滚动 24 小时内的用量有限,而且额度会变化。
ChatGPT Plus 的 GPT-Live 是无限的吗?
不是。截至 2026 年 8 月 4 日,Go/Plus 的官方帮助页列出 GPT-Live-1 Instant 最多 1 小时、Medium/High 最多 1 小时、mini 最多 2 小时,按滚动 24 小时计算。以账号内提示为最终依据。
国内如何开通 ChatGPT Plus,开通后一定能用 GPT-Live 吗?
OpenAI 当前说明,付费用户将逐步使用 GPT-Live-1,Free 用户则使用 GPT-Live-1 mini;具体入口仍可能受地区、客户端版本、账号和工作区设置影响。如果你已确认账号与所在地区符合 OpenAI 当前支持条件,需要比较官方网页、应用商店付款和常见支付失败处理,可以阅读国内如何开通 ChatGPT Plus 完整教程。开通 Plus 不代表某项语音功能会立即出现在所有账号中,请以当前设备和账号页面实际显示为准。
GPT-Live 能共享摄像头或屏幕吗?
当前不能。符合条件的 iOS/Android 订阅用户需要切换到 Advanced Voice 才能使用视频或屏幕共享。
为什么全双工模式仍会打断我?
全双工减少了对固定停顿的依赖,但背景噪声、长停顿、其他说话者和音量问题仍可能干扰判断。可以使用耳机、换到安静环境,并在开场明确要求“等我说现在回答再回答”。
GPT-Live API 已经全面开放了吗?
不能这样表述。7 月 31 日产品页提到受支持的 OpenAI API 音频已加入 SynthID,也提供了验证 API;但 8 月 3 日工程文仍把更广泛的 GPT-Live API 称为 upcoming。开发者应以当前 API 文档和控制台实际可见能力为准,本文不宣称它已经全面 GA。
GPT-Live 能做中文或实时翻译吗?
官方将实时翻译列为能力之一,但不同语言、口音和专业词汇的流畅度并不一致。中文日常对话可以尝试,重要内容仍应要求它同步显示文字并人工校对。
官方与辅助来源
- OpenAI:How we built a realtime system for responsive voice AI in six months(2026-08-03)
- OpenAI:Introducing GPT-Live(2026-07-08;2026-07-31 更新)
- OpenAI Help Center:ChatGPT Voice(核对于 2026-08-04)
- OpenAI Help Center:ChatGPT Release Notes
- TechCrunch:GPT-Live 发布与语音模型概览
- TechRadar:如何检查新版 Voice 与上手用例
- Tom's Guide:GPT-Live 实时翻译体验