ChatGPT AI工具

GPT-Live 是什么?ChatGPT Voice 新语音模型、套餐、限制与工作原理

OpenAI 已用 GPT-Live 重构 ChatGPT Voice。本文说明 GPT-Live-1 与 mini 的套餐范围、Live/Advanced/Standard 区别、使用限制,并用通俗方式解析全双工语音、异步推理和低延迟架构。

本文目录 正在整理章节

事实核对日期:2026 年 8 月 4 日。OpenAI 在 2026 年 7 月 8 日发布 GPT-Live,并在 8 月 3 日进一步公开了支撑 ChatGPT Voice 的实时系统架构。本文把首发信息与当前帮助中心状态分开说明;套餐、额度、地区和工作区可用性以后仍可能变化,请以账号内显示为准。

先说结论:GPT-Live 不只是“把文字念出来”的新语音。它可以一边听、一边说,也能在后台把搜索、推理或工具任务交给更强的模型处理。付费计划主要使用 GPT-Live-1,Free 使用 GPT-Live-1 mini;如果你需要视频或屏幕共享,当前仍应切回 Advanced Voice。

GPT-Live 是什么?它改变了哪一步

传统语音助手通常按“语音转文字 → 大模型回答 → 文字转语音”的顺序工作。早期 Advanced Voice 已经能直接处理和生成音频,但仍要依赖“轮次检测”:系统先判断用户是否说完,再决定何时回答。短暂停顿、环境噪声或两个人同时说话,都可能让它过早插话或反应变慢。

GPT-Live 是 OpenAI 的第三代语音系统。它采用全双工架构,让模型持续接收和生成音频,并在每秒多次判断应该继续听、说话、暂停、接受打断还是调用工具。复杂问题则走另一条异步路径处理,因此语音对话不必一直等待后台任务结束。

  • GPT-Live-1:当前主要面向付费计划,强调更强的语音理解和后台推理。
  • GPT-Live-1 mini:Free 的默认 Live 模型,也是部分付费计划帮助页单独列出额度的轻量版本。
  • 后台模型:首发时使用 GPT-5.5 处理搜索和更深推理;这不是永久绑定,OpenAI 表示会随前沿模型更新。

Live、Advanced 与 Standard Voice 有什么区别

模式 工作方式 适合场景 当前关键限制
Live 全双工,能同时听和说;可调用搜索与记忆,并在支持时结合文字、图片和视觉卡片 自然对话、语言练习、实时翻译、口头梳理复杂问题 暂不支持视频、屏幕共享、连接应用或插件
Advanced 上一代实时语音,按轮次交互 需要在支持的 iOS/Android 账号上使用视频或屏幕共享 对停顿和打断的处理不如 Live 连续
Standard 先把语音转成文字,再生成回答 更偏传统的一问一答;Live 不可用时备用 对话节奏更慢,不是全双工

选择很简单:日常连续对话优先 Live;要共享摄像头或屏幕时选 Advanced;只需要传统语音问答或其他模式不可用时选 Standard。

GPT-Live 套餐与时长:截至 2026 年 8 月 4 日

OpenAI 当前按滚动 24 小时计算 Live 用量,并明确说明额度可能变化。下表概括的是 Voice in Chat,不是 Work 或 Codex 的语音额度。

计划 当前帮助中心列出的额度
Free 有限的 GPT-Live-1 mini 用量,按滚动 24 小时计算
Go / Plus GPT-Live-1 Instant 最多 1 小时;Medium/High 最多 1 小时;mini 最多 2 小时
Pro 帮助中心同时列出不同 Pro 版本:200 美元/月版本为 GPT-Live-1 无限使用;100 美元/月版本为 Instant 12 小时、Medium/High 12 小时、mini 24 小时。不要把其中一种价格和额度当成所有地区统一方案
Business Instant 1 小时、Medium/High 1 小时;超出后当前费率为每分钟 5 credits
Enterprise / Edu / Healthcare 灵活计价工作区当前为每分钟 5 credits;旧版 Enterprise/Edu 为 Live 1 小时、mini 2 小时

单次 Live 对话最长 2 小时。ChatGPT 会在达到额度时提示。不同地区、工作区设置、客户端版本和灰度进度都可能影响你实际看到的选项,所以发布后也应定期复核官方 ChatGPT Voice 帮助页。如果你还在比较套餐定位,可参考本站的ChatGPT Free、Go、Plus 与 Pro 对比

怎么开启 GPT-Live

  1. 先把 ChatGPT iOS、Android 或桌面客户端更新到最新版;网页端直接登录 ChatGPT.com。
  2. 打开 Settings → Voice,查看是否出现 Live、Advanced 和 Standard。
  3. 选择 Live,然后在聊天输入框点语音图标;首次使用时允许麦克风权限并选择声音。
  4. 如果账号出现 Intelligence 选项,可在 Instant、Medium 或 High 之间选择。更高推理级别处理复杂问题更强,但可能回答更慢。
  5. 用一句明确指令开始测试,例如:“我思考时会停顿,请等我说‘现在回答’后再回答。”

设置里没有 Live 怎么办

  • 确认应用已经更新,并重新打开 Settings → Voice。
  • 检查当前计划、所在地区和账号是否处于逐步开放范围。
  • 团队工作区还要检查管理员是否启用了 Voice;部分 Enterprise、Edu 和 Healthcare 工作区在早期开放阶段还需开启 Early Model Access。
  • 如果仍看不到 Live,先使用 Advanced 或 Standard,不要通过非官方客户端绕过账号或地区限制。

三个真正适合 Live 的使用方法

1. 语言练习与双向翻译

你可以先指定两种语言、翻译方向和节奏,例如:“我说中文时翻成英文,对方说英文时翻成中文;不要解释,只在听完一句后翻译。”GPT-Live 支持实时翻译,但口音、专业名词和嘈杂环境仍可能导致错误,医疗、法律或合同沟通不应只依赖自动翻译。

2. 口头规划与头脑风暴

Live 适合边走边梳理行程、访谈提纲或内容框架。先让它复述目标和约束,再要求它搜索日期敏感信息并给出来源。语音模式也会犯错,涉及时间、地点、价格和规则时,应回到文字结果逐项核对。

3. 在桌面端协调 Work 或 Codex

在支持的 macOS 和 Windows ChatGPT 桌面应用中,Voice 可以开始任务、询问进度、调整优先级或协调多个代理;配对的 iOS 可作为远程入口。它和普通 Voice in Chat 使用不同额度与计费,不能直接套用上面的 1 小时或 2 小时规则。开始前可先阅读本站的ChatGPT、Work、Agent 与 Codex 区别以及ChatGPT 桌面版与 Codex 更新说明

为什么 GPT-Live 听起来更“实时”

全双工取代独立轮次检测

GPT-Live 把“什么时候说、什么时候继续听”的判断放进语音模型本身,不再让独立的 turn detector 卡在音频路径上。因此它能在用户停顿时继续听,也能接受更自然的插话。不过,全双工不等于多人会议永远准确;重叠讲话和环境噪声依然会造成误判。

媒体快路径与异步推理分开

音频在客户端与语音模型之间走专用快路径,搜索、工具和业务逻辑则隔着异步 RPC 运行。慢工具调用可能推迟自己的结果,却不会直接堵住音频流。OpenAI 还把媒体前端和推理逻辑从 Python asyncio 重写为 Go;按其 8 月 3 日工程文章的第一方数据,新系统 p95 的音频帧交付表现达到旧系统 p50 水平。

WebRTC、WARP 与 Instant Connect

底层仍以 WebRTC 传输低延迟媒体。OpenAI 设计的 WARP(WebRTC Abridged Roundtrip Protocol)把媒体和数据启动从 6 次网络往返压缩到 1 次;配合预协商参数的 Instant Connect,客户端可以用首个 UDP 数据包启动会话。WARP 采用开放规范,相关提案正在 IETF TSVWG 推进,并已获得 libwebrtc 与 Pion 支持。

长对话中的无缝切换

语音会话持续变长时,模型上下文会增长,服务实例也可能需要切换。新系统会提前预热替代实例、填充当前上下文并并行运行,准备好后再切换。上下文压缩也在旁路完成,避免为了整理历史而中断正在播放的语音。

本站此前曾记录GPT-Realtime-2 与 WebRTC 文档语音方案。那篇是面向开发者实时音频能力的日期型摘要;本文关注 GPT-Live 如何成为当前 ChatGPT Voice 的交互层,两者共享实时传输背景,但不是同一个搜索意图。

使用限制、转录与隐私

  • 不是多人会议转写工具:Live 更适合一对一交流;重叠说话、长停顿和背景音仍可能触发插话。
  • 转录不是逐字稿:会话结束后会加入聊天历史,但可能和实际说法不同,尤其在语音重叠或环境嘈杂时。
  • 自定义 GPT 暂不支持 Live:与 GPT 的语音对话继续使用 Advanced Voice;一次只能开启一个 Voice 会话。
  • Live 暂不支持视频和屏幕共享:符合条件的移动端用户需要切换到 Advanced。
  • 音视频有单独留存规则:Live/Advanced 音频及 Advanced 视频通常与转录一起保留 30 天。删除聊天后,相关片段原则上在 30 天内删除;“存档”不等于删除。
  • 训练由数据控制决定:音频和视频默认不会用于训练,除非用户主动选择分享;转录和其他文件是否可用于改进模型,还取决于计划与“Improve the model for everyone”设置。

SynthID 水印意味着什么

OpenAI 在 2026 年 7 月 31 日更新称,通过 ChatGPT Voice 和 OpenAI API 生成的“受支持 GPT-Live 音频”会包含 SynthID 水印,并提供公开验证工具与验证 API。检测到来源信号,只能说明音频很可能来自 OpenAI,不能证明内容真实或未被编辑;没有检测到,也不能反向证明它不是 AI 生成。

常见问题

Free 用户可以使用 GPT-Live 吗?

可以。Free 当前使用 GPT-Live-1 mini,但滚动 24 小时内的用量有限,而且额度会变化。

ChatGPT Plus 的 GPT-Live 是无限的吗?

不是。截至 2026 年 8 月 4 日,Go/Plus 的官方帮助页列出 GPT-Live-1 Instant 最多 1 小时、Medium/High 最多 1 小时、mini 最多 2 小时,按滚动 24 小时计算。以账号内提示为最终依据。

国内如何开通 ChatGPT Plus,开通后一定能用 GPT-Live 吗?

OpenAI 当前说明,付费用户将逐步使用 GPT-Live-1,Free 用户则使用 GPT-Live-1 mini;具体入口仍可能受地区、客户端版本、账号和工作区设置影响。如果你已确认账号与所在地区符合 OpenAI 当前支持条件,需要比较官方网页、应用商店付款和常见支付失败处理,可以阅读国内如何开通 ChatGPT Plus 完整教程。开通 Plus 不代表某项语音功能会立即出现在所有账号中,请以当前设备和账号页面实际显示为准。

GPT-Live 能共享摄像头或屏幕吗?

当前不能。符合条件的 iOS/Android 订阅用户需要切换到 Advanced Voice 才能使用视频或屏幕共享。

为什么全双工模式仍会打断我?

全双工减少了对固定停顿的依赖,但背景噪声、长停顿、其他说话者和音量问题仍可能干扰判断。可以使用耳机、换到安静环境,并在开场明确要求“等我说现在回答再回答”。

GPT-Live API 已经全面开放了吗?

不能这样表述。7 月 31 日产品页提到受支持的 OpenAI API 音频已加入 SynthID,也提供了验证 API;但 8 月 3 日工程文仍把更广泛的 GPT-Live API 称为 upcoming。开发者应以当前 API 文档和控制台实际可见能力为准,本文不宣称它已经全面 GA。

GPT-Live 能做中文或实时翻译吗?

官方将实时翻译列为能力之一,但不同语言、口音和专业词汇的流畅度并不一致。中文日常对话可以尝试,重要内容仍应要求它同步显示文字并人工校对。

官方与辅助来源

Continue reading

相关推荐

查看全部文章
01 2026最新:国内如何开通 ChatGPT Plus?微信/支付宝也能订阅(完整教程) 2026-02-15 02 ChatGPT 官方 Chrome 插件怎么用?Side Chat、多标签与权限安全指南 2026-08-03 03 OpenAI Astra 是什么?10 项数学研究成果与 ChatGPT 上线事实边界 2026-08-02 04 ChatGPT 生成图片失败怎么办?宕机、限额与政策排查 2026-07-28