OpenAI 开放 GPT‑Live‑1 API:可以将GPT的语音对话能力接入到任意应用中 每分钟 0.05 美元
先在 ChatGPT 上线的全双工语音模型开放给开发者。它怎么处理打断和噪音、怎么把任务委派给后端,评测、价格和 10 段演示视频怎么看。
OpenAI正式将此前先在 ChatGPT 上线的 GPT-Live-1 开放至 API,今天即可在 API 中使用。作为一款支持全双工(full-duplex)的实时语音模型,GPT-Live-1 能够同时倾听与说话;正如在 Codex 和 ChatGPT Work 中所展示的那样,它可以将更深层次的推理与操作委派给搭配的模型与工具。这项能力主要面向希望在应用和业务工作流中构建自然语音交互体验的开发者,帮助其更灵活地掌控语音 Agent 的表达风格与行为方式。
为什么以前的语音 AI 总像“对讲机”
如果你用过早期的电话 AI 客服,或者在嘈杂环境里和车载语音助手说过话,大概率经历过这些尴尬瞬间:
- 你刚说了半句停下来想词,AI 以为你说完了,立刻抢话;
- AI 在念一段你不需要的信息,你喊“停一下”,它非要念完才停;
- 旁边有人咳嗽一声,或者咖啡馆音乐变响,AI 突然回一句“抱歉我没听清”;
- 为了查一个订单,电话那头一片沉默,只能干等。
这和语音 Agent 的搭法有关。常见的搭法有三种:
三种语音 Agent 的搭法
谁在听、谁在想、谁去办事
前两种是 GPT‑Live‑1 之前常见的做法;第三种是这次发布的分工方式。说明依据 OpenAI 发布页与 GPT‑Live 开发者文档。
-
串联式语音转文字 → 文字模型 → 文字转语音
每交接一次就多一段等待,也多一次丢掉节奏和上下文的机会。有人插话、停顿、改主意时怎么办,要开发者自己在各段之间协调。
-
单模型实时语音如 gpt‑realtime‑2.1
不用自己拼三段,但对话和推理压在同一个模型上:选了它,也就选定了它的推理能力。
-
GPT‑Live‑1 + 后端前端管对话,后端办事前端 · GPT‑Live‑1
边听边说(全双工),自己处理打断、附和、背景噪音,决定什么时候找后端帮忙。按通话时长计费。
后端 · 你选的模型或 Agent查资料、调工具、推理,把结果交回前端来说。可以是 Responses 模型(如 GPT‑6 Astra、Luna),也可以是你自己跑的任何模型、Agent 或服务。按用量另计费。
后端干活时对话不停,用户可以继续补充细节。文档特别提醒:打断说话不会自动取消后端任务;权限、确认、私有函数执行和长期任务状态,都由你的应用负责。
串联式把语音识别、推理模型和语音合成拼在一起,发布页指出,每交接一次就多一段延迟,也多一次丢掉对话时机、上下文和自然节奏的机会;有人打断、停顿或改主意时怎么办,要开发者自己在各段之间协调。单模型实时语音(如 GPT-Realtime-2.1)用一个模型同时负责说话、推理和选工具;Yelp 技术负责人 Thavidu Ranatunga(自称 Tav)在官方访谈里说,以往的语音对语音模型“通常不够聪明,做不了复杂任务”。GPT-Live-1 走的是第三种:一个模型负责听和说,把深层推理和工具调用委派给后端。
GPT-Live-1 怎么工作
可以把它想成一个专注于实时听说的前台,复杂的推理和办事交给后台。不过和串联式不同,GPT-Live-1 的听和说是在同一个模型里完成的:它同时对进来的声音和自己正在说的声音做推理(reasons over incoming and outgoing audio together),所以能边听边说;官方表示它能分清人声和背景噪音,在被打断或听到“嗯嗯”这类附和时即时回应,同时把更深的推理和工具调用委派(delegation)给后端模型或 Agent,后台干活时对话照常进行。
这段演示里,Workbench 界面有三条泳道:You(Microphone)、GPT-Live-1(Voice frontend)和 Backend(标注为 GPT-5.6 Luna)。会话一开始就有委派条目 Display → "GPT LIVE 1",所以点阵屏开场就显示“GPT LIVE 1”;工程师让模型向大家问好时,模型说“Hi everyone! Great to be here. Welcome to the GPT-Live-1 launch.”,后端同时把屏幕换成 OpenAI 标志和挥手动画;讲到价格时,屏幕显示“5¢ a minute”,模型说前端语音层每分钟 5 美分,后端推理和工具服务另算。值得注意的是,工程师约 16–20 秒打断说话、约 26–35 秒说背景有噪音时,Backend 泳道都是空的:打断和噪音由前端自己处理,并没有同时发生委派。画面里能看到的委派条目都是屏幕指令,“把动作交给机器人”来自模型自己的台词。
后端怎么选、怎么委派
后端可以独立于语音模型来选。官方给的例子是:预约排期、订单更新这类高频任务搭 Luna,需要推理的复杂客诉搭 Astra,按任务匹配推理深度、速度和成本。
开发者文档给了两种委派方式:
- Responses 委派:GPT-Live 直接调用你配置的 Responses 模型,自动带上对话上下文并拿回结果,适合托管后端。
- Client 委派:你的应用自己运行后端,可以接任何模型、Agent 框架或服务,并决定哪些结果交给 GPT-Live。
委派方式在创建会话时选定,要换得新开会话。有两点要特别注意:用户打断说话不会自动取消已经发出的后端任务,取消逻辑要应用自己处理;权限控制、确认机制、私有函数执行和长期任务状态,也都由你的应用负责。
此外,API 版原生提供这些能力:
- 语音识别转写(ASR transcripts)和回复文本;
- 较强的字母数字识别,支持关键词偏置(keyword biasing),比如让它更容易认对产品名、订单号;
- 虽然不是轮次制模型,但原生支持轮次检测(turn detection),仍可按明确的轮次边界开发;
- 更好地处理背景噪音和停顿,不打断对话,也不会把后台每一步都念出来;
- 长会话里的上下文保持和对话质量有改善;
- 支持部署到电话线路,从餐厅订位到企业客服。
对话体验:打断、噪音与语气
官方说 GPT-Live-1 能分清人声和背景噪音,咖啡馆的嘈杂声不必打断对话;用户也不用等模型说完,随时可以补充细节或改方向。
前半段是串联式,背景噪音滑块 8%:AI 一口气讲了一长串,被用户打断才停下,之后只回了一句泛泛的“是比你要的加载转圈改得多”。后半段切到 GPT-Live-1,噪音调到 29%,用户中途插话“我只要个加载转圈,为什么改 API 调用?”,AI 马上承认改多了,提议直接用现有 hook 里的 isLoading 标志;用户补一句不需要新依赖,AI 同意,并确认加载时禁用按钮。
后端处理推理和工具调用时,前台可以继续和用户聊,用户也能在等待时补充说明,结果好了再由前台说出来。
开头是串联模式:用户说“把低音加重”,AI 没反应,用户喊了声“Hello?”又说一遍。切到 GPT-Live-1 后,音乐不停,用户说“慢一点”,AI 回“降到 108 BPM”(108 是 AI 自己定的),接着要“更梦幻、更多空间”,最后要结尾加上升音效(riser)。下方 Tool calls 面板依次记下了 set_playback、set_bass_layer、adjust_saturation、adjust_tempo(每次调整有 2 秒渐变)、set_reverb,和排在小节末尾的 end_with_riser。
说话风格可以用 system prompt 调:语气、语速、表现力,以及语言和回复长度。OpenAI 在推文里说,它还能模仿说话人声音里的语气和情绪,跟上对方的语速。
用户出题“戴领结的鱼叫什么”,AI 抢先说出笑点“so fish-ticated”,用户吐槽“你早就知道了吧”;接着 AI 反讲了一个咖啡被抢劫(got mugged)的报警笑话。
音色也从以往少数几个实时音色,扩展到覆盖多种口音、方言和语言的一批。页面列了 12 个名字:Quartz、Ripple、Vesper、Willow、Stone、Gleam、Meridian、Bossa、Tempo、Beacon、Delta、Cinder,其中默认选中的 Quartz 标注为“带澳大利亚英语口音”(Australian English influenced),其余口音页面没有展开;未来几个月还会增加音色和语言,定制音色要联系销售。发布页还有一个限时的在线试用,可以在家、咖啡馆或街上试试打断、发笑或改主意。
官方评测:7 项数据怎么看
OpenAI 在发布页公布了 7 项评测,对比对象是自家上一代实时语音模型 GPT-Realtime-2.1 和 GPT-Realtime-2,没有列出第三方模型:
官方 7 项评测
GPT‑Live‑1 和 OpenAI 上一代实时语音模型对比
数据来自 OpenAI 发布页的图表,对比对象只有自家的 gpt‑realtime‑2.1 和 gpt‑realtime‑2,没有其他公司的模型。标 † 的 GPT‑Live‑1 成绩接了后端文字模型,两款 Realtime 模型都是单模型自己完成,所以比较条件并不相同;没标 † 的几项,页面没有说明是否接了后端。
- gpt‑live‑1
- gpt‑realtime‑2.1
- gpt‑realtime‑2
- gpt‑live‑1†
- 86.2%
- realtime‑2.1
- 45.7%
- realtime‑2
- 42.4%
† 后端:GPT‑6 Astra(medium 推理强度)
- gpt‑live‑1†
- 32.0%
- realtime‑2.1
- 12.4%
- realtime‑2
- 10.3%
† 后端:GPT‑6 Astra(medium)
- gpt‑live‑1
- 97.3%
- realtime‑2.1
- 95.7%
- realtime‑2
- 95.3%
- gpt‑live‑1
- 80.1%
- realtime‑2.1
- 45.4%
- realtime‑2
- 47.8%
- gpt‑live‑1
- 0.798 秒
- realtime‑2.1
- 1.41 秒
- realtime‑2
- 1.63 秒
条长按秒数画,最长为 1.63 秒
- gpt‑live‑1†
- 87.0%
- realtime‑2.1
- 60.0%
- realtime‑2
- 58.0%
† 后端:Terra(low)
- gpt‑live‑1†
- 90.0%
- realtime‑2.1
- 88.0%
- realtime‑2
- 81.0%
† 后端:Terra(low)
先注意比较条件并不相同:带 † 的 GPT-Live-1 成绩接了后端文字模型,两款 Realtime 模型是单模型自己完成。Tau3(Voice)考的是航空、零售、电信三类语音客服任务,Pass@1 是一次做成的比例,总分对三个领域等权平均;GPT-Live-1 搭 GPT-6 Astra(medium 推理强度)拿到 86.2%,GPT-Realtime-2.1 是 45.7%,GPT-Realtime-2 是 42.4%。官方说的“Tau3 第一”,图里也只和自家两款旧模型比。
Tau Banking(Voice)考的是要查知识库、用账户工具的 97 个银行客服任务。同样搭 Astra(medium),GPT-Live-1 是 32.0%,约为 GPT-Realtime-2.1(12.4%)的 2.6 倍。剩下约 68% 只说明这 97 个任务里没能一次做成,不能直接当成现实金融业务的失败率;但涉及高风险操作,仍要按文档说的由应用自己做好权限和确认。
对话节奏上,Full Duplex Bench v1 的接话延迟(用户说完到 AI 开口,越短越好)GPT-Live-1 是 0.798 秒,比 GPT-Realtime-2.1 的 1.41 秒缩短约 43%。Full Duplex Bench v1.5 的互动性(背景有人说话、用户转头跟别人说话、附和、打断时的反应)GPT-Live-1 是 80.10%,比 GPT-Realtime-2.1 的 45.4% 高 34.7 个百分点;官方正文说的是“高 30 个百分点”,没说明计算口径,这一项里 GPT-Realtime-2(47.8%)反而比 2.1 略高。Artificial Analysis 的对话节奏评估三者都很接近:97.3%、95.7%、95.3%。这几项页面都没有标注后端。
最后两项来自 Full Duplex Bench v3,考的是话里带停顿、犹豫、改口时的工具使用。GPT-Live-1 这里搭的是 Terra(OpenAI 的 GPT-5.6 Terra 文字模型,价格在 Luna 和 Astra 之间,用 low 推理强度):工具调用顺序的准确率 87.0%(两款 Realtime 为 60.0%、58.0%),说出来的回答与参考意图的匹配度 90.0%(88.0%、81.0%)。
客户怎么用
下面的演示和评价都来自 OpenAI 发布页,是官方挑选的客户自述;其中 OpenAI Presence 是 OpenAI 自家的企业产品。
餐厅电话:Yelp
顾客打给餐厅 Stella Lago,先订周六晚 7 点 4 位;中途转头问家人“孩子们来吗”,改成 2 位;接着把时间改到 7:30,说是纪念日想要靠窗,名字留 Patel,又问有没有无麸质。AI 说靠窗可以备注但不保证桌位,无麸质披萨饼底和意面加 3 美元;顾客最后又把名字改成 Smith,AI 核对后确认了周六 7:30、两位、Smith 的预订。视频自己注明,通话录音经过剪辑,实际效果可能不同。
他说,在早期大规模生产测试中,AI 接下并处理完的来电比例提高、转接减少,越来越多的人开始用完整、自然的句子和 AI 说话。Yelp CTO Alex Levy 在发布页的书面评价也提到这一点:
“当 Yelp Host 使用 GPT-Live-1 接听订座和外卖等来电时,我们看到来电处理率有了实质提升。来电者也开始说出更完整、更自然的句子……”——Alex Levy,Yelp CTO
客服:OpenAI Presence 与 Fin
OpenAI Presence 是 OpenAI 面向企业的产品,用 GPT-Live-1 做实时语音,帮企业部署能回答问题、解决问题、使用公司系统、执行已批准操作并在需要时转人工的 AI Agent,可以通过 OpenAI 客户经理了解。
顾客说一单蒸汽拖把发出一两个月了、还在派送中,不想要了,想退款;中途请 AI“说慢一点”,AI 答应放慢。后台可以看到查询订单、判断退款资格等工具和委派条目,定位到订单 SC-908214,最后给出并登记了 20 美元的补偿额度,顾客接受。
Fin 的 COO Jordan Neil 在发布页写道:
“顾客可以自然地停顿、打断和改变方向……Fin 可以将这种自然对话与自有的支持系统结合起来,进行更深层次的处理以解决问题。”——Jordan Neil,Fin COO
医疗:EliseAI
“和我们原来的级联方案相比,GPT-Live-1 让代码库减少了 80%,删掉了 2.3 万行代码。病人对话变得自然、实时,团队也能腾出手改进从预约到就医引导的整段体验。”——Tony Stoyanov,EliseAI 联合创始人兼 CTO
语言学习:Speak 与 HeyGen
“……在我们的早期评估中,学员思考停顿时的打断比以前的轮次式系统减少了近 80%。”——Andrew Hsu,Speak 联合创始人兼 CTO
学员 Wayne 在模拟的东京咖啡馆练点单。老师先教了拿铁“ラテをください”,学员插话说自己要的是咖啡不是拿铁,老师马上改教“コーヒーをください”(kōhī o kudasai),提醒别漏掉中间的 o;最后学员用“Aisu de”点了冰的。视频开头和画面上方的“Unlimited concurrency / Pennies a minute”是 HeyGen 自家的宣传语,不是 GPT-Live-1 的价格。
编程与创作:Devin 与 Picsart
工程师用语音让 Devin 做 Devin Live 的发布落地页:去 Notion 拉“发布简报”(launch brief),里面有三个设计方向,每个方向开一个子会话(child session)并行做,都要符合 Cognition 品牌的大体设计和感觉。Devin 边聊边做,最后交出三版预览:
- editorial:沉稳、像随笔,留白充裕,克制的蓝色点缀;
- playful retro:保留 Cognition 底色,加像素字体、精灵图和街机质感;
- bold:海报级大字,深色反白块和电光蓝。
“借助 Devin 和 GPT-Live-1,与 AI 工程师协作开始变得更像与队友合作。你可以一起推敲想法、验证方案,或者在离开键盘时把活交出去。”——Walden Yan,Cognition 联合创始人兼 CPO
画面里是一组儿童卡通角色(卡皮巴拉、巴哥犬 Pickle、老鼠 Pip 等)。用户选中卡皮巴拉那组,让 AI 想 4 个新场景并同时生成:彩虹花园迷宫、奶茶过家家咖啡馆、纸箱火箭、搞笑舞蹈游行;生成过程中又插话要老鼠 Pip 的角色参考图,AI 答应了(口头回复里说成了 Pickle 的参考图)。视频结束时,4 个场景好了 3 个。
价格与成本
前端语音层每分钟 0.05 美元,折合每小时 3 美元,按秒计费、不向上取整到整分钟;会话开着就计时,所以通话结束要及时关闭会话。上一代 GPT-Realtime-2.1 按音频 token 计费(输入每百万 32 美元、输出每百万 64 美元),GPT-Live-1 把语音层改成按时长计费,后端推理另算。
后端模型按 token 计费,工具按各自价格另算。价格页的短上下文标准价:
- GPT-6 Astra:输入每百万 token 10 美元,输出 50 美元;
- GPT-5.6 Terra:输入 2 美元,输出 12 美元;
- GPT-5.6 Luna:输入 0.20 美元,输出 1.20 美元。
官方没有给每小时总成本。举个明确是假设的算例:每小时委派 60 次,每次输入 4,000 token、输出 150 token,不含推理思考 token,也不含任何工具费。后端用 Luna,输入约 0.048 美元、输出约 0.011 美元,合计约 0.06 美元,加上前端 3 美元,约 3.06 美元/小时;后端用 Astra,输入 2.40 美元、输出 0.45 美元,合计约 2.85 美元,加上前端,约 5.85 美元/小时。实际账单取决于委派次数、上下文长度和工具开销。
开发者上手
接入方式
开发者文档列了几种连接方式:
- WebRTC:浏览器语音应用,音频走媒体轨道,JSON 事件走数据通道;
- WebSocket:服务端音频集成,一条连接同时传音频和控制事件;
- 服务端控制(server-side controls):给已有会话加一条旁路连接传事件,音频仍走主连接;
- 电话与 SIP:接电话线路;
- 合作方集成:已经在用 LiveKit、Twilio、Telnyx、Daily/Pipecat 的,按官方合作方指引对接。
上手步骤:
- 准备麦克风、HTTPS 或 localhost 的网页,API key 放在受信任的服务端,不要暴露给客户端;
- 写一份简短的前台 prompt,定好说话风格和什么时候找后端;
- 按快速上手指引接好浏览器的麦克风、播放和事件通道,由服务端创建会话、交换 Offer / Answer;
- 收到
session.started再开始说话; - 结束时显式关闭会话,才能拿到最终用量、释放连接。
前台 prompt 示例(编辑自拟)
GPT-Live 的 prompt 要短,只管说话风格(语气、语速、表现力、语言、回复长度)和什么时候找后端;详细业务规则和工具流程放在后端。
# Role & Tone(角色与说话风格)
你是一家餐厅的电话接待员。
语气保持亲切、自然与专业,语速适中,
富有表现力。
使用简体中文回复,
每次发音保持在 1 到 2 句话以内,
避免长篇大论。
当用户说话停顿或思考时,
可使用简短人类语气词适当回应
(如“好的”、“明白”),
但不要频繁重复口头禅。
# Delegation Rules(何时向后台委派)
你负责维持自然流畅的电话交流,
不直接处理具体业务数据库。
1. 涉及查询餐位空余、确认预订、
取消或修改订单等具体操作时:
- 先口头告知用户稍候,例如:
“好的,请稍等,我为您查看一下”,
随后请求后端进行处理。
2. 在后台处理任务期间:
- 若用户继续补充偏好或提出新要求,
保持正常倾听并简要确认。
3. 接收到后台返回的结果后:
- 提炼关键信息,用口语化、
两句话以内的自然中文传达给用户,
切勿照本宣科念出原始接口数据。
把 GPT-Live-1 接到 Codex(官方代码片段)
发布页给了一段把 GPT-Live-1 接到 Codex 的代码;按开发者文档的定义,这种由应用自己运行后端的做法属于 client 委派。官方说明:这段只截取了把对话上下文交给 Codex、再把答案交回 GPT-Live-1 的部分,连接建立和委派处理都省略了。sandboxMode: "read-only" 加 approvalPolicy: "never" 表示只读仓库、不需要人工批准,所以只适合只读问答。中文注释为编辑所加。
import { Codex } from "@openai/codex-sdk";
// 1. 初始化 Codex 执行线程(配置为只读沙箱,无需人工审批,适合只读检索)
const thread = new Codex().startThread({
workingDirectory: "./repo",
sandboxMode: "read-only",
approvalPolicy: "never",
});
// 2. 接收来自 GPT-Live-1 前台的委派请求(Client 委派模式)
async function answer(live, delegationId, context) {
// 将对话上下文传递给 Codex 执行检索与回答
const { finalResponse } = await thread.run(
`Answer the latest question using this repo.
Reply in two short spoken sentences.\n${context}`
);
// 3. 将结果通过事件发送回 GPT-Live-1 前台语音层播报
live.send({
type: "session.commentary.append",
delegation_id: delegationId,
content: finalResponse,
});
}
上线前检查清单(编辑自拟)
- 接话延迟:在实际的 4G/5G 或 VoIP 电话线路上测,看用户说完到 Agent 开口的延迟能否接近评测里的 0.8 秒(阈值按业务调整)。
- 停顿与抢话:模拟边想边说(“我想预订……嗯……那个……周六晚上的两人位”),看会不会过早抢话(示例缓冲 1.5 秒,按业务调整)。
- 背景人声与噪音:在有旁人交谈、电视声或环境噪音的地方测,确认不会把别人的话当成指令。
- 打断后的后端任务:打断不会自动取消已发出的后端任务,用户改主意时,应用要自己取消或重置状态。
- 权限与确认:支付、扣款、退货、改签这类敏感或不可逆操作,由应用设置明确的确认环节。
- 关闭会话:前端按秒计费,结束时显式关闭会话;建议设单次会话最长时长(如 15 分钟,示例阈值),防止客户端异常没挂断。
Realtime 仍是官方列出的一种选择,由一个模型同时负责说话、推理和选工具;需要在自然对话的同时处理复杂业务和工具调用时,GPT-Live-1 的前后端分工给了更灵活的搭配空间。