OpenAI 正式在 API 中推出原生语音模型 GPT-Live-1。该模型支持边听边说和自然打断,可将深度推理委托给后端模型,告别传统拼接架构的高延迟痛点,前端语音层调用费用为每分钟 0.05 美元。
OpenAI 正式在 API 中推出原生语音模型 GPT-Live-1,开发者现可通过该接口构建更具临场感、反应自然的实时语音应用与业务流程。
该模型最初在 ChatGPT 中推出,具备同时收听与表达的双工能力。正如之前结合 Codex 与 ChatGPT Work 的演示所展示的那样,GPT-Live-1 还能将更深层的逻辑推理与工具调用委托给后端的其他模型协同完成。
传统的语音 AI 智能体通常采用「语音转文字(STT)→ 大语言模型推理 → 文字转语音(TTS)」的串联拼接架构。各环节之间的流转不仅层层叠加延迟,也容易丢失会话节奏和语境,开发者往往需要耗费大量精力去处理用户抢话、停顿或改变话题等边界情况。
GPT-Live-1 由单一模型统一处理音频输入与输出,大幅精简了语音交互层:
GPT-Live-1 专注于前端实时交互,同时支持将深层推理或工具调用分发给后端模型。开发者能够完全自主选择后端的模型梯队与智能体框架:例如针对高频日常任务搭配轻量模型,面对复杂客诉时则联动具备强推理能力的后端模型,以此实现响应速度、推理深度与调用成本的最佳平衡。
此外,开发者还能直接通过系统提示词来调控智能体的语调、语速和会话风格。模型原生输出 ASR 转录文本与回复文字,并支持关键词偏置(Keyword Biasing)与轮流发言边界检测。
官方评测显示,GPT-Live-1 在衡量双工交互能力的 Full Duplex Bench 基准测试中,表现相较 GPT-Realtime-2.1 提升了 30 个百分点,交互延迟与打断反馈大幅优化。当搭配后端模型进行中等推理强度评测时,它在衡量前沿语音智能体端到端能力的 Tau3 基准上取得第一。
OpenAI 此次还为 GPT-Live-1 扩充了音色库,涵盖更多口音、方言与语种,便于开发者匹配自身产品的品牌形象。
GPT-Live-1 即日起可在 API 中调用,前端语音层按使用时长计费,价格为每分钟 0.05 美元。企业用户亦可通过 OpenAI Presence 将其接入企业内部系统,部署受控、可信且支持人工接管的端到端实时语音流程。
免费获取企业 AI 成熟度诊断报告,发现转型机会








关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断