前途科技前途科技
  • 服务
  • 关于
  • AI
    • AI 大模型
    • 具身智能
    • 算力芯片
  • 科技
    • 智能终端
    • 软件·互联网
    • 汽车·出行
    • 科学前沿
  • 资源中心
    • 深度研究
      • AI 前沿
      • 教程
      • AI 知识库
      • 案例研究
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们
产品/09.11 · 07:01/3 MIN/0 阅读

OpenAI 开放 GPT-Live-1 API:原生全双工实时语音模型

OpenAI 正式在 API 中推出原生语音模型 GPT-Live-1。该模型支持边听边说和自然打断,可将深度推理委托给后端模型,告别传统拼接架构的高延迟痛点,前端语音层调用费用为每分钟 0.05 美元。

OpenAI 正式在 API 中推出原生语音模型 GPT-Live-1,开发者现可通过该接口构建更具临场感、反应自然的实时语音应用与业务流程。

该模型最初在 ChatGPT 中推出,具备同时收听与表达的双工能力。正如之前结合 Codex 与 ChatGPT Work 的演示所展示的那样,GPT-Live-1 还能将更深层的逻辑推理与工具调用委托给后端的其他模型协同完成。

告别拼接架构,化解传统语音延迟

传统的语音 AI 智能体通常采用「语音转文字(STT)→ 大语言模型推理 → 文字转语音(TTS)」的串联拼接架构。各环节之间的流转不仅层层叠加延迟,也容易丢失会话节奏和语境,开发者往往需要耗费大量精力去处理用户抢话、停顿或改变话题等边界情况。

GPT-Live-1 由单一模型统一处理音频输入与输出,大幅精简了语音交互层:

  • 流畅打断处理:单模型端到端同步推演收听与发音,消除串联交接时的脆弱感。在语言学习平台 Speak 的早期测试中,该模型为学员留出了更充分的思考时间,误判打断的情况较以往系统减少近 80%。
  • 静默与背景降噪:能够更好地过滤背景杂音并理解自然静默,避免不必要的插话或把每个动作都念出声来。
  • 长会话稳定性:在超长对话中保持上下文连贯与交互质量。
  • 电话系统支持:支持直接部署到全双工电话业务中,覆盖餐厅预订、客服支持等典型场景。

推理委托与灵活编排

GPT-Live-1 专注于前端实时交互,同时支持将深层推理或工具调用分发给后端模型。开发者能够完全自主选择后端的模型梯队与智能体框架:例如针对高频日常任务搭配轻量模型,面对复杂客诉时则联动具备强推理能力的后端模型,以此实现响应速度、推理深度与调用成本的最佳平衡。

此外,开发者还能直接通过系统提示词来调控智能体的语调、语速和会话风格。模型原生输出 ASR 转录文本与回复文字,并支持关键词偏置(Keyword Biasing)与轮流发言边界检测。

基准评估表现

官方评测显示,GPT-Live-1 在衡量双工交互能力的 Full Duplex Bench 基准测试中,表现相较 GPT-Realtime-2.1 提升了 30 个百分点,交互延迟与打断反馈大幅优化。当搭配后端模型进行中等推理强度评测时,它在衡量前沿语音智能体端到端能力的 Tau3 基准上取得第一。

更多音色与定价

OpenAI 此次还为 GPT-Live-1 扩充了音色库,涵盖更多口音、方言与语种,便于开发者匹配自身产品的品牌形象。

GPT-Live-1 即日起可在 API 中调用,前端语音层按使用时长计费,价格为每分钟 0.05 美元。企业用户亦可通过 OpenAI Presence 将其接入企业内部系统,部署受控、可信且支持人工接管的端到端实时语音流程。

标签:OpenAIGPT-Live-1AI 智能体

想了解 AI 如何助力您的企业?

免费获取企业 AI 成熟度诊断报告,发现转型机会

置顶文章

拒绝率清零,代价是拒掉 74% 的正常问题:安全对齐评测漏掉的另一半
置顶

拒绝率清零,代价是拒掉 74% 的正常问题:安全对齐评测漏掉的另一半

拆解 Claude 文本水印:不是绿名单,是锦标赛采样,以及它在中国合规里挡得住的那一半
置顶

拆解 Claude 文本水印:不是绿名单,是锦标赛采样,以及它在中国合规里挡得住的那一半

前途科技前途科技
服务关于快讯技术商业报告
前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款
NeoMME 拆解:单塔多模态编码器如何把视觉 RAG 索引压到每页 6 KB
置顶

NeoMME 拆解:单塔多模态编码器如何把视觉 RAG 索引压到每页 6 KB

//

24小时热榜

RLHF先驱Paul Christiano加入OpenAI基金会董事会
TOP1

RLHF先驱Paul Christiano加入OpenAI基金会董事会

OpenAI发布Data agent:自然语言直连数仓与BI系统
TOP2

OpenAI发布Data agent:自然语言直连数仓与BI系统

3

CISA经历裁员后紧急重建,局长警告AI网络威胁加剧

14小时前
CISA经历裁员后紧急重建,局长警告AI网络威胁加剧
4

超越序列预测:AI何时能复原现实世界的隐藏规律?

23小时前
超越序列预测:AI何时能复原现实世界的隐藏规律?
5

OpenAI 发布 Agents API 公测版:一键构建生产级智能体

56分钟前
OpenAI 发布 Agents API 公测版:一键构建生产级智能体
6

OpenAI 开放 GPT-Live-1 API:原生全双工实时语音模型

57分钟前
OpenAI 开放 GPT-Live-1 API:原生全双工实时语音模型
7

OpenAI 推出金融专属 ChatGPT,搭载 GPT-6 Astra 强化投行业务

57分钟前
OpenAI 推出金融专属 ChatGPT,搭载 GPT-6 Astra 强化投行业务
8

ChatGPT与Codex加持:AI将抗生素筛选缩至数小时

58分钟前
ChatGPT与Codex加持:AI将抗生素筛选缩至数小时
热门标签
大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

关注公众号

前途科技微信公众号

扫码关注,获取最新 AI 资讯

免费获取 AI 落地指南

3 步完成企业诊断,获取专属转型建议

已有 200+ 企业完成诊断