OpenAI正式上线GPT-Live-1 API:支持打断…

AI广播站10小时前更新 小悠
6 0 0

OpenAI于近日正式宣布将全新模型GPT-Live-1引入API,为开发者打造全双工实时语音应用及业务流程提供核心支撑。该模型的推出,标志着AI语音交互正在从传统的“分段式处理”向真正的自然对话演进。

在核心技术架构上,GPT-Live-1实现了语音理解与语音输出在同一模型中的深度整合。它打破了传统模式中“语音转文字、大语言模型推理、文字转语音”的多次衔接壁垒,从而大幅降低了系统延迟。该模型全面支持全双工对话,不仅能让系统在输出语音的同时依然聆听用户的声音,还能在对话过程中精准处理打断、停顿以及背景噪声等复杂场景。

OpenAI正式上线GPT-Live-1 API:支持打断处理、工具调用与电话智能体

除了流畅的交互体验,GPT-Live-1在功能扩展和场景落地上也展现出极高的灵活性。开发者可以通过系统提示词轻松调整模型的语气、语速和对话风格,并配置后端模型、工具及智能体框架。同时,该模型支持原生语音识别转写和回复文本,具备字母数字理解、关键词偏置及轮次检测能力。它可以与Codex等工具连接,也可以通过OpenAI Presence开发能够查询企业系统、执行获批操作并在必要时转交人工的语音工作。在实际应用场景中,它能够无缝切入电话场景,胜任餐厅预订、客户服务等全双工语音智能体任务。

实际应用层面的成效同样显著。在早期评估中,语言学习平台Speak接入GPT-Live-1后,学习者在思考停顿期间的误打断次数较此前基于轮次的系统减少了将近80%;医疗服务平台也通过该模型精简了架构,大幅削减了代码量。在OpenAI公布的评测中,GPT-Live-1在Full Duplex Bench测试中的表现比GPT-Realtime-2.1高出30个百分点,并在搭配GPT-6Astra中等推理强度时,在Tau3端到端语音智能体任务测试中荣登榜首。

目前,GPT-Live-1已正式在API中提供,其前端语音层的定价为每分钟0.05美元(按每小时计算约为3美元),后端模型和智能体工具的费用另行计算。与此同时,OpenAI还进一步扩展了其实时语音选项,新增了Quartz、Ripple、Vesper、Willow、Stone、Gleam、Meridian、Bossa、Tempo、Beacon、Delta和Cinder等多款全新声音,并计划在未来数月内持续增加更多的语音和语言支持,全面加速智能语音生态的普及。

OpenAI语音产品负责人宣布,ChatGPT语音模式支持用户自选模型与推理深度,Pro套餐可调用GPT-5.6 Sol或GPT-6 Astra;涉及网络搜索或复杂推理时自动调用指定模型。语音转交底层文本模型处理计为一条消息。四档套餐额度及三档语音智能等级同步公布。

美国加州州长纽森签署一揽子人工智能监管法案,要求前沿大模型强化安全风险评估、透明度披露,并防范灾难性网络攻击;万亿参数级模型上线前须通过红队演练和第三方审计。该立法罕见获得OpenAI、Anthropic等硅谷头部AI企业公开背书支持。

OpenAI推出图像生成与语音功能后,被曝悄然更新广告政策:禁止竞争对手在ChatGPT平台投放图像和音频生成类AI产品广告,已通知部分合作伙伴,不再审批此类广告。新规此前未对外披露,也未更新至公开政策页面。

知情人士称,明星AI研究员安德鲁·塔洛克即将从Meta离职。Meta去年以超10亿美元薪酬方案挖他回归,被视为重大胜利,也为扎克伯格重金争夺AI人才、追赶竞赛画上句号。塔洛克曾在Meta工作11年,2023年转投OpenAI,随后共同创立公司。

OpenAI近期推出图像生成与语音功能后,悄然更新内部广告政策,禁止竞争对手在ChatGPT平台投放图像生成、语音生成等特定生成式AI产品广告。该新规此前未公开披露,也未更新至官方广告政策页面,但已正式实施。

OpenAI正式上线GPT-Live-1 API:支持打断…

关注 “悠AI” 更多干货技巧行业动态

© 版权声明

相关文章

没有相关内容!

暂无评论

您必须登录才能参与评论!
立即登录
none
暂无评论...