OpenAI 扩大实时语音模型能力:GPT-Live-1 上线 API,支持打断处理、工具调用和电话语音智能体

IT之家 9 月 11 日消息,OpenAI 今日宣布将 GPT-Live-1 引入 API,开发者可据此打造支持实时语音交互的应用和业务流程。该模型支持全双工对话,能够同时听取和输出语音,并在对话过程中处理打断、停顿及背景噪声。 GPT-Live-1 还支持电话场景,可用于预订餐厅、客户服务等全双工语音智能体。OpenAI 表示,开发者可以将其与 Codex 等工具连接,也可以通过 OpenAI Presence 开发能够查询企业系统、执行获批操作并在必要时转交人工的语音工作。 据介绍,GPT-Live-1 将语音理解与语音输出整合在同一模型中,减少传统“语音转文字 — 大语言模型 — 文字…
以上为资讯摘要,完整内容请访问原文网站。
阅读原文 →