OpenAI Developers
@OpenAIDevs
对于 GPT-Live-1 的智能,Tau3 测试语音代理是否能够真正完成跨航空公司、零售和电信场景的客户支持任务。
与中等推理强度的 GPT-6 Astra 配合使用,GPT-Live-1 第一次尝试就完成了 83.6% 的任务,而 GPT-Realtime-2.1 为 45.7%。
同样的配对在 TauBanking 上得分为 38.1%,其中客服人员需要在银行文件中查找信息并应用它,同时使用工具来解决客户请求。
当然,与我们的构建聊天的人不会在完美的时间轮流中交谈。
他们停下来思考,用另一个问题打断,或者说“嗯-嗯”,而不期望你停下来:
• GPT-Live-1 在 Artificial Analysis 的对话动态基准上得分为 97.3%,该基准评估何时等待、轮流、响应中断或通过简短的确认继续说话。
• 在Full Duplex Bench v1.5 上,它在重叠语音、背景声音、旁白和中断的交互性方面得分为80.1%。
• 在Full Duplex Bench v1 中,它在用户回合结束后0.798 秒开始响应,而GPT-Realtime-2.1 则为1.41 秒。它衡量的是回复开始之前的等待时间,而不是模型说话的速度。
正确完成任务还意味着当有人暂停、犹豫或纠正自己时遵循要求。
通过后端模型处理工具调用,GPT-Live-1 设置在 Full Duplex Bench v3 上实现了以下结果:
• 完成正确的工具调用顺序后,工具调用成功率为 87%。
• 90% 基于单独的响应质量评估。
在发布博客中阅读更多内容:
https://openai.com/index/introducing-gpt-live-1-in-the-api/