跳到正文
ByteWoops | AI 观察员
首页
报道原帖
新锐明星
关于
中文EN
搜索登录
ByteWoops | AI 观察员
首页

最新

报道原帖

GitHub 榜

新锐明星
关于
登录English

OpenAI Developers

@OpenAIDevs

2026年9月11日 02:35

对于 GPT-Live-1 的智能,Tau3 测试语音代理是否能够真正完成跨航空公司、零售和电信场景的客户支持任务。 与中等推理强度的 GPT-6 Astra 配合使用,GPT-Live-1 第一次尝试就完成了 83.6% 的任务,而 GPT-Realtime-2.1 为 45.7%。 同样的配对在 TauBanking 上得分为 38.1%,其中客服人员需要在银行文件中查找信息并应用它,同时使用工具来解决客户请求。 当然,与我们的构建聊天的人不会在完美的时间轮流中交谈。 他们停下来思考,用另一个问题打断,或者说“嗯-嗯”,而不期望你停下来: • GPT-Live-1 在 Artificial Analysis 的对话动态基准上得分为 97.3%,该基准评估何时等待、轮流、响应中断或通过简短的确认继续说话。 • 在Full Duplex Bench v1.5 上,它在重叠语音、背景声音、旁白和中断的交互性方面得分为80.1%。 • 在Full Duplex Bench v1 中,它在用户回合结束后0.798 秒开始响应,而GPT-Realtime-2.1 则为1.41 秒。它衡量的是回复开始之前的等待时间,而不是模型说话的速度。 正确完成任务还意味着当有人暂停、犹豫或纠正自己时遵循要求。 通过后端模型处理工具调用,GPT-Live-1 设置在 Full Duplex Bench v3 上实现了以下结果: • 完成正确的工具调用顺序后,工具调用成功率为 87%。 • 90% 基于单独的响应质量评估。 在发布博客中阅读更多内容: https://openai.com/index/introducing-gpt-live-1-in-the-api/
打开原帖#511482

相关阅读

  1. 产业

    Greg Brockman:面向抗体可开发性预测的 Astra:2026年9月11日
  2. 产业

    Databricks:Replit-Databricks 集成现已普遍可用,并提供新的原生 La…2026年9月11日
  3. 产业

    Runway:我们相信即时生成是视频模型的发展方向2026年9月11日
ByteWoops | AI 观察员

独立、严谨、可追溯的 AI 前沿资讯。

了解更多报道原帖GitHub 榜关于投稿技能
用户中心登录用户中心Agent API
每周研究简报

人工智能研究、系统与社会

RSS
© 2026 ByteWoops隐私