Rohan Paul

@rohanpaul_ai

Anthropic 发布了 Haiku 5.5 > 在 10 万 token 以内的提示上,成本比 Haiku 4.5 低 90%。 > Haiku 5.5 首次为 Haiku 加入 effort(投入度)设置,用成本换取准确度,但对于 Terminal-Bench 4.0 任务这类复杂的智能体编程,Anthropic 仍推荐使用 Sonnet 5.5 和 Opus 5.5。 > Asana 报告称,与其当前使用的模型相比,任务完成延迟降低了 30% 以上,每个智能体回合的推理速度最高快 2.5 倍。 > 在测试 AI 智能体能否操作真实电脑完成长时间多步骤任务的 OSWorld 2.1 上,Haiku 5.5 从 Haiku 4.5 的 15.7% 跃升至 72.4%。 在 Chartography(一项不借助工具读取和解读图表的视觉推理测试)上,它从 6.4% 提升到 46.4%。
打开原帖#511482
  1. 产业

    Rohan Paul:– https://arxiv.org/abs/2610.08144 标题…
  2. 产业

    Rohan Paul:一篇新论文表明,当 AI 把一个数学证明翻译成 Lean 时,通过 Lea…
  3. 产业

    Rohan Paul:Emad Mostaque:AI 模型“基本上已经达到了人脑的效率”