Rohan Paul
@rohanpaul_ai
Anthropic 发布了 Haiku 5.5
> 在 10 万 token 以内的提示上,成本比 Haiku 4.5 低 90%。
> Haiku 5.5 首次为 Haiku 加入 effort(投入度)设置,用成本换取准确度,但对于 Terminal-Bench 4.0 任务这类复杂的智能体编程,Anthropic 仍推荐使用 Sonnet 5.5 和 Opus 5.5。
> Asana 报告称,与其当前使用的模型相比,任务完成延迟降低了 30% 以上,每个智能体回合的推理速度最高快 2.5 倍。
> 在测试 AI 智能体能否操作真实电脑完成长时间多步骤任务的 OSWorld 2.1 上,Haiku 5.5 从 Haiku 4.5 的 15.7% 跃升至 72.4%。
在 Chartography(一项不借助工具读取和解读图表的视觉推理测试)上,它从 6.4% 提升到 46.4%。