AI21 Labs@AI21Labs2026年10月06日 21:28我们分析了一年来在 4 类任务上的智能体研究:深度研究、RAG 索引、智能体搜索和编程。 我们发现,先问一句“这个任务可验证吗?”,就能暴露出智能体架构中值得优化的低效环节——而且应在动用扩展(scaling)这一杠杆之前先做优化。 这就是我们的可验证性试金石: > 如果任务无法验证 → 做聚合 > 如果可以验证 → 低成本地生成,把预算花在校验上 完整文章见: https://t.co/HKr3Q5UcWl打开原帖#511482