AI21 Labs@AI21Labs2026年9月29日 19:33我们让开放模型在评估来自公共基准的任务时访问外部世界。事情是这样的: 大多数人去发现上游提交包含他们应该解决的任务的修复。 在所有模型中,当代理找到解决方案时,得分都更高。对一些人来说,这个差距是巨大的: •GPT 5.6 Luna: 0.40→0.72 •glm-5.3: 0.60→0.84 •最小最大值M3: 0.31→0.63 引入了一些关于评估所衡量的大问题:编写代码的能力,还是找到答案的能力? 评估来自SWE-rebench, SWE-smith, Atlas QnA等的任务。打开原帖#511482