AI21 Labs

@AI21Labs

我们让开放模型在评估来自公共基准的任务时访问外部世界。事情是这样的: 大多数人去发现上游提交包含他们应该解决的任务的修复。 在所有模型中,当代理找到解决方案时,得分都更高。对一些人来说,这个差距是巨大的: •GPT 5.6 Luna: 0.40→0.72 •glm-5.3: 0.60→0.84 •最小最大值M3: 0.31→0.63 引入了一些关于评估所衡量的大问题:编写代码的能力,还是找到答案的能力? 评估来自SWE-rebench, SWE-smith, Atlas QnA等的任务。
打开原帖#511482
  1. 产业

    Elon Musk:超级智能
  2. 产业

    Alexandr Wang:Muse 笑死我了
  3. 产业

    Alexandr Wang:一图胜千言