Sebastian Raschka

@rasbt

设计基准时需要思考的一些问题...... 因此,这是 GPT-5.6 Astra 和 Qwen3.8 Max 之间的一些计算机使用(视觉)比较。 这里的任务是使用 Paint UI 在中心重新创建图像。 非常有趣的是,两个不同的法学硕士+Harnesses在默认情况下如何以完全不同的方式处理这个问题。 也就是说,Astra 试图通过绘制和分层几何形状来解决这个问题。 Qwen 逐个像素地接近这个点。 (当然,逐像素结果看起来更接近原始结果,本质上它本质上是低分辨率版本。) 因此,Qwen 生成的图像肯定会得分更高,因为它更接近原始图像。 但我不会从这个例子中得出结论,一个法学硕士在其他任务上比另一个法学硕士概括得更好。另外,我不会说 Qwen 比 Astra 具有更好的计算使用能力或更好的视觉理解能力。 但它强调了一个有趣的观点,即当只比较最终结果时,基准测试是多么不稳定。
打开原帖#511482
  1. 研究

    Andrew Ng:过去两周,引发对人工智能危险担忧的最响亮的声音取得了巨大进展
  2. 研究

    Jeff Dean:很自豪能与许多其他人在其中很多事情上合作
  3. 研究

    Jeff Dean:Waymo的安全数据越来越好