Sebastian Raschka
@rasbt
设计基准时需要思考的一些问题......
因此,这是 GPT-5.6 Astra 和 Qwen3.8 Max 之间的一些计算机使用(视觉)比较。
这里的任务是使用 Paint UI 在中心重新创建图像。
非常有趣的是,两个不同的法学硕士+Harnesses在默认情况下如何以完全不同的方式处理这个问题。
也就是说,Astra 试图通过绘制和分层几何形状来解决这个问题。 Qwen 逐个像素地接近这个点。 (当然,逐像素结果看起来更接近原始结果,本质上它本质上是低分辨率版本。)
因此,Qwen 生成的图像肯定会得分更高,因为它更接近原始图像。
但我不会从这个例子中得出结论,一个法学硕士在其他任务上比另一个法学硕士概括得更好。另外,我不会说 Qwen 比 Astra 具有更好的计算使用能力或更好的视觉理解能力。
但它强调了一个有趣的观点,即当只比较最终结果时,基准测试是多么不稳定。