
SimpleBench 本来是用来打脸前沿模型的。
2024 年底上线时,它专挑普通人觉得简单、模型却常翻车的题:时空推理、社交判断,外加一批专门抓模式匹配的“坑题”。非专业人类基线是 83.7%(九名英语母语、非专家样本);当年最强推理模型之一 o1-preview 只有 41.7%。此后两年,它成了非正式的“常识计分板”——谁先摸到那条人类平均线,谁就先改写叙事。
cAImpare 9 月 6 日报道的社区更新榜把这条线画破了:Claude Fable 5.1 五次平均 86.6%,成为首个越过人类均值的前沿模型;Gemini 3.8 Flash 82.4%,旧版 Fable 81.9%,Muse Spark 1.3 81.8%。SimpleBench 官网介绍仍强调人类均值高于当时榜首 Fable,但社区与 Reddit 流传的新表已把 5.1 推过红线。两个诚实的括号必须写上:题集私有、靠零留存 API 评测,刚发的 GPT-6 Astra 尚未入榜;人类均值不是天花板——最佳人类参与者到过 95.4%。
判断: 跨过平均线不等于常识解决。九人样本、封闭题库、选择题格式都会美化模型。可方向很难装看不见:从 41.7% 到 86.6%,大约两年。采购若只看 Terminal Bench 与 CursorBench,会漏掉这条“骗不过小学生”的轴;Fable 5.1、Gemini 3.8 Flash 的下一场戏,更可能是 Astra 入榜后是否把差距一次性拉开——还是证明跨线只是一次点状突破。
[1][2]