Rohan Paul
@rohanpaul_ai
新耶鲁大学(Yale Univ) + 其他顶级实验室论文显示,前沿模型已经接近了今天封闭式物理基准的最大化。
而许多明显的失败来自于不良的问题,错误的参考答案,而Brittle分级器解释了大多数被审计的物理故障,使得基准质量成为衡量前沿模型的新瓶颈.
研究者有物理学家在6个流行的物理基准中重新检查模型故障,而不是信任原始的分数.
在4个经审计的基准子集的250个被驳回的案件中,只有12个是实际模型错误。
其他238则来自问题差,参考答案错误,或分级者拒绝正确答案.
经过专家审查,GPT-5.6-Sol测得的HLE物理分数从47.3%上升到78.7%.
因此,低物理基准分数可以严重低估前沿模型实际能解决的问题.
但这并不意味着这些模型能够可靠地进行物理学研究:作者的代理人仍然未能完全解决他们尝试过的任何开放的理论-物理问题.
但这确实意味着不再将基准分数视为AI物理能力的干净地面真理.