Rohan Paul

@rohanpaul_ai

新耶鲁大学(Yale Univ) + 其他顶级实验室论文显示,前沿模型已经接近了今天封闭式物理基准的最大化。 而许多明显的失败来自于不良的问题,错误的参考答案,而Brittle分级器解释了大多数被审计的物理故障,使得基准质量成为衡量前沿模型的新瓶颈. 研究者有物理学家在6个流行的物理基准中重新检查模型故障,而不是信任原始的分数. 在4个经审计的基准子集的250个被驳回的案件中,只有12个是实际模型错误。 其他238则来自问题差,参考答案错误,或分级者拒绝正确答案. 经过专家审查,GPT-5.6-Sol测得的HLE物理分数从47.3%上升到78.7%. 因此,低物理基准分数可以严重低估前沿模型实际能解决的问题. 但这并不意味着这些模型能够可靠地进行物理学研究:作者的代理人仍然未能完全解决他们尝试过的任何开放的理论-物理问题. 但这确实意味着不再将基准分数视为AI物理能力的干净地面真理.
打开原帖#511482
  1. 产业

    Elon Musk:《@SpaceX 纪录片》新一集
  2. 产业

    Runway:你活动所需的每个版本都可以来自你已经拍摄的素材:画面中的不同颜色版本、另一…
  3. 产业

    Amazon Web Services:30%的电话从未拨通正确的地方