Ethan Mollick@emollick2026年9月16日 22:40公共人工智能基准测试的现状十分严峻,这削弱了我们理解当前人工智能水平的能力。 大多数著名的测量指标已经达到上限,并且正如本文所示,未达到饱和的基准测试充满了如此多的错误,以至于大大低估了人工智能的能力。打开原帖#511482