Rohan Paul

@rohanpaul_ai

这篇论文是对长期人工智能的残酷现实检验。如果给智能体一年的时间来进行相互关联的决策、延迟的反馈以及其过去行为的后果,那么它的性能相对于人类来说就会崩溃。 研究人员测试了八种领先模型,包括 GPT-5.6 Sol 和 Claude Opus 4.8。然而,表现最好的设置,Qwen3.7-Max with Hermes,最终只获得了人类参与者平均收入的 27.3%。 一个以仅为人类性能四分之一的系统完成长达一年的任务的系统远谈不上可靠的长期执行。
打开原帖#511482
  1. 产业

    Huawei:华为执行董事兼消费者BG董事局主席余承东介绍完全自主研发的华为XMAGE…
  2. 产业

    Huawei:华为推出Mate90系列,所有型号均配备旗舰τ芯片,包括全球首款逻辑折叠芯…
  3. 产业

    Huawei:华为执行董事兼消费者BG董事会主席余承东详细介绍了公司如何通过行业领先的5…