跳到正文
ByteWoops | AI 观察员
首页
报道原帖
Opus 5.5喵 AI关于
中文EN
搜索登录
ByteWoops | AI 观察员
首页

最新

报道原帖
Opus 5.5喵 AI关于
登录English

Tencent Hy

@TencentHunyuan

2026年9月30日 21:29

新研究:我们正在发布ExplorationBench,这是一个衡量人工智能系统如何探索的基准。 科学发现始于已知问题的终结:系统必须构建假设,设计实验,并从结果中学习。评估这一点很难。真正的新答案不能被快速检查,在熟悉的领域,模型只能简单地回忆它所看到的。 为了应对这一挑战,来自腾讯、复旦大学和清华大学的研究人员构建了可验证的外星世界。它们的规则是可执行的,所以每个答案都被精确地检查过,它们与熟悉的知识相冲突,所以单靠回忆是无法解决任务的。 🔹两个沙箱:AlienCode(31个隐藏规则更改,70个任务)和AlienLogic(24个修补的推理规则,70个定理) 🔹一本有缺陷的手册,四轮自行设计的探针,每轮之后进行闭卷测试 🔹每个答案都由翻译或校对人员评分,没有法学硕士评委 我们在10个前沿AI系统中发现: 1️得到反馈比独自思考更有效。没有AlienCode运行启动高于15.7%;四个回合后,最好的分数达到89.0%,而相同回合没有反馈的分数则停留在0.5-11.0%。 2️#设计实验很重要。在AlienCode中,10个系统中有9个系统的表现比他们自己选择探针时还要差。 3️知道一个规则就是不去使用它。即使每个必需的规则都正确地陈述了,任务的解决率也只有73.4%。 4️1分隐藏了很多。在同样的预算下,同样的系统的结果从5.7%到79.0%不等,两个世界的排名几乎没有变化。 CL-bench询问模型是否可以从环境中学习。ExplorationBench询问他们是否可以自己发现规则。 📄论文:https://t.co/eamwrsJyxQ 🌐网站及排行榜:https://t.co/gxSeoCfc2s 📝博客:https://t.co/jyrwH7ZnQH 💻代码(即将发布):https://t.co/i7VlgErkcl
打开原帖#511482

相关阅读

  1. 产业

    Elon Musk:Starship 第14次飞行2026年10月1日
  2. 产业

    Elon Musk:Starship 将把更大的望远镜送入轨道、并在月球上部署巨型望远镜,从而…2026年10月1日
  3. 产业

    Alexandr Wang:欢迎来到 muse2026年10月1日
ByteWoops | AI 观察员

独立、严谨、可追溯的 AI 前沿资讯。

了解更多报道原帖喵 AI关于投稿技能
用户中心登录用户中心Agent API
每周研究简报

人工智能研究、系统与社会

RSS
© 2026 ByteWoops隐私