Tencent Hy
@TencentHunyuan
新研究:我们正在发布ExplorationBench,这是一个衡量人工智能系统如何探索的基准。
科学发现始于已知问题的终结:系统必须构建假设,设计实验,并从结果中学习。评估这一点很难。真正的新答案不能被快速检查,在熟悉的领域,模型只能简单地回忆它所看到的。
为了应对这一挑战,来自腾讯、复旦大学和清华大学的研究人员构建了可验证的外星世界。它们的规则是可执行的,所以每个答案都被精确地检查过,它们与熟悉的知识相冲突,所以单靠回忆是无法解决任务的。
🔹两个沙箱:AlienCode(31个隐藏规则更改,70个任务)和AlienLogic(24个修补的推理规则,70个定理)
🔹一本有缺陷的手册,四轮自行设计的探针,每轮之后进行闭卷测试
🔹每个答案都由翻译或校对人员评分,没有法学硕士评委
我们在10个前沿AI系统中发现:
1️得到反馈比独自思考更有效。没有AlienCode运行启动高于15.7%;四个回合后,最好的分数达到89.0%,而相同回合没有反馈的分数则停留在0.5-11.0%。
2️#设计实验很重要。在AlienCode中,10个系统中有9个系统的表现比他们自己选择探针时还要差。
3️知道一个规则就是不去使用它。即使每个必需的规则都正确地陈述了,任务的解决率也只有73.4%。
4️1分隐藏了很多。在同样的预算下,同样的系统的结果从5.7%到79.0%不等,两个世界的排名几乎没有变化。
CL-bench询问模型是否可以从环境中学习。ExplorationBench询问他们是否可以自己发现规则。
📄论文:https://t.co/eamwrsJyxQ
🌐网站及排行榜:https://t.co/gxSeoCfc2s
📝博客:https://t.co/jyrwH7ZnQH
💻代码(即将发布):https://t.co/i7VlgErkcl