Rohan Paul

@rohanpaul_ai

Nvidia 的新论文:随着作业变长,人工智能模型会变得更加草率,即使在上下文窗口内也是如此,因此请对每个项目进行编号,并将大作业分成小块。 模型大小并不能保证长时间重复性工作的可靠性 想象一下一个代理逐行更新一个巨大的发票文件。它可以读取整个文件,但仍然可以跳过一行或更新错误的记录。 NVIDIA 在简单、重复的工作(例如添加数字和排序列表)上测试了 7 个开放模型。 128K 令牌作业的平均准确度比 4K 令牌作业低 62.8%。 即使是最好的模型,在最长的工作中也只有 17.1% 能够正确完成所有项目。这些模型似乎理解了任务,但失去了自己的位置,尤其是当物品没有 ID 号时。 如果您的代理处理长列表,请为每个项目提供一个 ID,小批量处理它们,并检查输出的每一行。 – arxiv。 org/abs/2609.38712 标题:“专注于任务:测试长期代理可靠性的基础”
打开原帖#511482
  1. 产业

    Elon Musk:Starlink V3部署美景
  2. 产业

    Elon Musk:这很酷
  3. 产业

    Sam Altman:dot 是迄今为止我最喜欢的 openai 产品! 让我惊奇的是,随着它更…