Rohan Paul
@rohanpaul_ai
Nvidia 的新论文:随着作业变长,人工智能模型会变得更加草率,即使在上下文窗口内也是如此,因此请对每个项目进行编号,并将大作业分成小块。
模型大小并不能保证长时间重复性工作的可靠性
想象一下一个代理逐行更新一个巨大的发票文件。它可以读取整个文件,但仍然可以跳过一行或更新错误的记录。
NVIDIA 在简单、重复的工作(例如添加数字和排序列表)上测试了 7 个开放模型。 128K 令牌作业的平均准确度比 4K 令牌作业低 62.8%。
即使是最好的模型,在最长的工作中也只有 17.1% 能够正确完成所有项目。这些模型似乎理解了任务,但失去了自己的位置,尤其是当物品没有 ID 号时。
如果您的代理处理长列表,请为每个项目提供一个 ID,小批量处理它们,并检查输出的每一行。
– arxiv。 org/abs/2609.38712
标题:“专注于任务:测试长期代理可靠性的基础”