9 月 23 日提交的 arXiv 论文(arXiv:2609.28449)提出 SWE-Flux:一个面向代码动态执行推理的仓库级基准。它包含 480 个"执行落地"实例,覆盖 12 个真实 Python 仓库;金答案不是人工编写、也不是交给 LLM 判定,而是由插桩后的测试执行自动采集。基准覆盖单测与多测问题下的控制流、循环、程序状态、数据流、异常与程序不变量。评估 5 个 LLM 后作者发现:最佳模型准确率只有 37%,模型在不变量、过程内控制流、异常与简单循环上表现较好,却在数据流、跨过程执行、精确状态推理与套件级聚合上明显吃力。
[1][2]这篇论文想回答一个很具体的问题:LLM 写代码能写对,但它能不能"想明白代码跑起来会发生什么"?现有仓库级问答基准大多测静态理解,且常用 LLM 打分;执行推理基准又多局限在片段或单函数。SWE-Flux 的差异在两处——一是尺度,把执行推理放到真实仓库级别;二是答案来源,金答案由插桩测试执行自动产出,绕开了"LLM 给自己判卷"的循环。这个设计本身就把"运行时行为推理"从评测方法论上独立出来。
结果部分(论文自报口径)最有信息量的是强弱项的分化:模型能处理局部化行为(不变量、过程内控制流、异常、简单循环),但一遇到数据流、跨过程执行、精确状态推理和"多测试聚合到套件结论"就崩——最佳模型整体只有 37% 准确率。这个分化指向一个可操作结论:LLM 的"执行直觉"是局部性的,缺少在仓库层面追踪变量在过程间流动、并把多个测试结果汇总成一条结论的全局推理能力;对真实工程的帮助在于,这类任务恰好是静态分析工具与测试框架的强项,补位方式未必是让模型更强,而是让它学会调用工具。论文还展示了一条副产品:用输入扰动自动生成基准新变体,近 90% 的选中实例能产出有效且更难的新变体——这意味着基准可以低成本扩充,避免"刷完就饱和"。
口径与局限:全部结果来自论文自报;基准仅覆盖 Python(12 个仓库、480 实例),评测模型 5 个,跨语言、跨规模的泛化未验证;金答案依赖插桩执行的正确性,复杂仓库的覆盖率未展开。放回研究脉络,它与"让模型调用执行工具"的一批工作同向:与其祈祷 LLM 凭空想对运行时行为,不如把执行本身交给真实解释器,让 LLM 负责推理与决策——SWE-Flux 的价值正是把这个分工需要的评测地基先搭出来。
[1][2]