Ai2 在 Hugging Face 发文,开源 AstaBrief 8B。它做的事很窄:输入一个研究问题,以及检索到的文献摘录,输出一篇带引用的报告。今天它已经出现在 Asta 的生成报告功能里,叫做 Fast 模式,旁边仍保留由 Claude 支持的 Thinking 模式。权重、训练数据,以及一份可以改成用自己的 PDF 出报告的示例工作流,一起公开。开放权重是为了让机构在自己的机器上跑,包括那些问题本身会暴露未发表工作的情况。

[1]
薄纸上沿有一条蓝黑长线,左缘露出五片空白索引片,线的下方是大片空白。
纸的上沿是一条一次画完的蓝黑线,右端停在一个墨点。左缘有五片空白索引片,线下面几乎是空的。对应整篇报告一次写成,分节的卡片没有用上。这是插画,不是界面截图。, AI 生成插画,不是新闻照片

起点是 Qwen3-8B。他们考虑过用强化学习做长文报告,最后选了监督微调和直接偏好优化。文章的理由是,强化学习可能不稳定,也更贵;他们想知道一套更便宜、更好排查的流程,能把报告质量推到多远。

监督数据来自真实用户查询,不是只靠合成题。去掉测试账号、机器人流量和过短问题,再用模型过滤非英语、非科研和含个人信息的提示之后,剩下 9 万条以研究为中心的查询。目标报告由 ScholarQA 的多步流水线生成,背后用过 Claude 3.5 Sonnet、Claude 3.7 Sonnet、o3、o4-mini 和 GPT-4.1。质量过滤后,可用样本是 4.7 万条。

偏好数据用的是另一批没有参与监督微调的查询。每条查询配两份报告,由 GPT-4.1 和 DeepSeek-R1 两个评判挑选。文章写,评判与人类偏好的一致率是 95%,并且只留下两个评判意见相同的配对。过滤之后,直接偏好优化大约 6000 条。

[1]

速度来自改写流水线。给定问题和相关片段,模型一次写出整篇报告,不再像 Thinking 模式那样先摘要、再聚类,也不再一节一节写。文章说,这样做没有把质量换掉。

同一段里有两句不能合成一句。一句是:相对他们跟踪的专有模型,生成时间接近下降一个数量级。另一句是:整条 Asta 流水线里,Fast 模式平均每份报告 51.1 秒,Thinking 模式 178.5 秒,大约快 3.5 倍。3.5 倍比的是这两种模式的流水线耗时,不是相对所有专有模型的倍数。

[1]

开发期的主评测是 SQABench-CS2,200 道用户写的计算机科学研究题,分开看覆盖、段落是否切题、引用是否支撑它所挂的主张,以及主张是否被引用盖住。DeepScholarBench 有 63 条查询,它的指标不能和 SQABench-CS2 对照着读。第一轮监督微调提高了内容,但答案精度和引用质量仍落后于 Claude 那条流水线。他们试了四种统计过滤,收益最大的是去掉引用密度低的合成报告。更严的过滤、几种过滤叠在一起,以及学习率扫描,都没有再带来明显收益。正文里的图给出了比较,具体分数印在图上,文字没有列出,这里不补。

一项 14 题的人类研究里,三位科研人员各出 4 到 5 题,给三个系统排序,允许并列。总体偏好是 DR-Tulu 更高。三位里有两位在引用准确性上更倾向 AstaBrief。这是三个人的样本。

Fast 模式的早期使用:374 名试过的用户中,29.1% 用了两天或更久,平均每人 3.67 条报告线程。试过之后,23% 的人后来的线程没有再回到 Thinking。另外 18% 会按目标在两种模式之间换,Fast 大约占他们线程的 40%。正面反馈的比例是 84.2%,Thinking 是 85.2%。文章写,反馈太稀,不能由此下很强的结论。

训练和评测大多在 2025 年完成。用来造数据、用来对照的专有模型,反映的是当时的前沿。他们没有对照今天的前沿模型把整套评测重跑一遍。这些数字最好读成当时那套数据和系统设计的结果,而不是这颗 8B 现在处在什么位置。

[1]

要点

  • AstaBrief 8B 从 Qwen3-8B 做监督微调和直接偏好优化,一次写成带引用的报告。
  • 过滤后约 9 万条查询、4.7 万条监督样本、约 6000 条偏好对;两个评判一致才保留,与人类一致率 95%。
  • 整条流水线 Fast 平均 51.1 秒,Thinking 178.5 秒。另一句写接近一个数量级,两句不是同一个倍数。
  • 374 名用户里 29.1% 用了至少两天。训练和评测大多在 2025 年,未对照今天的前沿重跑。