51 秒出一份带引用的科学报告:Ai2 把 Asta 的「快枪手」AstaBrief 开源了
💡 一句话总结:Ai2 于 10 月 2 日开源了 AstaBrief 8B——一个「研究问题 + 检索好的文献片段」直接一次成文、输出带引用科学报告的开源模型(Qwen3-8B 底座,SFT+DPO 训练)。在 Asta 平台上它把出报告的时间从 178.5 秒压到 51.1 秒(约 3.5 倍提速),引用质量在多项指标上与 Claude 驱动的管线打平。权重、数据和本地部署示例全部开放。
先问一个写过文献综述的同学都懂的问题:让大模型帮你写综述,最怕什么?
不是它不会写,是它张口就来——句子漂亮、逻辑顺滑,但引用是编的,或者「这个研究说的是 A,它给你推广成了 A+」。科研场景里这叫把证据的强度悄悄放大了,是要出事的。所以正经的科研 AI 工具都在死磕两件事:答案要钉在证据上,以及你得能核查它。
Ai2(Allen Institute for AI,就是做 OLMo、Semantic Scholar 那家非营利机构)的科学代理平台 Asta 上,「生成报告」一直用的是 Claude 驱动的多步管线:先把检索到的文献片段做摘要、聚类,再分节撰写——质量好,但慢,而且闭源 API 捏在别人手里。
10 月 2 日,Ai2 把这个环节里自己练的模型开源了。
想自己动手?资源在这:
- 🤗 模型权重 · allenai/AstaBrief_8B
- 📝 官方博客 · Open-sourcing AstaBrief(HF 镜像)
- 🔧 本地部署示例 · ai2-scholarqa-lib lite workflow
🎯 AstaBrief 是个啥:不是检索器,是「报告书写员」
先把分工说清楚,这是很多人会误解的点。
AstaBrief 8B 不做检索。它的输入是两样东西:你的研究问题,加上前置管线已经检索好、排好序、带稳定来源 ID 的文献片段。它的输出是一篇一次成文的带引用报告。
在 Asta 里,它现在的身份是「Generate a report」功能的 Fast 模式,和 Claude 驱动的 Thinking 模式并排放着。区别在于管线结构:
- Thinking 模式(Claude 管线):检索 → 片段摘要 → 聚类组织 → 逐节撰写。每一步都是一次昂贵的专有模型调用。
- Fast 模式(AstaBrief):检索 → 直接一次生成完整报告。中间的摘要、聚类、分节全部跳过。
为什么会这样?答案就藏在它的定位里——报告是给研究者当草稿用的,先快速给你一版能核查的东西,然后你在后续对话里迭代。既然是草稿,何必每一版都走全套仪式?官方的实测结论是:跳过这些阶段,质量没有崩(后面看数据)。
🍳 怎么训的:不搞 RL,死磕数据
技术路线官方写得很大方,核心一句话:SFT + DPO,明确不用 RL。
为什么不用 RL?官方的理由很实在:RL 训练不稳定、贵、难调试。他们想验证的是——用更便宜、更好运维的配方,能把报告生成质量推到哪。这也让整个项目更容易复现和迭代(他们之前 RL 路线的成果叫 DR Tulu,也开源了,两条路线可以对照看)。
SFT(监督微调):4.7 万条样本。
- 底料是 Asta/ScholarQA 系统里真实科研用户的查询——不是合成 prompt。过滤掉机器人流量、太短的、非英文的、非科研的、带隐私的,剩 9 万条。
- 每条查询用 ScholarQA 管线(混用 Claude 3.5/3.7 Sonnet、o3、o4-mini、GPT-4.1 做报告生成)产出完整报告做训练目标,质量过滤后留 4.7 万条。
DPO(直接偏好优化):约 6 千对。
- 同一个问题的两份报告:一份来自 Claude 管线(正例候选),另一份让 o3/o4-mini/DeepSeek-V3/DeepSeek-R1 直接吃检索片段现写(负例候选)。
- 关键设计:GPT-4.1 和 DeepSeek-R1 两个评委对拼,与人类偏好一致性 95%,且两个评委都同意才保留这对数据。不把任何单一模型当标准答案。
这套「多生成器 + 双评委一致才留」的流程,算是给「怎么规模化造偏好数据」提供了一个可抄的作业——不需要人类逐条标注,又不至于被单个评委的偏见带跑。
🔍 最值钱的细节:引用密度过滤
整个项目里官方自己最强调的发现,是一个听起来平平无奇的过滤器。
他们给合成训练数据试了四个统计过滤指标:输出/输入 token 比、引用相关性、引用密度、引用多样性。结果收益最大的,是把「引用密度低」的报告扔掉——也就是那些大段大段陈述不带引用的样本。
这个发现反过来说也成立:模型学会「句句有出处」,靠的不是往预训练里塞更多科学文献,而是后训练数据里有没有演示这种行为。对做垂直领域微调的团队来说,这是个成本低到离谱的有效信号——你不需要复杂的过滤系统,先检查训练数据里该带引用的地方带没带引用。
(当然,这是他们在这个项目里的结论,不是普适定律——但它便宜到值得你先试。)
📊 效果:快 3.5 倍,质量没崩
先看速度,这是最没有争议的部分:
| 指标 | Fast 模式(AstaBrief) | Thinking 模式(Claude 管线) |
|---|---|---|
| 全管线平均出稿时间 | 51.1 秒/篇 | 178.5 秒/篇(约 3.5×) |
| 生成环节相对专有模型 | 官方称接近一个数量级缩减 | 基准参照 |
质量层面,主评估基准是 SQABench-CS2(200 个真实用户手写的计算机科研问题),四个指标:rubric 分数(内容覆盖度)、答案精确率(段落是否切题)、引用精确率(引用是否真的支撑论点)、引用召回率(论点是否被引用充分支撑)。
结果怎么说:
- 在开发评估中,AstaBrief 与 Claude 管线、DR Tulu 在多项答案/引用质量指标上有竞争力——注意不是全面碾压,是「打平感」。
- 14 道题的小规模人类研究(3 名科研人员):总偏好 DR Tulu 第一,但 3 人中有 2 人在引用准确性上更偏好 AstaBrief。
- 真实使用数据(374 名 Asta 用户):29.1% 用了 2 天以上;人均生成 3.67 个报告线程;23% 的人试过 Fast 之后再没切回 Thinking;正反馈率 84.2% vs Thinking 的 85.2%——基本持平。
这里要给 Ai2 的诚实点个赞:官方博客明确写了「大部分训练和评估在 2025 年完成,对比的专有模型反映的是当时的前沿,没有对今天的前沿模型重跑全量评估」。这话说得很清楚——这组数字证明的是「这套训练和系统设计选择有效」,不是「这个 8B 模型能打过今天的 Claude」。
🏠 对你有什么用:私有部署是刚需场景
开源这个动作的真实价值,对学术机构和企业的场景很具体:科研问题经常涉及敏感的、未发表的工作,这类内容不能送到第三方 API。AstaBrief 开放权重后,机构可以在自己防火墙里跑完整的报告生成。
社区里已经出现了实践路线:用 vLLM 部署 AstaBrief,前面接自己的文档解析和检索,只把排好序的证据片段喂给模型——整个「私有 RAG + 报告生成」链路都不出网。Ai2 官方也在 GitHub 上放了可改造的示例工作流,支持从自己的 PDF 库生成报告。
位置感也要摆对。拿它和同赛道工具比:
- OpenScholar:广域文献综述的强默认选项;
- PaperQA2:受控 PDF 文集的问答更实用;
- AstaBrief:检索已经做好之后,快速把证据变成带引用初稿的那一环。
它不是要替代你的检索器,是接在检索后面提效的。
🧊 泼点冷水
把话说完整,三个边界要心里有数:
- 对比对象是「当时的前沿」:前面说过,2025 年的对比基线,没和今天的前沿模型重跑。引用它的时候别把「打平 Claude」说成现在时。
- 主基准偏窄:SQABench-CS2 是 200 道计算机领域问题 + 63 道 DeepScholarBench,生物医学等其他领域的泛化没有充分验证;人类研究只有 14 题 3 人,统计力度有限。
- 引用对了 ≠ 证据强度对了:官方自己点出的深水区——模型可以引用正确的论文,却把「某个样本上的发现」悄悄说成「普遍结论」,把描述性结果说成行动建议。这种「范围放大」目前还没有进入它的评估体系,官方列为未来工作。(uncertain:生产环境中引用幻觉率的纵向数据,官方未披露)
写在最后
AstaBrief 这类发布最有趣的地方,不是「8B 打平专有模型」这个标题,而是它再次验证了一个对资源有限的团队友好的结论:在垂直场景里,后训练数据的质量和构成,比训练方法的复杂度更重要。4.7 万条带引用的报告、6 千对双评委筛过的偏好数据、一个「引用密度」过滤器——没有 RL,没有从零预训练,做出的是一个已经在线上服务真实用户的模型。
你的场景里如果也有「把检索结果变成结构化产出」的环节,这套配方值得认真读一遍官方博客——毕竟权重和数据都摆在那,复现的门槛已经替你降好了。
参考来源
- Ai2 官方博客:Open-sourcing AstaBrief, the fast report-generation model in Asta(2026-10-02,一手信源)
- Hugging Face 官方账号博客镜像:Open-sourcing AstaBrief
- 模型权重:allenai/AstaBrief_8B;训练数据集合:allenai astabrief collection
- 本地部署示例:ai2-scholarqa-lib · lite workflow(GitHub 官方工作流示例)
- 独立报道:Ai2 open-sources AstaBrief 8B(aicoder,2026-10-03);AstaBrief 8B: Ai2 Open-Sources Fast Scientific Report Model(TPS Report)
- 背景工作:ScholarQA(ACL 2025 demo);DR Tulu(Ai2 RL 路线,可对照)
浙公网安备 33010602011771号