Ai2 于 10 月 2 日发布了 AstaBrief 8B,作为 Asta“生成报告”功能中快速模式所使用的模型。这个可下载模型接收研究问题和从科学论文中检索到的摘录,然后一次性生成带引文的报告。对研究人员来说,关键区别在于论文从何而来,以及引文实际支持什么:AstaBrief 根据提供的证据写作;它本身并不是文献检索服务。Ai2 的发布公告和模型卡都说明了这一边界。
重大变化
- 变化:Ai2 将 AstaBrief 用于 Asta 在线提供的快速模式,并公开发布了模型权重和训练材料。
- 意义:据 Ai2 称,研究团队可以检查或改编报告生成器,并在自己的基础设施上运行开放权重模型。
- 关注点:报告质量取决于检索到的文献;每个重要主张都需要对照来源核查。Asta 由 Claude 驱动的“思考模式”仍是另一种独立的多步骤选项。
从问题到报告
在线托管流程从Asta 的“生成报告”功能开始,其中快速模式使用 AstaBrief。Ai2 表示,报告系统会先检索相关文献,再把问题和摘录交给模型。随后模型一次性撰写报告,不会像“思考模式”那样经历引文提取、聚类和逐节起草。公开的 ScholarQA 代码库介绍了如何通过 Semantic Scholar 的段落检索和关键词搜索获取文献,再进行重新排序;其精简版实现根据重新排序后的参考文献构造提示,并调用配置好的生成器。这些是有文档记录的组件,并非 BIG CHANGE 对 Asta 在线服务进行的测试。
对于可下载模型,AstaBrief 模型卡建议使用其链接的提示格式,并输入研究问题和各章节参考文献。模型卡提供了示例transformers/vLLM推理代码,最大输出长度为 4,096 个 token。卡片示例将model_name 设置为SFT 检查点,而页面本身描述的是之后经 DPO 微调的AstaBrief_8B;研究人员选择检查点时应先解决这一不一致,而不应假定示例按原样运行的就是最终模型。Ai2 还链接了ScholarQA 精简版示例代码,研究人员可以据此改编用自己的 PDF 生成报告。该链接目录提供的是代码,并未将其说明为开箱即用的 PDF 方案,也没有给出最低硬件要求。
因此,本地实验可以按一个实用流程开展:取得自己获准使用的论文;提取并选择相关段落,同时保留论文标识;按照模型卡的建议组织问题和参考资料;运行选定的检查点;最后对照这些段落和原始论文检查生成的报告。这些是资料中记载的组成部分,并非 BIG CHANGE 实际执行过的步骤。要完整复现本地流程,还需要模型权重本身不包含的检索、PDF 解析、参考资料处理和服务部署方案。
使用文字前先核验证据
从检索开始。记录查询内容,以及提供给生成器的论文或 PDF 集合。遗漏一项研究或纳入无关摘录,都可能在 AstaBrief 写下任何文字之前扭曲答案。然后打开每篇被引用的论文,核对重要主张。确认引文所指段落确实支持对应句子,包括适用人群、方法、日期和确定性程度。引文本身真实且相关,并不意味着报告没有把某个样本中的结果扩大到整个领域,或把描述性发现改写成建议。Ai2 在其发布公告中明确指出了这种主张范围失真的问题。
最后,查找重要但没有引文支撑的主张,并注意报告是否反复依赖检索到的少数几篇论文。Ai2 表示,筛选训练报告并提高引文密度,改善了其开发结果。这项发现说明了归属标注的重要性,但引文密度本身无法证明被引用的主张忠实于原文。应将生成报告视为一份工作中的综合稿,对照论文进行修订;尤其是在研究中引用它或据此作出重要决策之前。
公开评估能够证明什么
Ai2 报告称,在 Asta 整体流程中,快速模式平均每份报告耗时51.1 秒,而思考模式耗时178.5 秒,在这项比较中约快 3.5 倍。其模型卡报告了 AstaBrief 在 ScholarQA-CS2 计算机科学问题集和 DeepScholarBench 上的结果;发布公告还介绍了一项单独的小规模人工比较:3 名研究人员共提出 14 个问题。这些是 Ai2 对其系统和测试集所做的评估,并非对任何特定报告准确性的独立验证。公告称,大部分训练和评估工作在 2025 年进行,完整评估没有针对当前前沿模型重新运行。
该最终检查点采用 Apache 2.0 许可证公开发布;Ai2 在AstaBrief 资料汇总页列出了训练数据集和提示。模型卡表示,该模型面向研究和教育用途,使用时应遵循 Ai2 的负责任使用指南。训练说明提到,DPO 训练使用了 8 张 H100 GPU;这并非已公布的推理最低配置。我们查阅的主要资料没有提供在线 Asta 每份报告的价格、本地运行所需的最低 GPU 配置,或可靠的单份报告本地成本。任何计划部署的人都需要针对自己的配置核算这些成本。
来源与延伸阅读
- Ai2 10 月 2 日的发布公告介绍了在线快速模式、一次性生成设计、耗时数据和评估局限。性能主张来自 Ai2 自身。
- AstaBrief 8B 模型卡说明了许可证、预期用途、提示建议和推理示例,其中示例注明了 SFT 检查点名称。
- AstaBrief 资料汇总页列出了已发布的检查点、数据集和提示;这些资料的存在并不证明本地端到端复现已经可行。
- ScholarQA 代码与文档介绍了检索系统;精简版生成器展示了如何将重新排序的参考文献转换为一次性生成提示。我们查看了文档和代码,但没有运行它们。
- ScholarQA-CS2 评估代码库提供了基准测试代码和数据,包括评分标准的构建方式。它有助于解释测试设计,但不是对 AstaBrief 所报告分数的独立验证。



