开源仓库bytedance/pasa1,622 Stars

PaSa

把复杂学术问题拆成多条搜索式,自动检索并筛选最相关论文

适合面对一个复杂学术问题时需要系统搜索而非简单关键词检索的研究者。PaSa 先为问题生成多条互补搜索式并发检索 arXiv,再用 Selector 逐论文判断相关性,支持从引用列表中扩展新候选,最终输出一棵可评估的搜索树。

bo老师判断:值得观察

方向值得关注,建议先确认当前任务是否真正需要它。

...互动状态已更新

什么时候用

先判断任务是否合适

  • 面对一个涉及多个子问题的复杂学术查询,需要系统性搜索而非简单关键词匹配
  • 做文献综述时不确定用什么搜索词能覆盖研究问题的不同侧面
  • 希望搜索一个主题的同时自动沿引用链扩展候选论文
  • 需要区分“可能与问题相关”和“经筛选确认相关”的两个论文集合

先准备什么

材料越清楚,结果越有用

  • 一个清晰的学术研究问题
  • Google Serper API 密钥(用于搜索 arXiv)
  • 可下载的 Hugging Face 模型(Crawler 和 Selector)
  • Python 运行环境

它会怎样推进

从材料到可以检查的结果

  1. 01

    拆分搜索式

    Crawler 将复杂查询拆成多条互斥的搜索式,覆盖问题的不同侧面

  2. 02

    并发搜索召回

    用 Google Serper 按每条搜索式在 arXiv 上检索,合并形成候选论文池

  3. 03

    相关性筛选

    Selector 对每篇候选论文的标题和摘要做相关性打分,高于阈值则标记为召回

  4. 04

    引用扩展

    读取召回论文的引用列表,通过 ar5iv 获取章节内容后扩展新候选

  5. 05

    输出搜索树

    形成可评估的搜索树,记录各层召回数量和筛选决策,支持后续复现搜索过程

第一次这样开始

把仓库地址直接交给 AI

先让 AI 说明环境和风险,再完成最小安装验证。跑通以后,再把自己的真实材料放进去。

第一次直接复制

帮我安装这个库:https://github.com/bytedance/pasa
安装前先告诉我需要什么环境,安装后帮我跑通一个最小示例。

结果出来后

先看这些检查点

  • 搜索树中每层候选论文是否逐篇标注了相关性分数和筛选状态
  • 引用扩展的论文是否也经过了 Selector 的质量门
  • Crawler 生成的搜索式是否确实互斥且覆盖了问题的不同维度
  • 输出论文列表是否区分了“元数据候选”和“经阅读确认相关”

常见误区

这些判断仍由你负责

  • 直接把 Selector 的“高于阈值”等同于“已阅读全文确认支持”——标题摘要相关性不等于全文质量
  • 依赖搜索式生成覆盖所有侧面——如果问题本身有概念性缺口,搜索式会系统性地遗漏某一类文献
  • 将搜索树当作一次性搜索结果使用——它的价值在于保留搜索策略,方便调整搜索式重新运行并对比召回差异

技术依据

查看能力拆解、验证范围与来源

能力地图4 项已拆解能力
  1. 01

    Selector相关性打分与候选筛选

    把候选论文的标题和摘要,与用户查询做相关性判断,输出 selectscore,并把高于阈值的论文标记为召回结果。

  2. 02

    搜索式生成与候选论文召回

    把复杂学术查询转成多条互斥搜索式,并用 Google Serper 搜索 arXiv 论文,形成第一轮候选论文队列。

  3. 03

    搜索树输出与召回评估

    把搜索和扩展过程保存成论文树 JSON,并用标注答案集合计算 Crawler recall、Selector precision、recall 和 top-k recall。

  4. 04

    论文全文章节读取与引用扩展

    从候选论文读取 ar5iv 全文结构,让 Crawler 选择值得查看的章节,再沿章节引用标题扩展新的候选论文。

能力主要输入主要输出人工检查

Selector相关性打分与候选筛选

源码已核对

  • 候选论文标题和摘要。
  • 用户查询。
  • Selector 模型。
  • 带 selectscore 的 PaperNode。
  • Crawler 召回集合。
  • Selector 通过集合。
  • 核对结果是否符合当前研究问题和证据边界

搜索式生成与候选论文召回

源码已核对

  • 用户学术搜索需求 userquery。
  • Crawler 模型。
  • Selector 模型。
  • 第一轮候选论文 PaperNode。
  • 按搜索式分组的 root.child。
  • 去重后的 touchids。
  • 核对结果是否符合当前研究问题和证据边界

搜索树输出与召回评估

源码已核对

  • PaperAgent.root 搜索树。
  • 可选标准答案 data["answer"]。
  • 输出目录 results。
  • 搜索树 JSON。
  • Crawler recall。
  • Selector precision 和 recall。
  • 核对结果是否符合当前研究问题和证据边界

论文全文章节读取与引用扩展

源码已核对

  • 已进入 papersqueue 的候选论文。
  • arXiv id。
  • ar5iv HTML。
  • 已扩展的论文树。
  • 章节到引用候选的边。
  • 新增引用候选论文节点。
  • 核对结果是否符合当前研究问题和证据边界

处理机制

  1. 01

    核心处理链

    把复杂学术问题拆成多条搜索式,自动检索并筛选最相关论文

已核对范围

  • 已核对来源定位、公开入口和核心处理链

仍待核对

  • 尚未完成真实环境运行和大规模输入验证

读取版本

2aaa6a9b1e48d24a2b7e21e8551f863dad9eeb84

许可

Apache-2.0

最近核对

内容 2026-06-16
Stars 2026-07-11

已完成源码核对

科研之我见

AI 可以参与科研的哪些环节?一张 11 环节工作流全景图

从选题、文献、理论、数据到投稿,逐环节判断 AI 可以主导、需要人工校验和必须由研究者把关的工作。

查看内容

科研之我见

如何从 300 篇候选文献中筛出 50 篇核心文献

把文献检索与筛选拆开,通过本地文献库、Zotero、外部数据库和引文追踪形成可回查的核心文献清单。

查看内容

文献 · 验证

paper-qa

从本地论文和文档中检索证据并生成带精确引用的科研答案

查看内容

文献 · 分析 · 写作

grobid

把学术论文PDF解析成结构化TEI XML,提取元数据、全文结构和参考文献

查看内容

文献 · 设计 · 分析 · 写作

Scientific-Agent-Skills

为AI科研代理提供文献检索、写作、统计、实验设计和同行评审的结构化能力。

查看内容

相关课程

把单项工具放进完整研究设计流程

课程一从研究问题、文献判断、理论假设和方法骨架继续推进,帮助你建立可以复用的研究设计档案。

查看课程一