什么时候用
先判断任务是否合适
- 面对一个涉及多个子问题的复杂学术查询,需要系统性搜索而非简单关键词匹配
- 做文献综述时不确定用什么搜索词能覆盖研究问题的不同侧面
- 希望搜索一个主题的同时自动沿引用链扩展候选论文
- 需要区分“可能与问题相关”和“经筛选确认相关”的两个论文集合
先准备什么
材料越清楚,结果越有用
- •一个清晰的学术研究问题
- •Google Serper API 密钥(用于搜索 arXiv)
- •可下载的 Hugging Face 模型(Crawler 和 Selector)
- •Python 运行环境
它会怎样推进
从材料到可以检查的结果
- 01
拆分搜索式
Crawler 将复杂查询拆成多条互斥的搜索式,覆盖问题的不同侧面
- 02
并发搜索召回
用 Google Serper 按每条搜索式在 arXiv 上检索,合并形成候选论文池
- 03
相关性筛选
Selector 对每篇候选论文的标题和摘要做相关性打分,高于阈值则标记为召回
- 04
引用扩展
读取召回论文的引用列表,通过 ar5iv 获取章节内容后扩展新候选
- 05
输出搜索树
形成可评估的搜索树,记录各层召回数量和筛选决策,支持后续复现搜索过程
第一次这样开始
把仓库地址直接交给 AI
先让 AI 说明环境和风险,再完成最小安装验证。跑通以后,再把自己的真实材料放进去。
第一次直接复制
帮我安装这个库:https://github.com/bytedance/pasa 安装前先告诉我需要什么环境,安装后帮我跑通一个最小示例。
结果出来后
先看这些检查点
- 搜索树中每层候选论文是否逐篇标注了相关性分数和筛选状态
- 引用扩展的论文是否也经过了 Selector 的质量门
- Crawler 生成的搜索式是否确实互斥且覆盖了问题的不同维度
- 输出论文列表是否区分了“元数据候选”和“经阅读确认相关”
常见误区
这些判断仍由你负责
- 直接把 Selector 的“高于阈值”等同于“已阅读全文确认支持”——标题摘要相关性不等于全文质量
- 依赖搜索式生成覆盖所有侧面——如果问题本身有概念性缺口,搜索式会系统性地遗漏某一类文献
- 将搜索树当作一次性搜索结果使用——它的价值在于保留搜索策略,方便调整搜索式重新运行并对比召回差异
技术依据
查看能力拆解、验证范围与来源
技术依据
查看能力拆解、验证范围与来源
能力地图4 项已拆解能力
- 01
Selector相关性打分与候选筛选
把候选论文的标题和摘要,与用户查询做相关性判断,输出 selectscore,并把高于阈值的论文标记为召回结果。
- 02
搜索式生成与候选论文召回
把复杂学术查询转成多条互斥搜索式,并用 Google Serper 搜索 arXiv 论文,形成第一轮候选论文队列。
- 03
搜索树输出与召回评估
把搜索和扩展过程保存成论文树 JSON,并用标注答案集合计算 Crawler recall、Selector precision、recall 和 top-k recall。
- 04
论文全文章节读取与引用扩展
从候选论文读取 ar5iv 全文结构,让 Crawler 选择值得查看的章节,再沿章节引用标题扩展新的候选论文。
| 能力 | 主要输入 | 主要输出 | 人工检查 |
|---|---|---|---|
Selector相关性打分与候选筛选源码已核对 |
|
|
|
搜索式生成与候选论文召回源码已核对 |
|
|
|
搜索树输出与召回评估源码已核对 |
|
|
|
论文全文章节读取与引用扩展源码已核对 |
|
|
|
处理机制
- 01
核心处理链
把复杂学术问题拆成多条搜索式,自动检索并筛选最相关论文
已核对范围
- 已核对来源定位、公开入口和核心处理链
仍待核对
- 尚未完成真实环境运行和大规模输入验证
读取版本
2aaa6a9b1e48d24a2b7e21e8551f863dad9eeb84许可
Apache-2.0
最近核对
内容 2026-06-16
Stars 2026-07-11
已完成源码核对
相关文章
具备相关能力的其他库
相关课程
把单项工具放进完整研究设计流程
课程一从研究问题、文献判断、理论假设和方法骨架继续推进,帮助你建立可以复用的研究设计档案。