5 分钟科研方法与流程方法流程

如何从 300 篇候选文献中筛出 50 篇核心文献

把文献检索与筛选拆开,通过本地文献库、Zotero、外部数据库和引文追踪形成可回查的核心文献清单。

文献检索科研方法
...互动状态已更新

在体系中的位置

在持续积累候选文献后,完成核心文献筛选和引文追踪。

文献工作流 · 第 2

如何从 300 篇候选文献中筛出 50 篇核心文献封面

科研工作流系列·01|这是系列第一篇深度拆解。上一篇我们画了11个环节的全景图,从这篇开始,一个环节一个环节地拆。第一个拆的,是大多数科研人每天都在做、但几乎没人做得高效的环节:文献检索。

同样是用AI做文献检索,为什么有人三天搞定三百篇,有人三天还在调ChatGPT的Prompt?

差距不在工具,在流程。

我见过太多人的文献检索方式:打开数据库,输入关键词,下载前两页结果,然后一篇一篇打开看摘要。看了二十篇觉得差不多了,开始写综述。写到一半发现漏了关键文献,回去重新搜。搜完发现又多了一堆,不知道哪些该读哪些该扔。

这个循环可以无限重复。

问题出在哪?出在把"检索"和"筛选"混在一起了。检索是撒网,筛选是收网,这是两个完全不同的动作。大多数人一边撒网一边收网,结果网越撒越乱,鱼越捞越少。

我花了大半年时间,在自己的供应链韧性研究项目里反复打磨,最终跑通了一套完整的文献筛选流程。核心思路是:先让AI从你的文献库里一次性筛出20到50篇高相关文献,然后分三轮从不同来源补充可能遗漏的论文。AI负责评分和分类,你负责在每一轮补充时做取舍判断。

这篇文章把这套流程完整拆给你看。

第一步:AI一次性筛选,从文献库直接锁定核心论文

这一步是整个流程的核心,也是AI发挥最大价值的地方。

你需要给AI三样东西:研究主题(一句话描述你的研究问题)、理论Gap(你要填补的研究空白)、关键词列表(按类别组织)。关键词我通常分三组:核心概念词、理论机制词、研究视角词。

拿我的供应链韧性项目举例:核心概念是"供应链韧性""数字化转型",理论机制是"资源编排""动态能力",研究视角是"双刃剑效应""数字鸿沟"。三组词交叉组合,覆盖面就够了。

AI拿到这些信息后,会在你的文献库里做两件事。

第一件:相关性评分。对每篇文献从两个维度打分,主题相关度和Gap契合度,各5分,满分10分。主题相关度看的是这篇论文和你的研究问题有多大关系;Gap契合度看的是它对你要填补的研究空白有没有直接帮助。两个维度加起来,分数高的留下。

第二件:角色分配。这一步很多人不知道AI能做,但它对后续写综述帮助极大。AI会给每篇筛出的论文分配一个角色:理论基础、机制解释、现象描述、方法借鉴、对照观点、实证证据。六个角色,对应综述中六种不同的引用方式。

这意味着筛选完成的那一刻,你手里拿到的不只是一个论文列表,而是一份带评分、带角色标签的结构化清单。每篇论文在你的综述里该放在哪个位置、起什么作用,AI已经帮你想好了。

这一步跑完,通常能从文献库里筛出20到50篇高相关文献。如果你的文献库积累够厚,这个数量可能就够用了。但大多数情况下,还需要从其他来源补充。

第二步:Zotero补充,捞回精选库里的遗漏

如果你用Zotero管理文献,这一步值得做。

Zotero里存的往往是你精挑细选过的论文,质量普遍比较高。AI会用你的关键词在Zotero里搜一轮,把搜到的结果和第一步的列表做去重,然后把新发现的论文展示给你。

注意,这一步AI不替你做决定。它会列出搜到的论文,附上标题、作者、年份、标签、期刊,然后问你:哪些要纳入?你可以选全部纳入,也可以只挑几篇,也可以一篇都不要。

你选中的论文会被AI用同样的标准打分、分配角色,然后合并到核心列表里。

第三步:外部搜索,从学术数据库发现新论文

本地文献库和Zotero覆盖的都是你已经读过或收藏过的论文。但总有你没见过的好论文。

这一步用三个学术数据源并行搜索:Semantic Scholar、OpenAlex、arXiv。AI会把你的中文关键词翻译成英文,组合成2到3个搜索查询,同时发给三个数据源。三个源的结果自动合并、自动去重、自动排除前两步已经有的论文,按引用数降序排列。

搜完之后,同样是展示给你看,你来决定哪些纳入。

这一步经常能发现惊喜。我在供应链韧性项目里,就是通过外部搜索发现了几篇2024年新发表的实证研究,本地文献库里根本没有,但对我的论证非常关键。

第四步:引文追踪,顺藤摸瓜找到隐藏的关键论文

这一步很多人不做,但它能捞回前三步都漏掉的论文。

原理很简单:如果一篇重要论文的标题和摘要里恰好没有你的关键词,关键词检索根本搜不到它。但如果它被你已经筛出的多篇核心论文引用,引文追踪就能把它找出来。

引文追踪分两个方向:正向引用(谁引用了这篇论文)和反向引用(这篇论文引用了谁)。你从前三步的结果里挑出几篇最核心的论文,AI通过OpenAlex的API批量获取它们的引用关系,去重之后展示给你。

我在供应链韧性项目里就遇到过这种情况。有一篇关于组织冗余理论的论文,标题里完全没有"供应链"和"韧性"这两个词,前三步全部漏掉了。但它被我核心文献中的四篇同时引用,引文追踪一下子就把它找出来了。这篇论文后来成了我理论框架的重要支撑。

最终产出:不只是一个列表

四步走完,你会拿到两份结构化文档,信息远比简单的论文列表完整。

第一份是引用索引。每篇论文按角色分类(理论基础、机制解释、现象描述、方法借鉴、对照观点、实证证据),附带相关性评分、核心贡献描述、来源标记(本地文献库、Zotero、外部搜索、引文追踪)。本地文献直接链接到你的笔记,外部文献附带DOI和URL。

第二份是综述框架。AI基于筛选结果,自动生成一份综述的骨架:核心概念界定用哪些文献、理论基础用哪些、研究现状和争议怎么组织、研究空白怎么论证。每个部分都列出了对应的论文和它在综述中的具体作用。

这两份文档加在一起,你的综述其实已经完成了一半。剩下的工作是逐篇精读、填充细节、打磨论证逻辑。

AI在这个流程里的真实边界

跑完这套流程,我对AI在文献检索这个环节能干什么、不能干什么,有了比较清楚的判断。

AI真正强的地方有两个:一是批量评分和分类,几百篇文献的相关性评分和角色分配,让Claude或者ChatGPT配合脚本跑,几个小时就能完成,人来做要几周;二是多源搜索和去重,五个数据源并行检索、上千条引用关系的追踪、跨源自动去重,这些纯体力活AI做得又快又准。

但有两件事AI做不了。

第一,它判断不了一篇论文对你的研究到底有多重要。相关性高不等于重要,一篇论文可能和你的主题高度相关,但方法有严重缺陷;另一篇看起来相关性一般,但提出了一个独特的理论视角,恰好能解释你数据中那个反常的发现。这种判断靠的是你的学术直觉,所以每一轮补充搜索的结果都需要你亲自过目、亲自取舍。

第二,它发现不了跨学科的隐藏文献。如果一篇论文来自完全不同的学科领域,用的是完全不同的术语体系,关键词检索和语义匹配都捕捉不到。这种文献往往需要你在读其他论文时偶然发现,或者在学术会议上听到别人提起。

所以这套流程的设计逻辑是:AI负责评分、分类、搜索、去重这些重体力活,你负责在每个关键节点做取舍判断。AI和你在每一步都各司其职,人工判断贯穿全过程。

文献筛完了,下一步是逐篇精读。五十篇核心文献,每篇要提取核心观点、研究方法、理论依据、主要结论、关键变量、因果机制、研究局限,七个维度。手动做,一篇至少一两个小时,五十篇就是五十到一百个小时。

bo老师头像

bo老师

持续整理科研方法、开源能力和真实产品。小红书搜索“bo老师”,公众号搜索“趣味bo老师”。

了解作者与关注渠道

科研之我见

如何建立可持续更新的科研文献库

用期刊 RSS、关键词初筛和本地笔记库持续积累候选文献,让一次性检索变成长期更新的研究基础设施。

查看内容

科研之我见

如何用 AI 结构化精读 50 篇核心文献

先固定七个抽取维度,再让 AI 批量生成文献方法矩阵,并通过人工抽样复核控制理论、机制和变量角色误判。

查看内容

科研之我见

396篇摘要,怎样收束成一份研究档案

一个真实科研 Agent 案例:从一句模糊想法出发,筛选 396 篇摘要、精读重点全文,最终形成可以回到文献核查的研究档案。

查看内容

需要系统训练时

把一条公开方法,练成可以反复使用的科研流程

公开文章先解决一个具体判断;课程继续连接研究问题、文献判断、理论假设和方法骨架,并形成可复用的研究设计档案。

了解系统课程