8 分钟AI 基础与工具概念科普

我拆了 30 多个科研 Skill,发现它们其实只分 5 类

按照输入、交付物和人工检查点,把科研 Skill 放回文献证据、研究设计、分析执行、表达审查和运行治理五类任务。

科研 skill能力图谱工作流
...互动状态已更新

在体系中的位置

完成概念和工具选择后,用五类科研任务判断一个 Skill 是否值得使用。

AI 工作系统入门 · 第 3

我拆了 30 多个科研 Skill,发现它们其实只分 5 类封面

你看到一个科研 Skill,先别急着收藏。先问三句话:它吃什么材料?吐出什么交付物?哪一步必须人工检查?

这段时间,我在做课程的过程中,把自己收藏过的科研 Skill 又顺了一遍。

里面有已经分享过的 academic-research-skills 和 journal-reviewer,还有 paper-qa、ChatPaper、Nature、Zotero 相关插件,也有 AI Scientist、Agent Laboratory、paper2code,还有论文写作、图表生成、审稿检查、医学科研和运行治理相关的 Skill。

如果只看名字,会很乱。每一个都说自己能帮你做科研,每一个都像是值得收藏的工具。

但当我把它们放回科研流程里看,事情就清楚很多。

科研 Skill 的重点,不在工具名多酷。真正要看的是:它接管了科研流程里的哪一个环节。

有的 Skill 在帮你整理文献和证据,有的在帮你把模糊想法变成研究问题,有的在帮你把设计变成代码和实验包,有的在帮你写论文、改图、预审,有的在管权限、缓存、日志和安全边界。

所以这篇我想给你一张地图。以后你再看到一个新的科研 Skill,先把它放进这张图里,再决定要不要学。

回到上一篇:Skill 是肌肉记忆

上一篇讲 AI Agent、MCP、Skill 和知识库的关系时,我用过一个比喻:

模型是大脑,工具是身体和工作台,MCP 是感官和神经接口,知识库是记忆和书架,Skill 是肌肉记忆,Agent 是为了一个目标组织起来的能力包。

这一篇只往 Skill 这一层再走一步。

肌肉记忆的意思很简单:你做过很多次的一组小动作,不需要每次重新想从哪里开始、先看什么、怎么收尾。

放到科研里,Skill 就是把一类重复科研动作固定下来。

比如读一篇论文,不能每次都临时问“帮我总结一下”。更稳定的 Skill 会固定几件事:

第一,它需要你给材料。

比如论文 PDF、Zotero 条目、研究问题、实验配置、图表草稿、审稿意见。

第二,它会给你一个交付物。

比如证据摘要、文献矩阵、研究设计、执行脚本、论文段落、图表代码、审稿问题清单。

第三,它应该告诉你哪里要人工检查。

比如引用有没有对上原文,研究问题有没有价值,实验结果能不能解释,医学结论有没有越界,投稿材料有没有漏项。

所以我现在判断一个科研 Skill,先不用问“它是不是很智能”,先问:

这个 Skill 吃什么材料?
它吐出什么交付物?
哪一步必须人工检查?

这三个问题,比单纯问“哪个工具更强”更有用。

科研 Skill 大体可以分成 5 类

我在卡片库里拆过的科研相关来源,已经超过 30 个。为了写这篇,我没有把所有技术细节搬出来,只保留最适合普通科研用户理解的一层。

可以先看这张图。

图先给直觉,下面这张表把五类再讲实一点。

类别它处理什么它交付什么常见例子人要守住什么
材料和证据类论文、PDF、网页、Zotero 条目、数据库证据片段、引用锚点、文献矩阵、带来源回答paper-qa、ChatPaper、OpenScholar、Zotero 插件原文是否真支持结论,引用有没有错位
研究问题和设计类想法、关键词、参考论文、已有证据候选问题、研究设计、假设链、分析计划academic-research-skills、AI Scientist、AI Researcher新颖性不等于可做,设计要能被检验
执行和实验类设计方案、数据、代码、配置、环境执行包、实验目录、脚本、日志、评分结果Agent Laboratory、paper2code、DeepScientist评分只是线索,结果解释要人来做
写作图表和审稿类结果、证据矩阵、草稿、图表、审稿意见论文段落、图表代码、预审清单、回复包、投稿资产research-paper-writing-skills、autofigure、supervisor-skills、nature-skills表达要能被审查,图表和文字要对齐
运行治理和安全类API、缓存、runner、权限、日志、高风险输出状态机、权限边界、失败恢复、eval、人工确认门science-skills、openclaw-medical-skills、自动科研 agent 治理模块高风险结论不能自动放行

你不需要一上来就知道每个 Skill 怎么安装、怎么调用、怎么配置。第一步只要判断它属于哪一类。

第一类:材料和证据类

这一类最适合大多数科研用户先学。

因为科研里最基础、也最容易翻车的环节,就是材料和证据。

你让 AI 写一段综述,真正危险的地方常常不在文笔,而在它引用的材料到底从哪里来。它说某篇论文支持这个观点,原文是不是真这么说?它把几篇文献放在一起比较,比较口径有没有一致?它回答了你的问题,引用有没有对上具体段落?

paper-qa、ChatPaper、OpenScholar 和 Zotero 相关插件,很多都在处理这类问题。

它们更大的价值,是把论文、PDF、网页、数据库和 Zotero 条目变成可追溯的证据对象。

这里有几个关键词你可以记住:

候选材料、证据锚点、引用归因、本地写回。

  • 候选材料解决“哪些材料可以进来”。

  • 证据锚点解决“这句话落在原文哪里”。

  • 引用归因解决“生成结果和引用来源怎样对应”。

  • 本地写回解决“整理后的结果要不要回到 Zotero 或知识库里”。

所以你看到一个文献类 Skill,别只看它能不能总结论文。你要看它有没有回答这三个问题:

来源是谁,证据在哪里,引用怎样回查。

第二类:研究问题和设计类

很多自动科研 Agent 会从一个模糊想法开始,帮你生成研究问题,查新颖性,写研究计划,甚至继续往实验和论文走。

AI Scientist、AI Researcher、academic-research-skills 这一类,就经常覆盖这个区域。

但这里有一个很重要的边界:新颖性筛查不等于研究真的可做。

AI 可以帮你扩展问题、比较已有论文、提出可能的假设,也可以帮你把研究设计写得更完整。可一个问题到底值不值得做,数据能不能拿到,变量能不能测量,模型能不能识别,这些都不能交给 Skill 自动拍板。

这类 Skill 最适合帮你做两件事:

第一,把含糊的想法变成可以讨论的问题。

第二,把问题拆成研究设计、假设链、数据需求和分析计划。

它最不适合做的一件事,是替你宣布“这个选题已经成立”。

你可以让 AI 帮你把选题摊开,但最后要自己判断:这个问题有没有真实缺口,证据能不能支撑,方法能不能落地

第三类:执行和实验类

这一类更接近“自动科研”的想象。

比如 Agent Laboratory、paper2code、DeepScientist、auto-empirical-research-skills、AI Scientist v2 这类来源,都不满足于只给你一个研究计划。它们会继续往下走,尝试把设计变成代码、实验目录、runner、配置、数据包、日志和评分结果。

听起来很强。

但这一类也最需要边界。

因为只要进入执行环节,Skill 处理的东西就不再是文字。它会碰到代码、数据、环境、依赖、GPU、runner、失败重试和结果评分。

我在拆这些来源时,最明显的感受是:自动科研 Agent 的核心学习对象,其实是状态机和执行包。

  • 状态机回答“现在走到哪一步”。

  • 执行包回答“这一步到底用什么代码、数据、配置和环境跑出来”。

  • 日志回答“失败发生在哪里”。

  • 评分回答“结果可能好不好”。

但评分不能直接变成科研结论。

比如一个实验跑出来分数更高,只能说明它在某个指标上看起来更好。这个结果能不能解释,稳健性够不够,是否只是数据泄漏或配置差异,仍然需要人判断。

所以你看到执行类 Skill,要重点看它有没有保留这些东西:

代码、数据、配置、runner、日志、失败分支、人工接管点。

没有这些,它就只是把复杂风险藏起来了。

第四类:写作、图表和审稿类

很多人把论文写作 Skill 理解成“帮我润色”。

这个理解太窄。

真正成熟的写作类 Skill,处理的不只是文字,还包括论文结构、论证链、图表、审稿问题、逐点回复和投稿包。

research-paper-writing-skills、claude-scientific-writer、supervisor-skills、autofigure、autofigure-edit、nature-skills 这类来源,都能放在这一类里看。

这里最重要的问题是:表达能不能被同行审查。

一段论文表达要能被审查,至少要对齐三件事:

主张、证据、表达形式。

  • 你提出了什么判断。

  • 这个判断由什么证据支撑。

  • 你用文字、表格、图、公式还是补充材料表达它。

图表类 Skill 值得单独看。科研图不是普通配图,它往往是论文证据的一部分。图代码、渲染结果、可编辑 SVG、中间 mask、坐标、审稿反馈和修改记录,都可能影响最终投稿质量。

审稿类 Skill 也一样。好的审稿 Skill 不应该只说“这篇论文有问题”,它应该把问题分成主张问题、证据问题、方法问题、图表问题、格式问题,再告诉你每一类问题该怎么修。

所以你看到写作类 Skill,可以直接问:

它是在帮我写得更顺,还是在帮我把论文变得更可审查?

后者价值更高。

第五类:运行治理和安全类

这一类最不容易被普通读者注意,但越到后面越重要。

因为科研 Skill 一旦从“帮我总结”走向“帮我执行”,就会碰到运行治理。

比如 API 怎么调用,缓存怎么保存,外部模型有没有权限,Zotero 写回是否可控,runner 失败怎么恢复,日志能不能复查,CI 和 eval 有没有最低门槛。

这些听起来不像科研,但会直接影响科研工作能不能复现。

尤其是医学、生物、临床试验、治疗计划这类高风险方向,边界要更清楚。science-skills、openclaw-medical-skills 这类来源里,很多能力只能作为科研线索或辅助报告草稿,不能当成诊疗建议。

这一类 Skill 的核心问题是:

哪些东西可以自动跑,哪些东西必须停下来让人确认。

以后看到科研 Skill,就用这三问

到这里,你其实已经不需要记住所有 Skill 名字了。

你只需要记住一个判断法。

看到任何一个科研 Skill,先问三句话:

第一,它吃什么材料?

是论文 PDF、Zotero 条目、研究想法、实验数据、代码仓库、图表草稿,还是审稿意见?

第二,它吐出什么交付物?

是证据摘要、文献矩阵、研究设计、执行脚本、实验日志、论文段落、图表代码,还是投稿包?

第三,哪一步必须人工检查?

是引用、研究问题、数据口径、实验结果、图表质量、医学边界,还是权限和安全?

你也可以把下面这段话直接丢给 AI,用来判断一个新 Skill:

我现在看到一个科研 Skill。
请你只按三项判断:
1. 它需要我提供什么材料?
2. 它会产出什么交付物?
3. 哪些结果必须由我人工检查?
最后把它归入五类中的一类:材料证据、研究设计、执行实验、写作审稿、运行治理。

科研 AI 真正难的地方,从来不是“又学习、添加了一个新工具”。真正难的是,你自己的科研流程有没有被拆清楚

流程清楚了,Skill 才知道该接哪一步。

流程不清楚,收藏再多 Skill,也只会变成另一个资料夹。

以后你再看到科研 Skill,可以先不急着学。先把它放进这五类里,看它解决的是证据、设计、执行、表达,还是运行边界。

能放进去,再决定要不要深入。

放不进去,就先别急着收藏。


bo老师头像

bo老师

持续整理科研方法、开源能力和真实产品。小红书搜索“bo老师”,公众号搜索“趣味bo老师”。

了解作者与关注渠道

科研之我见

AI、Agent、MCP、Skill 到底啥关系?把 AI 当成一个人就懂了

用大脑、身体、感官、记忆和肌肉记忆的比喻,讲清模型、工具、MCP、知识库、Skill、Agent 与多 Agent 的分工。

查看内容

科研之我见

如何寻找和构建属于自己的科研 Skill

从反复出现的真实工作入手,先拆清工作模式、寻找现成方案,再把稳定的输入、步骤、输出和检查固化下来。

查看内容

科研之我见

396篇摘要,怎样收束成一份研究档案

一个真实科研 Agent 案例:从一句模糊想法出发,筛选 396 篇摘要、精读重点全文,最终形成可以回到文献核查的研究档案。

查看内容