我拆了 30 多个科研 Skill,发现它们其实只分 5 类
按照输入、交付物和人工检查点,把科研 Skill 放回文献证据、研究设计、分析执行、表达审查和运行治理五类任务。
在体系中的位置
完成概念和工具选择后,用五类科研任务判断一个 Skill 是否值得使用。
AI 工作系统入门 · 第 3 篇

你看到一个科研 Skill,先别急着收藏。先问三句话:它吃什么材料?吐出什么交付物?哪一步必须人工检查?
这段时间,我在做课程的过程中,把自己收藏过的科研 Skill 又顺了一遍。
里面有已经分享过的 academic-research-skills 和 journal-reviewer,还有 paper-qa、ChatPaper、Nature、Zotero 相关插件,也有 AI Scientist、Agent Laboratory、paper2code,还有论文写作、图表生成、审稿检查、医学科研和运行治理相关的 Skill。
如果只看名字,会很乱。每一个都说自己能帮你做科研,每一个都像是值得收藏的工具。
但当我把它们放回科研流程里看,事情就清楚很多。
科研 Skill 的重点,不在工具名多酷。真正要看的是:它接管了科研流程里的哪一个环节。
有的 Skill 在帮你整理文献和证据,有的在帮你把模糊想法变成研究问题,有的在帮你把设计变成代码和实验包,有的在帮你写论文、改图、预审,有的在管权限、缓存、日志和安全边界。
所以这篇我想给你一张地图。以后你再看到一个新的科研 Skill,先把它放进这张图里,再决定要不要学。
回到上一篇:Skill 是肌肉记忆
上一篇讲 AI Agent、MCP、Skill 和知识库的关系时,我用过一个比喻:
模型是大脑,工具是身体和工作台,MCP 是感官和神经接口,知识库是记忆和书架,Skill 是肌肉记忆,Agent 是为了一个目标组织起来的能力包。
这一篇只往 Skill 这一层再走一步。
肌肉记忆的意思很简单:你做过很多次的一组小动作,不需要每次重新想从哪里开始、先看什么、怎么收尾。
放到科研里,Skill 就是把一类重复科研动作固定下来。
比如读一篇论文,不能每次都临时问“帮我总结一下”。更稳定的 Skill 会固定几件事:
第一,它需要你给材料。
比如论文 PDF、Zotero 条目、研究问题、实验配置、图表草稿、审稿意见。
第二,它会给你一个交付物。
比如证据摘要、文献矩阵、研究设计、执行脚本、论文段落、图表代码、审稿问题清单。
第三,它应该告诉你哪里要人工检查。
比如引用有没有对上原文,研究问题有没有价值,实验结果能不能解释,医学结论有没有越界,投稿材料有没有漏项。
所以我现在判断一个科研 Skill,先不用问“它是不是很智能”,先问:
这个 Skill 吃什么材料?
它吐出什么交付物?
哪一步必须人工检查?
这三个问题,比单纯问“哪个工具更强”更有用。
科研 Skill 大体可以分成 5 类
我在卡片库里拆过的科研相关来源,已经超过 30 个。为了写这篇,我没有把所有技术细节搬出来,只保留最适合普通科研用户理解的一层。
可以先看这张图。
图先给直觉,下面这张表把五类再讲实一点。
| 类别 | 它处理什么 | 它交付什么 | 常见例子 | 人要守住什么 |
|---|---|---|---|---|
| 材料和证据类 | 论文、PDF、网页、Zotero 条目、数据库 | 证据片段、引用锚点、文献矩阵、带来源回答 | paper-qa、ChatPaper、OpenScholar、Zotero 插件 | 原文是否真支持结论,引用有没有错位 |
| 研究问题和设计类 | 想法、关键词、参考论文、已有证据 | 候选问题、研究设计、假设链、分析计划 | academic-research-skills、AI Scientist、AI Researcher | 新颖性不等于可做,设计要能被检验 |
| 执行和实验类 | 设计方案、数据、代码、配置、环境 | 执行包、实验目录、脚本、日志、评分结果 | Agent Laboratory、paper2code、DeepScientist | 评分只是线索,结果解释要人来做 |
| 写作图表和审稿类 | 结果、证据矩阵、草稿、图表、审稿意见 | 论文段落、图表代码、预审清单、回复包、投稿资产 | research-paper-writing-skills、autofigure、supervisor-skills、nature-skills | 表达要能被审查,图表和文字要对齐 |
| 运行治理和安全类 | API、缓存、runner、权限、日志、高风险输出 | 状态机、权限边界、失败恢复、eval、人工确认门 | science-skills、openclaw-medical-skills、自动科研 agent 治理模块 | 高风险结论不能自动放行 |
你不需要一上来就知道每个 Skill 怎么安装、怎么调用、怎么配置。第一步只要判断它属于哪一类。
第一类:材料和证据类
这一类最适合大多数科研用户先学。
因为科研里最基础、也最容易翻车的环节,就是材料和证据。
你让 AI 写一段综述,真正危险的地方常常不在文笔,而在它引用的材料到底从哪里来。它说某篇论文支持这个观点,原文是不是真这么说?它把几篇文献放在一起比较,比较口径有没有一致?它回答了你的问题,引用有没有对上具体段落?
paper-qa、ChatPaper、OpenScholar 和 Zotero 相关插件,很多都在处理这类问题。
它们更大的价值,是把论文、PDF、网页、数据库和 Zotero 条目变成可追溯的证据对象。
这里有几个关键词你可以记住:
候选材料、证据锚点、引用归因、本地写回。
-
候选材料解决“哪些材料可以进来”。
-
证据锚点解决“这句话落在原文哪里”。
-
引用归因解决“生成结果和引用来源怎样对应”。
-
本地写回解决“整理后的结果要不要回到 Zotero 或知识库里”。
所以你看到一个文献类 Skill,别只看它能不能总结论文。你要看它有没有回答这三个问题:
来源是谁,证据在哪里,引用怎样回查。
第二类:研究问题和设计类
很多自动科研 Agent 会从一个模糊想法开始,帮你生成研究问题,查新颖性,写研究计划,甚至继续往实验和论文走。
AI Scientist、AI Researcher、academic-research-skills 这一类,就经常覆盖这个区域。
但这里有一个很重要的边界:新颖性筛查不等于研究真的可做。
AI 可以帮你扩展问题、比较已有论文、提出可能的假设,也可以帮你把研究设计写得更完整。可一个问题到底值不值得做,数据能不能拿到,变量能不能测量,模型能不能识别,这些都不能交给 Skill 自动拍板。
这类 Skill 最适合帮你做两件事:
第一,把含糊的想法变成可以讨论的问题。
第二,把问题拆成研究设计、假设链、数据需求和分析计划。
它最不适合做的一件事,是替你宣布“这个选题已经成立”。
你可以让 AI 帮你把选题摊开,但最后要自己判断:这个问题有没有真实缺口,证据能不能支撑,方法能不能落地。
第三类:执行和实验类
这一类更接近“自动科研”的想象。
比如 Agent Laboratory、paper2code、DeepScientist、auto-empirical-research-skills、AI Scientist v2 这类来源,都不满足于只给你一个研究计划。它们会继续往下走,尝试把设计变成代码、实验目录、runner、配置、数据包、日志和评分结果。
听起来很强。
但这一类也最需要边界。
因为只要进入执行环节,Skill 处理的东西就不再是文字。它会碰到代码、数据、环境、依赖、GPU、runner、失败重试和结果评分。
我在拆这些来源时,最明显的感受是:自动科研 Agent 的核心学习对象,其实是状态机和执行包。
-
状态机回答“现在走到哪一步”。
-
执行包回答“这一步到底用什么代码、数据、配置和环境跑出来”。
-
日志回答“失败发生在哪里”。
-
评分回答“结果可能好不好”。
但评分不能直接变成科研结论。
比如一个实验跑出来分数更高,只能说明它在某个指标上看起来更好。这个结果能不能解释,稳健性够不够,是否只是数据泄漏或配置差异,仍然需要人判断。
所以你看到执行类 Skill,要重点看它有没有保留这些东西:
代码、数据、配置、runner、日志、失败分支、人工接管点。
没有这些,它就只是把复杂风险藏起来了。
第四类:写作、图表和审稿类
很多人把论文写作 Skill 理解成“帮我润色”。
这个理解太窄。
真正成熟的写作类 Skill,处理的不只是文字,还包括论文结构、论证链、图表、审稿问题、逐点回复和投稿包。
research-paper-writing-skills、claude-scientific-writer、supervisor-skills、autofigure、autofigure-edit、nature-skills 这类来源,都能放在这一类里看。
这里最重要的问题是:表达能不能被同行审查。
一段论文表达要能被审查,至少要对齐三件事:
主张、证据、表达形式。
-
你提出了什么判断。
-
这个判断由什么证据支撑。
-
你用文字、表格、图、公式还是补充材料表达它。
图表类 Skill 值得单独看。科研图不是普通配图,它往往是论文证据的一部分。图代码、渲染结果、可编辑 SVG、中间 mask、坐标、审稿反馈和修改记录,都可能影响最终投稿质量。
审稿类 Skill 也一样。好的审稿 Skill 不应该只说“这篇论文有问题”,它应该把问题分成主张问题、证据问题、方法问题、图表问题、格式问题,再告诉你每一类问题该怎么修。
所以你看到写作类 Skill,可以直接问:
它是在帮我写得更顺,还是在帮我把论文变得更可审查?
后者价值更高。
第五类:运行治理和安全类
这一类最不容易被普通读者注意,但越到后面越重要。
因为科研 Skill 一旦从“帮我总结”走向“帮我执行”,就会碰到运行治理。
比如 API 怎么调用,缓存怎么保存,外部模型有没有权限,Zotero 写回是否可控,runner 失败怎么恢复,日志能不能复查,CI 和 eval 有没有最低门槛。
这些听起来不像科研,但会直接影响科研工作能不能复现。
尤其是医学、生物、临床试验、治疗计划这类高风险方向,边界要更清楚。science-skills、openclaw-medical-skills 这类来源里,很多能力只能作为科研线索或辅助报告草稿,不能当成诊疗建议。
这一类 Skill 的核心问题是:
哪些东西可以自动跑,哪些东西必须停下来让人确认。
以后看到科研 Skill,就用这三问
到这里,你其实已经不需要记住所有 Skill 名字了。
你只需要记住一个判断法。
看到任何一个科研 Skill,先问三句话:
第一,它吃什么材料?
是论文 PDF、Zotero 条目、研究想法、实验数据、代码仓库、图表草稿,还是审稿意见?
第二,它吐出什么交付物?
是证据摘要、文献矩阵、研究设计、执行脚本、实验日志、论文段落、图表代码,还是投稿包?
第三,哪一步必须人工检查?
是引用、研究问题、数据口径、实验结果、图表质量、医学边界,还是权限和安全?
你也可以把下面这段话直接丢给 AI,用来判断一个新 Skill:
我现在看到一个科研 Skill。
请你只按三项判断:
1. 它需要我提供什么材料?
2. 它会产出什么交付物?
3. 哪些结果必须由我人工检查?
最后把它归入五类中的一类:材料证据、研究设计、执行实验、写作审稿、运行治理。
科研 AI 真正难的地方,从来不是“又学习、添加了一个新工具”。真正难的是,你自己的科研流程有没有被拆清楚。
流程清楚了,Skill 才知道该接哪一步。
流程不清楚,收藏再多 Skill,也只会变成另一个资料夹。
以后你再看到科研 Skill,可以先不急着学。先把它放进这五类里,看它解决的是证据、设计、执行、表达,还是运行边界。
能放进去,再决定要不要深入。
放不进去,就先别急着收藏。