什么时候用
先判断任务是否合适
- 需要从数据清洗到表图输出的完整实证分析pipeline时
- 准备向AER/AER:Insights/AEJ投稿并需要复现包和审稿回复指导时
- 需要在大规模skill目录中检索适用工具并检查来源许可时
先准备什么
材料越清楚,结果越有用
- •准备研究问题、数据路径、变量含义和处理组/结果变量定义
- •选择技术栈:StatsPAI DSL、Python、Stata或R
- •明确研究设计类型(DiD/IV/RDD/SCM等)和输出目标(表格/图形/复现包)
它会怎样推进
从材料到可以检查的结果
- 01
栈选择
根据项目需求和合作者偏好选择StatsPAI/Python/Stata/R技术栈
- 02
八步执行
依次完成清洗、变量构造、描述统计、诊断、基准估计、稳健性、机制异质性和表图输出
- 03
数值验证
用小型benchmark检查pipeline能否发现常见因果推断陷阱
- 04
行为评审
用rubric检查agent输出的弱IV误判、TWFE误用、引用编造等高成本错误
- 05
许可审计
检查所使用skill的来源许可和商业使用兼容性
第一次这样开始
把仓库地址直接交给 AI
先让 AI 说明环境和风险,再完成最小安装验证。跑通以后,再把自己的真实材料放进去。
第一次直接复制
帮我安装这个库:https://github.com/brycewang-stanford/Auto-Empirical-Research-Skills 安装前先告诉我需要什么环境,安装后帮我跑通一个最小示例。
结果出来后
先看这些检查点
- 统计结果是否通过benchmark的数值重算验证
- agent输出是否触发行为eval的红线(弱IV误判、TWFE误用等)
- skill的来源许可证是否允许在当前场景使用
- 输出格式是否满足目标期刊要求
常见误区
这些判断仍由你负责
- 把skill推荐的统计默认值直接用于真实研究而不按研究设计复核
- 把hygiene score(结构分数)等同于skill的行为正确性
- 忽略CC BY-SA许可的署名和相同方式共享义务
技术依据
查看能力拆解、验证范围与来源
技术依据
查看能力拆解、验证范围与来源
- 01
AER投稿与复现skill栈
把 AER、AER: Insights 和 AEJ 论文从选题、识别、稳健性、引言、表图、复现包、提交到 R&R 的流程拆成可路由的专门 skill。
- 02
CI质量门与同步治理
用本地 Makefile 和 GitHub Actions 把 catalog 新鲜度、repo 结构、workflow 安全策略、Python 兼容、unit tests、eval harness、benchmark 和 upstream skill 同步放进一组持续质量门。
- 03
skill目录生成与生态索引
把 skills/ 下的 vendored skill 文件收集成机器可读目录,再叠加来源、许可证、taxonomy、搜索页面和结构化 hygiene score,使大量 skill 能按研究阶段、方法、语言和主题检索。
- 04
完整实证pipeline技能分发
把完整实证研究流程封装成 agent 可调用的技能入口,让用户可以按 StatsPAI DSL、显式 Python、Stata 或 R 四种栈选择同一条实证 pipeline。
| 能力 | 主要输入 | 主要输出 | 人工检查 |
|---|---|---|---|
AER投稿与复现skill栈源码已核对 |
|
|
|
CI质量门与同步治理源码已核对 |
|
|
|
skill目录生成与生态索引源码已核对 |
|
|
|
完整实证pipeline技能分发源码已核对 |
|
|
|
数值benchmark重算与反作弊评分源码已核对 |
|
|
|
来源许可与provenance审计源码已核对 |
|
|
|
处理机制
- 01
skill目录到许可审计链
这个横向机制解释 AERS 如何把分散的 SKILL.md 文件整理成可检索 catalog,并把 catalog 与 provenance、license、commercialuse 和 sourceconfidence 绑定,形成大规模 skill 入库的治理链。
- 02
信任表面与质量门总图
这个横向机制解释 AERS 如何把 skill 说明、数值 benchmark、行为 eval、repo validator、workflow policy、unit tests 和 CI 组合成多层信任表面,避免大规模目录只停留在数量声明。
已核对范围
- 读取 README 的 AER-Skills 总览
- 读取 aer-workflow 的路由顺序和 handoff contract
- 读取 aer-identification 与 aer-replication 的判断和产物要求
- 读取 Makefile 的 catalog、validate、check、benchmark、eval 入口
- 读取 docs/QUALITYGATE.md 和 docs/TRUST.md 的质量门说明
- 读取 .github/workflows 中 validate、quality、sync、scorecard 和 link check workflow
- 运行上游 scripts/validate-repo.py
- 读取 catalog/skills.json summary
仍待核对
- 未检查全部 9 个 AER skill 的每个资源文件
- 未按真实 AER 稿件运行审稿或复现包流程
- 未验证 2026 年 AEA 政策实时页面
- 未运行完整 make check
- 未触发 GitHub Actions
- 未验证 sync workflow 会实际开 PR
- 未重新生成 catalog
- 未人工审查 1080 个 skill 的语义质量
读取版本
7f52b28bb58b78a7719f76ccbe63b1fadea9c228许可
CC-BY-SA-4.0
最近核对
内容 2026-06-16
Stars 2026-07-11
相关文章
具备相关能力的其他库
相关课程
把单项工具放进完整研究设计流程
课程一从研究问题、文献判断、理论假设和方法骨架继续推进,帮助你建立可以复用的研究设计档案。