什么时候用
先判断任务是否合适
- 已有明确的研究想法,需要快速实现代码并验证可行性
- 拿到一篇参考论文,希望在其基础上产生创新想法并实验
- 需要构建新的机器学习基准数据集供后续研究使用
- 希望自动完成实验代码、评审修正和论文初稿撰写
先准备什么
材料越清楚,结果越有用
- •准备研究想法描述或参考论文的标题和arXiv链接
- •配置OpenAI API Key和GitHub Token用于模型调用和搜索
- •准备Docker运行环境,确保GPU端口和缓存目录可用
- •确认参考代码仓库和数据集的许可协议允许复用
它会怎样推进
从材料到可以检查的结果
- 01
检索资源
根据参考论文搜索GitHub和arXiv,选择最相关的候选代码仓库和论文源码
- 02
生成计划
根据研究想法和检索结果制定数据集、模型、训练测试的完整方案
- 03
实现实验
在Docker容器中编写项目代码,完成真实数据的两轮训练和测试
- 04
评审修正
对实现代码逐项审查,反复修正直至满足研究想法的全部要求
- 05
分析提炼
分析实验结果,生成下一轮实验计划并补充可视化或新实验
- 06
撰写论文
根据实验结果和代码生成各章节LaTeX论文,处理引用并编译
第一次这样开始
把仓库地址直接交给 AI
先让 AI 说明环境和风险,再完成最小安装验证。跑通以后,再把自己的真实材料放进去。
第一次直接复制
帮我安装这个库:https://github.com/HKUDS/AI-Researcher 安装前先告诉我需要什么环境,安装后帮我跑通一个最小示例。 请先说明许可证和安装风险,等我确认后再安装。
结果出来后
先看这些检查点
- 检查生成的项目代码是否完整运行,训练测试结果是否合理
- 验证评审建议已被采纳,代码覆盖了研究想法的全部学术概念
- 确认生成的论文忠实反映实验结果,引用和图表准确无误
- 审查实验分析报告中的结论是否有真实数据支撑
常见误区
这些判断仍由你负责
- 在没有明确研究想法时启动系统,生成方向可能偏离预期
- 忽略候选代码仓库和数据集的使用许可,未确认版权风险
- 把自动评审的fully_correct当作绝对可信,跳过人工复核
- 让系统在缺少GPU、Docker或API Key时强行运行导致中断
技术依据
查看能力拆解、验证范围与来源
技术依据
查看能力拆解、验证范围与来源
- 01
Level1给定想法到实验实现闭环
把用户已经给出的机器学习研究 idea、benchmark instance、参考论文和候选代码仓,转成可运行项目、两轮训练测试、评审建议、提交实验结果和后续实验 refinements。
- 02
Level2参考论文到创新想法实现
把用户只提供参考论文、没有明确创新 idea 的任务,转成多个候选研究想法、一个精选并细化的 idea、代码实现调查、实验实现、评审修正和实验 refinement。
- 03
创新基准数据构建
把一组论文标题或关键词、PDF 和 LLM 指令模板,转成包含目标论文、source papers、task1、task2、领域元数据和匿名化处理的 innovation benchmark 数据。
- 04
参考论文与代码资源选择下载
把 benchmark 中的参考论文、日期边界和用户任务,转成一组 reference codebases、reference paths、reference papers,并把被选论文的 arXiv source 下载成本地 TeX 文件。
| 能力 | 主要输入 | 主要输出 | 人工检查 |
|---|---|---|---|
Level1给定想法到实验实现闭环源码已核对 |
|
|
|
Level2参考论文到创新想法实现源码已核对 |
|
|
|
创新基准数据构建源码已核对 |
|
|
|
参考论文与代码资源选择下载源码已核对 |
|
|
|
实验实现评审与迭代修正源码已核对 |
|
|
|
研究结果到LaTeX论文生成源码已核对 |
|
|
|
处理机制
- 01
Docker执行环境与浏览器下载边界
解释 AI-Researcher 如何把 agent 的文件读写、命令执行、Python 运行、网页下载和数据集准备限制在 Docker workspace 与本地挂载目录之间,以及这个机制有哪些失败边界。
- 02
MetaChain多agent工具调用与缓存
解释 AI-Researcher 多张能力卡共享的 agent 运行骨架:模型消息怎样调用工具、工具结果怎样进入上下文、agent 怎样切换、错误怎样留在消息里、缓存怎样影响长流程恢复。
- 03
基准实例与产物目录状态链
解释 AI-Researcher 如何把 benchmark instance、dataset candidate、workspace project、paper source、paper agent target sections 和 cache/log 组织成一条产物状态链。
已核对范围
- README Level 1 usage
- researchagent/runinferplan.py
- researchagent/inno/agents/innoagent/
- researchagent/inno/workflow/flowcache.py
- researchagent/inno/environment/dockerenv.py
- README Level 2 usage
- researchagent/runinferidea.py
- ideaagent and codesurveyagent definitions
仍待核对
- true LLM calls
- Docker execution
- GPU training
- external GitHub and arXiv calls
- generated project correctness
- generated idea novelty
- code survey completeness
- true end to end run
读取版本
f9a6f8480860c193afff600eeffe3defcee8a978许可
未发现明确许可
最近核对
内容 2026-06-16
Stars 2026-07-11
相关文章
科研之我见
AI 可以参与科研的哪些环节?一张 11 环节工作流全景图
从选题、文献、理论、数据到投稿,逐环节判断 AI 可以主导、需要人工校验和必须由研究者把关的工作。
查看内容具备相关能力的其他库
相关课程
把单项工具放进完整研究设计流程
课程一从研究问题、文献判断、理论假设和方法骨架继续推进,帮助你建立可以复用的研究设计档案。