什么时候用
先判断任务是否合适
- 需要自动化文献检索、实验代码生成和论文初稿撰写的完整科研流程
- 想快速探索一个研究方向,用多Agent协作生成实验代码并评分迭代
- 需要将实验结果自动编排为结构化的LaTeX论文,含评审和改进回环
- 希望原型化研究想法,通过可选的人工审核门控制自动化程度
先准备什么
材料越清楚,结果越有用
- •一个YAML配置文件,指定研究主题、LLM模型和工作流参数
- •OpenAI或DeepSeek API密钥,确保有足够额度支撑多阶段LLM调用
- •Python环境,包含PyTorch、HuggingFace datasets和sentence-transformers
- •可选:LaTeX发行版(pdflatex)以生成编译后的PDF论文
它会怎样推进
从材料到可以检查的结果
- 01
配置与启动
在YAML中定义研究主题、模型和预算,启动流水线脚本
- 02
文献检索
PhD Agent搜索arXiv、下载PDF并筛选论文,直至达到目标数量
- 03
方案规划
Postdoc和PhD Agent通过对话协作生成研究方案,提交人工确认
- 04
运行实验
MLESolver迭代生成、执行和评分实验代码,保留最优版本
- 05
撰写论文
PaperSolver逐章填充LaTeX框架,编译并通过LLM评分
- 06
评审与回环
三位评审Agent打分;根据分数决定结束或回到规划阶段重新开始
第一次这样开始
把仓库地址直接交给 AI
先让 AI 说明环境和风险,再完成最小安装验证。跑通以后,再把自己的真实材料放进去。
第一次直接复制
帮我安装这个库:https://github.com/SamuelSchmidgall/AgentLaboratory 安装前先告诉我需要什么环境,安装后帮我跑通一个最小示例。
结果出来后
先看这些检查点
- 检查文献综述是否覆盖了相关论文,而非仅仅搜索arXiv首页结果
- 验证实验代码能正常运行,输出的结果与论文中的主张一致
- 逐一核对论文引用是否真实存在且与正文内容匹配
- 确认评审回环未导致实验代码或论文质量退化
常见误区
这些判断仍由你负责
- 不设置API调用预算上限就运行流水线,多Agent循环可能导致高额费用
- 信任LLM生成的实验代码而不做人工代码审查就直接采用结果
- 未核实自动生成的引用文献是否存在,直接提交包含幻觉引用的论文
- 让工具在修订回环中无限制循环,未设定最大步骤数
技术依据
查看能力拆解、验证范围与来源
技术依据
查看能力拆解、验证范围与来源
- 01
AgentRxiv本地论文共享检索
在本地启动一个 AgentRxiv Flask 服务,把上传或自动生成的 PDF 抽取成文本并存入 SQLite,再用 sentence transformer embedding 做相似度搜索,让后续 agent 在文献综述阶段检索其他 agent 产出的论文全文和摘要。
- 02
HuggingFace数据准备与提交
让 ML engineer 和 software engineer 围绕研究计划协作,必要时搜索 HuggingFace 数据集,逐步执行候选数据准备代码,直到 software engineer 提交通过执行检查的最终 loaddata.py。
- 03
arXiv文献检索与综述归档
让 PhD agent 围绕研究主题反复发出 SUMMARY、FULLTEXT 和 ADDPAPER 命令,从 arXiv 搜索摘要、读取论文全文、选择相关论文,并把达到数量阈值的论文摘要整理成后续计划阶段可用的文献综述。
- 04
实验代码生成修复与评分
把数据准备代码、研究计划和文献洞察交给 MLESolver,让模型用 REPLACE 或 EDIT 生成实验代码,先运行代码,再用 LLM reward model 给代码与输出打分,保留最高分代码并写入实验目录。
| 能力 | 主要输入 | 主要输出 | 人工检查 |
|---|---|---|---|
AgentRxiv本地论文共享检索源码已核对 |
|
|
|
HuggingFace数据准备与提交源码已核对 |
|
|
|
arXiv文献检索与综述归档源码已核对 |
|
|
|
实验代码生成修复与评分源码已核对 |
|
|
|
研究计划协作生成源码已核对 |
|
|
|
论文写作与LaTeX产物生成源码已核对 |
|
|
|
处理机制
- 01
运行文件合同与外部依赖边界
这个机制解释 AgentLaboratory 的运行文件、目录、外部 API、代码执行、LaTeX 编译和 AgentRxiv 服务如何共同构成复现边界。它跨越配置调度、数据准备、实验代码、论文写作和 AgentRxiv 本地共享能力。
- 02
阶段命令协议与状态记忆
这个机制解释 AgentLaboratory 如何用单命令协议、agent history、phase status、过期上下文和 pickle checkpoint 串联多阶段研究流程。它支撑配置调度、文献综述、计划、数据准备、实验、论文写作和评审回环多张能力卡。
已核对范围
- 读取 AgentRxiv 类的本地 Flask server 启动、搜索和 PDF 缓存逻辑
- 读取 app.py 的 PDF 上传、SQLite 入库、embedding 搜索和 API 返回
- 读取 literaturereview 和 reportwriting 中的 AgentRxiv 接入点
- 读取 HFDataSearch 的数据集检索、过滤和评分逻辑
- 读取 SWEngineerAgent 与 MLEngineerAgent 的 data preparation 命令协议
- 读取 LaboratoryWorkflow.datapreparation 的代码执行、SEARCHHF 和 SUBMITCODE 分支
- 读取 PhDStudentAgent 的文献命令协议
- 读取 LaboratoryWorkflow.literaturereview 的 SUMMARY、FULLTEXT 和 ADDPAPER 分支
仍待核对
- 未启动 Flask server
- 未上传 PDF
- 未下载 sentence transformer 模型
- 未验证并行 lab 的 AgentRxiv 路径
- 未下载 HuggingFace dataset 索引
- 未运行模型生成的数据准备代码
- 未验证代码安全隔离
- 未验证真实 MATH 数据加载
读取版本
d9017d90e329112d2a80b7712f37ee9094d2cd27许可
MIT
最近核对
内容 2026-06-16
Stars 2026-07-11
相关文章
科研之我见
AI 可以参与科研的哪些环节?一张 11 环节工作流全景图
从选题、文献、理论、数据到投稿,逐环节判断 AI 可以主导、需要人工校验和必须由研究者把关的工作。
查看内容具备相关能力的其他库
相关课程
把单项工具放进完整研究设计流程
课程一从研究问题、文献判断、理论假设和方法骨架继续推进,帮助你建立可以复用的研究设计档案。