什么时候用
先判断任务是否合适
- 有一个高层研究主题,希望自动生成候选研究方向并评估可行性
- 需要自动化执行多组实验探索并自动记录结果与指标
- 希望将实验数据自动汇总为论文草稿和图表
- 需要对生成论文做自动评审和图文一致性复核
先准备什么
材料越清楚,结果越有用
- •准备一个Markdown格式的高层研究主题描述文件
- •配置LLM和VLM模型参数,确保API密钥可用
- •可选:准备好实验代码和Hugging Face数据集引用文件
- •确保运行环境满足GPU、磁盘空间和网络访问要求
它会怎样推进
从材料到可以检查的结果
- 01
生成研究想法
LLM基于主题描述生成多个结构化研究idea,并搜索相关文献辅助判断新颖性
- 02
装配实验配置
选定一个idea,自动创建实验目录、注入代码和数据集引用,生成专属配置
- 03
探索实验树
多阶段Agent自动生成实验计划、执行代码、解析指标并选择最优节点继续扩展
- 04
解析与反馈
节点级执行捕获stdout、解析metric、生成图像并用VLM提供图文反馈
- 05
聚合图表
LLM根据阶段摘要和数据文件生成聚合脚本,产出论文所需的最终图像
- 06
撰写与评审
收集引用生成LaTeX论文,编译PDF,LLM文本评审加VLM图文一致性复核
第一次这样开始
把仓库地址直接交给 AI
先让 AI 说明环境和风险,再完成最小安装验证。跑通以后,再把自己的真实材料放进去。
第一次直接复制
帮我安装这个库:https://github.com/SakanaAI/AI-Scientist-v2 安装前先告诉我需要什么环境,安装后帮我跑通一个最小示例。 请先说明许可证和安装风险,等我确认后再安装。
结果出来后
先看这些检查点
- 实验树是否按预期生成并完成所有阶段,检查checkpoint和阶段摘要完整性
- 最终图表是否来自真实实验数据,变量名和样本数可追溯
- 论文引用是否真实存在且与正文断言匹配
- 生成论文是否显著披露了机器生成和The AI Scientist使用信息
常见误区
这些判断仍由你负责
- 直接信任LLM生成的研究想法质量而不做人工复核,低质量想法浪费实验资源
- 忽略许可证要求,传播生成论文时未显著披露机器生成身份
- 依赖单一metric排序最优节点,忽略无法被数值化的研究质量维度
- 让图表聚合脚本猜测数据文件结构而不提供schema,导致生成看似合理但错误的图表
技术依据
查看能力拆解、验证范围与来源
技术依据
查看能力拆解、验证范围与来源
- 01
idea到实验目录与BFTS配置装配
把一个 pregenerated idea JSON 中的单条 idea 装配成独立实验目录,补写 idea.md、idea.json 和运行专属 bftsconfig.yaml,再把配置交给 BFTS 实验执行入口。
- 02
主题自由研究想法生成与文献检索
把一个高层研究主题 Markdown 变成一组结构化研究 idea,并要求 LLM 在定稿前至少做一次 Semantic Scholar 文献搜索。输出 idea JSON 后,主实验流水线再按 --loadideas 读取其中一个 idea。
- 03
多阶段agentic tree search实验探索
把单个研究 idea 转成一个由多阶段 agent 管理的实验树。系统不再依赖人工模板中的固定实验脚本主轴,而是通过 AgentManager 拆出四个主阶段,让 ParallelAgent 在每个阶段生成 plan、执行代码、解析指标、挑选节点并继续扩展。
- 04
实验摘要到最终图表聚合
把多阶段 tree search 产生的 stage summaries 和实验数据合并成论文写作可用的最终图表。这个能力是实验探索和论文写作之间的窄口,核心在于它用 LLM 根据已有摘要和数据文件写聚合脚本,并尝试把散落的结果变成最终图像。
| 能力 | 主要输入 | 主要输出 | 人工检查 |
|---|---|---|---|
idea到实验目录与BFTS配置装配源码已核对 |
|
|
|
主题自由研究想法生成与文献检索源码已核对 |
|
|
|
多阶段agentic tree search实验探索源码已核对 |
|
|
|
实验摘要到最终图表聚合源码已核对 |
|
|
|
引用收集与论文写作编译源码已核对 |
|
|
|
节点执行指标解析与图像反馈源码已核对 |
|
|
|
处理机制
- 01
tree search状态对象与目录链路
这个机制解释 AI-Scientist-v2 如何把 idea、BFTS 配置、workspace、stage、agent、journal、node、summary 和 final artifacts 串成一条可审计的状态链。它支撑装配、tree search、节点执行和图表聚合四张能力卡。
- 02
论文产物质量门与反思链
这个机制解释 AI-Scientist-v2 如何把实验摘要、最终图表、引用、LaTeX、PDF、LLM review 和 VLM review 串成论文产物质量门。它支撑图表聚合、写作编译和论文评审三张能力卡。
- 03
运行安全与外部服务边界
这个机制解释 AI-Scientist-v2 的运行风险来自哪里:LLM 写代码、子进程执行、多 worker、GPU、进程清理、外部模型 API、Semantic Scholar、VLM、LaTeX、PDF 工具和自定义许可证。它支撑本来源全部能力卡的运行边界判断。
已核对范围
- 读取 launchscientistbfts.py 的 CLI 参数、idea 读取、目录创建、code 和 dataset reference 注入
- 读取 bftsutils.py 的 idea Markdown 转换和 BFTS 配置重写
- 读取 bftsconfig.yaml 的 workspace、log、agent、search 和模型参数
- 读取 README 的 ideation 入口、参数和输出说明
- 读取 performideationtempfree.py 的工具调用、反思、JSON 解析和归档逻辑
- 读取 semanticscholar.py 的请求、排序和失败返回逻辑
- 读取 BFTS 主入口、AgentManager 阶段管理和 ParallelAgent 节点扩展代码
- 读取 journal 节点状态、summary 生成和 stage transition 逻辑
仍待核对
- 未实际创建 experiments 目录
- 未运行 BFTS
- 未验证 loadcode 与 adddatasetref 的组合效果
- 未调用真实 LLM
- 未调用 Semantic Scholar API
- 未验证 idea 质量、新颖性判断或 JSON 稳定性
- 未运行 tree search
- 未调用 LLM 生成实验计划
读取版本
96bd51617cfdbb494a9fc283af00fe090edfae48许可
AI-Scientist-Source-Code-License-1.0
最近核对
内容 2026-06-16
Stars 2026-07-11
相关文章
具备相关能力的其他库
相关课程
把单项工具放进完整研究设计流程
课程一从研究问题、文献判断、理论假设和方法骨架继续推进,帮助你建立可以复用的研究设计档案。