开源仓库SakanaAI/AI-Scientist-v26,800 Stars

AI Scientist v2

从开放研究主题到论文产出的端到端自动化科研流水线

面向机器学习研究者,适合从零开始探索开放式研究方向。系统用LLM生成结构化研究想法,通过多阶段Agentic Tree Search自动实验探索、解析指标、聚合图表,最后撰写论文并做图文一致性复核。

bo老师判断:谨慎使用

有明确用途,许可、运行风险或证据边界需要先核对。

...互动状态已更新

什么时候用

先判断任务是否合适

  • 有一个高层研究主题,希望自动生成候选研究方向并评估可行性
  • 需要自动化执行多组实验探索并自动记录结果与指标
  • 希望将实验数据自动汇总为论文草稿和图表
  • 需要对生成论文做自动评审和图文一致性复核

先准备什么

材料越清楚,结果越有用

  • 准备一个Markdown格式的高层研究主题描述文件
  • 配置LLM和VLM模型参数,确保API密钥可用
  • 可选:准备好实验代码和Hugging Face数据集引用文件
  • 确保运行环境满足GPU、磁盘空间和网络访问要求

它会怎样推进

从材料到可以检查的结果

  1. 01

    生成研究想法

    LLM基于主题描述生成多个结构化研究idea,并搜索相关文献辅助判断新颖性

  2. 02

    装配实验配置

    选定一个idea,自动创建实验目录、注入代码和数据集引用,生成专属配置

  3. 03

    探索实验树

    多阶段Agent自动生成实验计划、执行代码、解析指标并选择最优节点继续扩展

  4. 04

    解析与反馈

    节点级执行捕获stdout、解析metric、生成图像并用VLM提供图文反馈

  5. 05

    聚合图表

    LLM根据阶段摘要和数据文件生成聚合脚本,产出论文所需的最终图像

  6. 06

    撰写与评审

    收集引用生成LaTeX论文,编译PDF,LLM文本评审加VLM图文一致性复核

第一次这样开始

把仓库地址直接交给 AI

先让 AI 说明环境和风险,再完成最小安装验证。跑通以后,再把自己的真实材料放进去。

第一次直接复制

帮我安装这个库:https://github.com/SakanaAI/AI-Scientist-v2
安装前先告诉我需要什么环境,安装后帮我跑通一个最小示例。
请先说明许可证和安装风险,等我确认后再安装。

结果出来后

先看这些检查点

  • 实验树是否按预期生成并完成所有阶段,检查checkpoint和阶段摘要完整性
  • 最终图表是否来自真实实验数据,变量名和样本数可追溯
  • 论文引用是否真实存在且与正文断言匹配
  • 生成论文是否显著披露了机器生成和The AI Scientist使用信息

常见误区

这些判断仍由你负责

  • 直接信任LLM生成的研究想法质量而不做人工复核,低质量想法浪费实验资源
  • 忽略许可证要求,传播生成论文时未显著披露机器生成身份
  • 依赖单一metric排序最优节点,忽略无法被数值化的研究质量维度
  • 让图表聚合脚本猜测数据文件结构而不提供schema,导致生成看似合理但错误的图表

技术依据

查看能力拆解、验证范围与来源

能力地图6 项已拆解能力
  1. 01

    idea到实验目录与BFTS配置装配

    把一个 pregenerated idea JSON 中的单条 idea 装配成独立实验目录,补写 idea.md、idea.json 和运行专属 bftsconfig.yaml,再把配置交给 BFTS 实验执行入口。

  2. 02

    主题自由研究想法生成与文献检索

    把一个高层研究主题 Markdown 变成一组结构化研究 idea,并要求 LLM 在定稿前至少做一次 Semantic Scholar 文献搜索。输出 idea JSON 后,主实验流水线再按 --loadideas 读取其中一个 idea。

  3. 03

    多阶段agentic tree search实验探索

    把单个研究 idea 转成一个由多阶段 agent 管理的实验树。系统不再依赖人工模板中的固定实验脚本主轴,而是通过 AgentManager 拆出四个主阶段,让 ParallelAgent 在每个阶段生成 plan、执行代码、解析指标、挑选节点并继续扩展。

  4. 04

    实验摘要到最终图表聚合

    把多阶段 tree search 产生的 stage summaries 和实验数据合并成论文写作可用的最终图表。这个能力是实验探索和论文写作之间的窄口,核心在于它用 LLM 根据已有摘要和数据文件写聚合脚本,并尝试把散落的结果变成最终图像。

能力主要输入主要输出人工检查

idea到实验目录与BFTS配置装配

源码已核对

  • --loadideas 指向的 idea JSON。
  • --ideaidx 指定要运行的 idea。
  • 可选 --loadcode,读取和 idea JSON 同名的 .py 文件。
  • experiments/<timestamp<ideaattempt<id/idea.md
  • experiments/<timestamp<ideaattempt<id/idea.json
  • experiments/<timestamp<ideaattempt<id/bftsconfig.yaml
  • 是否允许加载和执行同名 .py。
  • 是否允许加入 HF dataset reference。
  • BFTS 配置中的模型和成本是否可接受。

主题自由研究想法生成与文献检索

源码已核对

  • 研究主题 Markdown,例如 aiscientist/ideas/icantbelieveitsnotbetter.md。
  • 模型名,必须在 AVAILABLELLMS 内。
  • max-num-generations:最多生成 proposal 数。
  • aiscientist/ideas/<topic.json
  • 每条 idea 的结构化字段。
  • 后续 launchscientistbfts.py --loadideas 的输入。
  • 主题范围是否足够明确。
  • Related Work 是否真正来自搜索结果。
  • idea 是否适合自动执行实验。

多阶段agentic tree search实验探索

源码已核对

  • idea JSON,至少包含研究题目、描述、实验目标和约束。
  • bftsconfig.yaml 中的 agent、search、exec、llm、workspace 配置。
  • codedir、datadir、basedir 和实验工作目录。
  • stage summary JSON。
  • tree export JSON。
  • journal checkpoint。
  • 四个阶段是否符合当前研究任务。
  • metric 是否真的代表研究目标。
  • best node 是否需要人工复核后再进入下一阶段。

实验摘要到最终图表聚合

源码已核对

  • 各阶段 stage summary。
  • 实验输出目录中的数据文件和图像文件。
  • experimentdata.npy 或等价实验数据。
  • 聚合脚本。
  • stdout 和 stderr。
  • 最终图像文件。
  • 最终图表是否来自真实数据。
  • 图表变量、轴名和样本数是否可追溯。
  • 聚合脚本是否读取了正确文件。

引用收集与论文写作编译

源码已核对

  • idea JSON。
  • BFTS 实验摘要、stage summaries 和最终图表。
  • 论文模板、目标会议或格式约束。
  • LaTeX 源文件。
  • BibTeX 引用文件。
  • PDF 草稿和反思后 PDF。
  • 引用是否真实存在且与正文断言匹配。
  • 论文是否显著披露机器生成和 The AI Scientist 使用。
  • 图表是否来自真实实验数据。

节点执行指标解析与图像反馈

源码已核对

  • 当前节点的计划、代码、工作目录和前序节点上下文。
  • Interpreter 执行配置、超时时间、环境变量和目录。
  • metric 名称、metric 解析 prompt 或解析规则。
  • 节点执行日志。
  • metric JSON 或等价字段。
  • plot 脚本和图像文件。
  • metric 是否足以代表实验目标。
  • 图像是否忠实呈现运行数据。
  • 失败节点是否保留足够审计证据。

处理机制

  1. 01

    tree search状态对象与目录链路

    这个机制解释 AI-Scientist-v2 如何把 idea、BFTS 配置、workspace、stage、agent、journal、node、summary 和 final artifacts 串成一条可审计的状态链。它支撑装配、tree search、节点执行和图表聚合四张能力卡。

  2. 02

    论文产物质量门与反思链

    这个机制解释 AI-Scientist-v2 如何把实验摘要、最终图表、引用、LaTeX、PDF、LLM review 和 VLM review 串成论文产物质量门。它支撑图表聚合、写作编译和论文评审三张能力卡。

  3. 03

    运行安全与外部服务边界

    这个机制解释 AI-Scientist-v2 的运行风险来自哪里:LLM 写代码、子进程执行、多 worker、GPU、进程清理、外部模型 API、Semantic Scholar、VLM、LaTeX、PDF 工具和自定义许可证。它支撑本来源全部能力卡的运行边界判断。

已核对范围

  • 读取 launchscientistbfts.py 的 CLI 参数、idea 读取、目录创建、code 和 dataset reference 注入
  • 读取 bftsutils.py 的 idea Markdown 转换和 BFTS 配置重写
  • 读取 bftsconfig.yaml 的 workspace、log、agent、search 和模型参数
  • 读取 README 的 ideation 入口、参数和输出说明
  • 读取 performideationtempfree.py 的工具调用、反思、JSON 解析和归档逻辑
  • 读取 semanticscholar.py 的请求、排序和失败返回逻辑
  • 读取 BFTS 主入口、AgentManager 阶段管理和 ParallelAgent 节点扩展代码
  • 读取 journal 节点状态、summary 生成和 stage transition 逻辑

仍待核对

  • 未实际创建 experiments 目录
  • 未运行 BFTS
  • 未验证 loadcode 与 adddatasetref 的组合效果
  • 未调用真实 LLM
  • 未调用 Semantic Scholar API
  • 未验证 idea 质量、新颖性判断或 JSON 稳定性
  • 未运行 tree search
  • 未调用 LLM 生成实验计划

读取版本

96bd51617cfdbb494a9fc283af00fe090edfae48

许可

AI-Scientist-Source-Code-License-1.0

最近核对

内容 2026-06-16
Stars 2026-07-11

已完成源码核对

科研之我见

AI 科研全流程怎么搭,我梳理出三个核心入口

每天开工先固定阶段入口、材料入口和验证入口,把庞大的科研全流程收缩成一段可执行、可检查的任务。

查看内容

科研之我见

AI 可以参与科研的哪些环节?一张 11 环节工作流全景图

从选题、文献、理论、数据到投稿,逐环节判断 AI 可以主导、需要人工校验和必须由研究者把关的工作。

查看内容

科研之我见

如何从 300 篇候选文献中筛出 50 篇核心文献

把文献检索与筛选拆开,通过本地文献库、Zotero、外部数据库和引文追踪形成可回查的核心文献清单。

查看内容

文献 · 验证

paper-qa

从本地论文和文档中检索证据并生成带精确引用的科研答案

查看内容

文献 · 分析 · 写作

grobid

把学术论文PDF解析成结构化TEI XML,提取元数据、全文结构和参考文献

查看内容

设计 · 分析 · 验证

CausalPy

用贝叶斯方法做准实验因果推断,含10+方法和稳健性诊断套件

查看内容

相关课程

把单项工具放进完整研究设计流程

课程一从研究问题、文献判断、理论假设和方法骨架继续推进,帮助你建立可以复用的研究设计档案。

查看课程一