什么时候用
先判断任务是否合适
- 拿到一篇机器学习论文后需要快速搭建复现代码骨架
- 想验证论文方法是否可以在不手工阅读全部细节的情况下被代码化
- 需要对比论文声称结果与模型生成代码的运行结果
- 论文复现工作量很大,需要先获得结构化的任务列表和依赖配置
先准备什么
材料越清楚,结果越有用
- •论文 PDF 文件或 LaTeX 源文件
- •OpenAI API 密钥或可访问的 vLLM 服务
- •目标输出目录和 Python 运行环境
- •论文中的公式、图表和算法描述
它会怎样推进
从材料到可以检查的结果
- 01
论文材料清洗
将 PDF 转为 JSON 并清洗,或直接读取 LaTeX 正文,提取结构化论文内容
- 02
生成复现计划
从论文内容生成复现计划、系统架构设计、文件级任务列表和依赖配置 YAML
- 03
逐文件逻辑分析
按任务列表顺序分析每个文件的输入输出、数据结构、算法步骤和模块间依赖
- 04
逐文件代码生成
根据分析结果生成代码文件,已完成文件作为后续文件的上下文
- 05
运行调试与评估
生成运行脚本并尝试执行,根据错误修补代码,最后用模型评估复现正确性
第一次这样开始
把仓库地址直接交给 AI
先让 AI 说明环境和风险,再完成最小安装验证。跑通以后,再把自己的真实材料放进去。
第一次直接复制
帮我安装这个库:https://github.com/going-doer/Paper2Code 安装前先告诉我需要什么环境,安装后帮我跑通一个最小示例。
结果出来后
先看这些检查点
- 生成的任务列表是否能稳定覆盖论文的关键实验
- 配置 YAML 中的依赖是否与实际生成代码一致
- 逐文件生成是否保持正确的 import 依赖顺序
- 模型评估给出的分数和理由是否能对应到具体代码行
常见误区
这些判断仍由你负责
- 把生成的代码当作可直接运行的最终产物——模型可能忽略论文中未明确描述的细节或超参数
- 跳过计划审查直接执行——如果复现计划遗漏了关键模块,后续代码链条会整体偏离
- 依赖模型评估来判断复现正确性——生成代码和论文结果之间的差异仍需人工对照原文验证
技术依据
查看能力拆解、验证范围与来源
技术依据
查看能力拆解、验证范围与来源
- 01
复现计划与任务设计生成
把论文内容转成一组面向代码复现的计划对象:总体复现计划、系统架构设计、文件任务拆分和配置 YAML。这个能力是 PaperCoder 后续分析和代码生成的中心合同。
- 02
模型评估裁决与评分汇总
把论文、生成仓库代码和可选 gold 仓库代码输入评估模型,要求模型按核心方法正确性给出 critique list 和 1 到 5 分,多次采样后汇总平均分和有效输出数量。
- 03
论文材料清洗与双输入摄取
把论文材料摄取为 PaperCoder 后续可消费的输入对象。仓库支持 PDF 转 JSON 后清洗,也支持直接读取已清理的 LaTeX 文本,运行脚本用环境变量和参数把输入路径传给 planning、analysis 和 coding 阶段。
- 04
运行脚本生成与调试修补
在代码文件落盘后,为生成仓库补一个可运行脚本,并在执行出错后把错误日志、生成代码和配置交给模型,由模型输出 SEARCH/REPLACE 补丁,再由脚本应用到目标文件。
| 能力 | 主要输入 | 主要输出 | 人工检查 |
|---|---|---|---|
复现计划与任务设计生成源码已核对 |
|
|
|
模型评估裁决与评分汇总源码已核对 |
|
|
|
论文材料清洗与双输入摄取源码已核对 |
|
|
|
运行脚本生成与调试修补源码已核对 |
|
|
|
逐文件代码生成与仓库落盘源码已核对 |
|
|
|
逐文件逻辑分析生成源码已核对 |
|
|
|
处理机制
- 01
三阶段轨迹与产物目录链
Paper2Code 的多张能力卡共享同一条产物链:输入论文先进入 planning,planning 产出 trajectories、config 和 task list,analysis 按 task list 生成逐文件分析,coding 再按相同顺序写入输出仓库,eval 和 debug 继续复用同一组文件。这个机制卡说明这些对象如何跨阶段传递。
已核对范围
- 静态确认 OpenAI 和 vLLM planning 脚本的四轮消息链
- 静态确认 plan、architecture design、task list 和 config YAML 的输出顺序
- 静态确认 ref-free 和 ref-based 两种评估 prompt
- 静态确认 eval 脚本读取论文、目标仓库、可选 gold 仓库并汇总 1 到 5 分
- 静态确认 JSON 清洗脚本、LaTeX 输入分支和四个运行脚本的入口参数
- 静态确认示例 JSON 结构和 cleaned JSON 的字段变化
- 静态确认 reproduce.sh 生成脚本读取生成仓库代码和配置
- 静态确认 debug 脚本按 SEARCH/REPLACE block 应用模型修补
仍待核对
- 未调用 OpenAI 或 vLLM 生成真实计划
- 未检查输出 JSON 是否总能被解析
- 未验证计划能否覆盖任意机器学习论文的关键实验
- 未调用评估模型
- 未验证评分稳定性
- 未验证无有效模型输出时的失败处理
- 未运行 s2orc-doc2json 或 Grobid 服务
- 未用真实 PDF 生成新的 JSON
读取版本
ba9169978043d5799c8d4f4a0963e6b66a24c2e1许可
Apache-2.0
最近核对
内容 2026-06-16
Stars 2026-07-11
相关文章
具备相关能力的其他库
相关课程
把单项工具放进完整研究设计流程
课程一从研究问题、文献判断、理论假设和方法骨架继续推进,帮助你建立可以复用的研究设计档案。