什么时候用
先判断任务是否合适
- 需要将论文方法描述快速转为可编辑的科研示意图时
- 需要从完整论文文件中自动抽方法段并生成对应图形时
- 需要对已有图形做多轮评审和迭代改进时
先准备什么
材料越清楚,结果越有用
- •准备论文方法文本、Markdown文件或PDF文件
- •配置LLM provider的API密钥(生成、评审和改进共用或分用)
- •如需图像增强需额外配置图像生成API
- •确定输出格式:SVG(可编辑矢量)或mxGraph XML(draw.io兼容)
它会怎样推进
从材料到可以检查的结果
- 01
输入文本
提供方法描述或上传论文文件,系统自动抽取方法段
- 02
生成初稿
LLM根据文本和参考图风格生成初始SVG或mxGraph代码和PNG预览
- 03
评审打分
视觉模型从美观度、内容保真度和占位符使用三维评分
- 04
迭代改进
根据评审问题和可选人工反馈重写图代码,直到质量达标
- 05
最终输出
保存最优版本的代码、PNG和生成报告
第一次这样开始
把仓库地址直接交给 AI
先让 AI 说明环境和风险,再完成最小安装验证。跑通以后,再把自己的真实材料放进去。
第一次直接复制
帮我安装这个库:https://github.com/ResearAI/AutoFigure 安装前先告诉我需要什么环境,安装后帮我跑通一个最小示例。
结果出来后
先看这些检查点
- 生成图形的文字、连线和结构是否与输入描述一致
- 评审分数和具体问题是否指向真实存在的缺陷
- 最终SVG或mxGraph文件是否能在编辑器中正常打开和修改
- 增强后的图形是否仍保留原始科学含义
常见误区
这些判断仍由你负责
- 把模型评审分数等同于期刊审稿人对图形的评价
- 让图像增强模型改变图形的科学含义(文字丢失或连线关系改变)
- 把全篇论文上传到外部模型而不检查数据外发风险
技术依据
查看能力拆解、验证范围与来源
技术依据
查看能力拆解、验证范围与来源
- 01
Web会话化人工反馈与增强调度
把文本输入、模型配置、每轮 XML、PNG 预览、evaluation、人类反馈、final XML 和增强变体组织成 Web session,让用户通过前端继续迭代、确认布局和启动增强。
- 02
图代码语法校验渲染与产物记录
把 LLM 生成或人工编辑的 SVG、mxGraph XML 转成可渲染预览和可复查文件,并在失败时尝试语法修复或写出错误产物。
- 03
图像增强与code2prompt美化
把已生成的布局预览图和可选图代码转成一个或多个更美观的 PNG 变体,其中 code2prompt 模式先让 LLM 分析图代码,再把结构化视觉规格交给图像生成模型。
- 04
文本描述到初始科研图代码生成
把用户提供的科研图描述、主题类型、参考图和输出格式配置转成初始 SVG 或 mxGraph XML 图代码,并生成后续评审和迭代可以读取的预览图。
| 能力 | 主要输入 | 主要输出 | 人工检查 |
|---|---|---|---|
Web会话化人工反馈与增强调度源码已核对 |
|
|
|
图代码语法校验渲染与产物记录源码已核对 |
|
|
|
图像增强与code2prompt美化源码已核对 |
|
|
|
文本描述到初始科研图代码生成源码已核对 |
|
|
|
论文文件到方法段抽取与图生成源码已核对 |
|
|
|
评审反馈驱动的代码修复迭代源码已核对 |
|
|
|
处理机制
- 01
provider配置与凭证边界
解释 AutoFigure 如何在 SDK、backend 和 frontend 三层处理 provider、base URL、模型名、API key 和用户凭证输入。这个机制支撑生成、方法抽取、评审、图像增强和 Web 会话能力。
- 02
迭代产物状态链与停止线
解释 AutoFigure 从输入文本到图代码、预览图、评审记录、迭代历史、最终图和增强变体之间的状态链,以及哪些失败会让链路停止或降级。
已核对范围
- 静态读取 backend Flask routes、frontend context、types、start script 和 docs
- 静态确认 Web 会话保存 iteration、final XML、enhancement progress 和用户反馈
- 静态读取 SVG、mxGraph XML 校验、渲染、修复和 saveiterationresults
- 静态确认每轮代码、PNG 和 evaluation JSON 会写入输出目录
- 静态读取 README enhancement 示例、Agent enhancement 分支、ImageEnhancer 和 backend enhancement route
- 静态确认可用 none、code、code2prompt 三种输入模式生成增强图变体
- 静态读取 README、SDK agent、generator prompt、provider 调用和代码抽取逻辑
- 静态确认文本输入可生成 SVG 或 mxGraph XML,并可返回预览路径与分数
仍待核对
- 未启动 backend 或 frontend
- 未验证本地端口、CORS 和浏览器 draw.io 行为
- 未验证并发 session 的内存占用
- 未运行 CairoSVG
- 未运行 Playwright draw.io export
- 未验证复杂 mxGraph XML 的浏览器导出稳定性
- 未调用图像生成模型
- 未验证增强图是否保持科学含义
读取版本
45895304cc270181abf94bb59742648b1d949ed0许可
MIT
最近核对
内容 2026-06-16
Stars 2026-07-11
相关文章
科研之我见
用 AI 写文献综述,怎样控制幻觉和证据断裂
把文献关系、核心文献筛选、方法矩阵和四类 Gap 分开处理,让综述中的每个判断都能回到具体材料。
查看内容