什么时候用
先判断任务是否合适
- 需要将论文方法描述自动生成可编辑的科研插图时
- 已有位图草稿想转成可编辑SVG并替换图标时
- 需要通过Web界面逐步确认分割、重建和优化效果时
先准备什么
材料越清楚,结果越有用
- •准备论文方法文本,或准备已有第一阶段科研位图文件
- •配置图像生成和SVG生成的provider及API密钥
- •如需SAM分割需配置SAM backend(本地/云端API)
- •如需图标去背景需配置HuggingFace token访问RMBG-2.0模型
它会怎样推进
从材料到可以检查的结果
- 01
生成位图
从方法文本生成figure.png,或直接导入已有位图
- 02
SAM分割
用文本提示词检测图中可替换的图标区域,生成标注图和坐标文件
- 03
去背景
按坐标裁切图标并用RMBG-2.0生成透明背景素材
- 04
SVG重建
多模态模型根据原图、标注图和坐标生成带占位符的SVG模板
- 05
图标替换
将透明图标嵌入SVG对应位置,可选LLM优化坐标对齐
- 06
编辑器微调
在浏览器内置svg-edit中手动微调最终效果
第一次这样开始
把仓库地址直接交给 AI
先让 AI 说明环境和风险,再完成最小安装验证。跑通以后,再把自己的真实材料放进去。
第一次直接复制
帮我安装这个库:https://github.com/ResearAI/AutoFigure-Edit 安装前先告诉我需要什么环境,安装后帮我跑通一个最小示例。
结果出来后
先看这些检查点
- SAM检测框是否准确定位了目标图标区域
- SVG模板的占位符位置是否与标注图对齐
- 透明图标替换后尺寸和清晰度是否符合预期
- final.svg是否能在矢量编辑器中正常打开和编辑
常见误区
这些判断仍由你负责
- 把生成位图质量直接等同于最终出版级图表
- 不检查SAM检测框是否漏检或误检就进入后续环节
- 未验证图标去背景后是否保留了必要细节
技术依据
查看能力拆解、验证范围与来源
技术依据
查看能力拆解、验证范围与来源
- 01
RMBG图标裁切与透明素材生成
根据 boxlib.json 中的候选框从 figure.png 裁切图标区域,再用 RMBG-2.0 生成透明背景素材,为最终 SVG 中的 <image 嵌入提供可替换图标资产。
- 02
SAM3多提示词分割与boxlib构建
把 figure.png 中可替换的图标、人物、动物或图形区域识别为带标签的候选 box,生成可视化标注图 samed.png 和结构化 boxlib.json,为 SVG 占位符和图标替换建立坐标合同。
- 03
SVG优化坐标对齐与最终合成
把初始 template.svg 经过可选多模态优化、坐标系对齐和透明图标替换,输出最终可编辑 SVG final.svg,并在无图标或失败场景下保留可显示的回退产物。
- 04
Web任务调度与可编辑产物回看
把用户在网页配置页或导入页提交的参数转成后端 CLI 子进程任务,并通过 SSE、artifact 列表、历史页和内置 svg-edit 把中间产物与最终 SVG 暴露给用户继续检查和编辑。
| 能力 | 主要输入 | 主要输出 | 人工检查 |
|---|---|---|---|
RMBG图标裁切与透明素材生成源码已核对 |
|
|
|
SAM3多提示词分割与boxlib构建源码已核对 |
|
|
|
SVG优化坐标对齐与最终合成源码已核对 |
|
|
|
Web任务调度与可编辑产物回看源码已核对 |
|
|
|
多模态SVG模板生成与语法修复源码已核对 |
|
|
|
已有位图导入与预处理源码已核对 |
|
|
|
处理机制
- 01
provider与外部服务路由边界
AutoFigure-Edit 把生图、文本、多模态 SVG、SAM 和 RMBG 分成多条外部服务路线。本机制卡说明 provider 配置、key 复用、custom base URL、SAM backend 和 HuggingFace gated 模型如何影响能力边界。
- 02
五步产物状态链与回退边界
AutoFigure-Edit 的多张能力卡共享同一条产物状态链:figure.png 先被分割成 samed.png 和 boxlib.json,再生成 icons/、template.svg、optimizedtemplate.svg 和 final.svg。本机制卡说明这些产物如何衔接,以及空检测、SVG 失败和编辑器缺失时如何降级。
已核对范围
- 静态读取 README 的 RMBG-2.0 说明、HuggingFace token 要求和 cropandremovebackground
- 静态确认 boxlib boxes 会生成 iconAFxx.png 与 iconAFxxnobg.png
- 静态读取 README 的 SAM3 分割说明、segmentwithsam3、box 合并和 API response 解析函数
- 静态确认输出包含 samed.png、boxlib.json、promptsused、boxes 和 noiconmode 标记
- 静态读取 optimizesvgwithllm、getsvgdimensions、calculatescalefactors、replaceiconsinsvg 和 final fallback
- 静态确认输出包含 optimizedtemplate.svg、可选 PNG 预览和 final.svg
- 静态读取 FastAPI 路由、Job 监控、artifact 扫描、Web run payload、SSE 和 svg-edit 加载逻辑
- 静态确认服务把 CLI 子进程产物映射到可回看 artifact 和浏览器编辑器
仍待核对
- 未下载 briaai/RMBG-2.0
- 未配置 HFTOKEN
- 未运行真实去背景模型
- 未安装本地 SAM3
- 未调用 fal.ai 或 Roboflow
- 未验证真实检测框质量和 prompt 召回率
- 未渲染真实 SVG
- 未验证图标替换成功率
读取版本
63f3f81cdecaae9d009d9a9b7af2dc7384fbaaec许可
MIT
最近核对
内容 2026-06-16
Stars 2026-07-11
相关文章
科研之我见
用 AI 写文献综述,怎样控制幻觉和证据断裂
把文献关系、核心文献筛选、方法矩阵和四类 Gap 分开处理,让综述中的每个判断都能回到具体材料。
查看内容