什么时候用
先判断任务是否合适
- 需要批量提取数百篇论文的标题、作者、摘要和参考文献信息
- 需要从PDF中定位引文在正文中的出现位置和页码坐标
- 希望对学术出版物做结构化信息抽取以构建文献数据库或知识图谱
- 需要处理专利文献中的引文信息
先准备什么
材料越清楚,结果越有用
- •准备需要解析的PDF论文文件(必须有文本层,扫描件要先做OCR)
- •如需CrossRef元数据补全,准备联系邮箱以使用礼貌级并发
- •根据文档类型选择解析风味:标准学术论文、专利或轻量模式
- •安装Java运行环境和grobid的模型文件
它会怎样推进
从材料到可以检查的结果
- 01
部署服务
启动grobid REST服务或直接使用公开demo实例
- 02
上传PDF
将论文PDF通过API或batch命令提交给对应端点
- 03
级联解析
grobid依次执行分割、头部、正文、参考文献、图表等模型标注
- 04
获取TEI XML
收取结构化的TEI XML文件,包含全部标注字段和可选坐标信息
- 05
验证关键字段
人工抽查标题、作者拆分、引文字段和坐标定位是否准确
第一次这样开始
把仓库地址直接交给 AI
先让 AI 说明环境和风险,再完成最小安装验证。跑通以后,再把自己的真实材料放进去。
第一次直接复制
帮我安装这个库:https://github.com/kermitt2/grobid 安装前先告诉我需要什么环境,安装后帮我跑通一个最小示例。
结果出来后
先看这些检查点
- 检查作者姓名拆分(尤其非西方名字格式)是否正确
- 抽查参考文献的DOI匹配和字段完整性
- 验证PDF坐标标注在目标阅读器中的定位是否准确
常见误区
这些判断仍由你负责
- 直接拿扫描件PDF解析而不先做OCR,会报无文本层错误
- 把CrossRef补全当作完全准确而不人工抽检,搜索API可能返回近似匹配
- 用grobid替代引文去重和文献质量判断,grobid只做提取不做评价
技术依据
查看能力拆解、验证范围与来源
技术依据
查看能力拆解、验证范围与来源
- 01
PDF全文结构化解析
把学术论文 PDF 完整解析成结构化 TEI XML(header + body + references),通过级联序列标注模型识别文档区域、段落、章节标题、图表、公式和参考文献标记,并可选附加 PDF 坐标、句子分段和页面范围控制。
- 02
PDF坐标标注与增强
在 PDF 全文解析结果上附加结构坐标(bounding boxes),使提取的结构可定位回原始 PDF 页面,支持三种输出:TEI XML 的 @coords 属性、JSON 标注(含页面尺寸+bounding box 列表,用于浏览器 PDF.js 渲染)、以及实验性的增强 PDF(写入 PDF 注释)。
- 03
PDF头部元数据提取
从 PDF 文档首页区域提取结构化书目元数据(标题、作者、摘要、作者单位、关键词、DOI、日期、版权许可证等),输出 TEI XML 或 BibTeX,并可选通过外部服务归一化补全。
- 04
专利引文提取
从专利出版物中提取和解析专利引文(patent citations)和非专利引文(non-patent literature citations),支持纯文本(TXT)、ST.36 XML 和 PDF 三种输入格式,输出 TEI XML 引文列表,并对 PDF 输入提供带坐标的 JSON 标注。
| 能力 | 主要输入 | 主要输出 | 人工检查 |
|---|---|---|---|
PDF全文结构化解析源码已核对 |
|
|
|
PDF坐标标注与增强源码已核对 |
|
|
|
PDF头部元数据提取源码已核对 |
|
|
|
专利引文提取源码已核对 |
|
|
|
原文片段解析源码已核对 |
|
|
|
参考文献外部归一化源码已核对 |
|
|
|
处理机制
- 01
核心处理链
把学术论文PDF解析成结构化TEI XML,提取元数据、全文结构和参考文献
已核对范围
- 静态确认 FullTextParser.processing 作为全文级联入口
- 静态确认级联顺序 segmentation→fulltext→header→reference-segmenter→citation→figure/table
- 静态确认 pdfalto 产出 LayoutToken(含坐标+字体),模型在 LayoutToken 上做序列标注而非纯文本
- 静态确认 REST /api/processFulltextDocument 和 batch processFullText 两条入口
- 静态确认 TEI XML 输出合同和可选坐标/句子分段/页面范围参数
- 静态确认 teiCoordinates 参数支持 ref/biblStruct/persName/figure/formula/head/s/p/note/title/affiliation 等结构附带坐标
- 静态确认 referenceAnnotations 端点返回 JSON 标注(含页面尺寸 + bounding box 列表)
- 静态确认 annotatePDF 端点返回修改后的 PDF(实验性,可能弃用)
仍待核对
- pdfalto 原生二进制内部解析细节未深读
- 各模型 Wapiti/DeLFT 内部推理链路未深读
- flavor(article/light-ref/sdo)对具体标注规则的影响未深读
- 大文件/超大 blocks 的降级阈值实际触发行为未验证
- 坐标计算的精度和 CropBox/MediaBox 差异处理未验证
- JSON 标注的完整 schema(哪些字段进入 annotations)未深读
- annotatePDF 的 PDF 修改内部实现未深读
- figure/formula 标注的覆盖率和准确性未验证
读取版本
ae58f2dd30e38207d2e4a919663de14f3695b836许可
Apache-2.0
最近核对
内容 2026-07-10
Stars 2026-07-11