Docling 开源文档解析工具:MIT协议、63k Star的工业级OCR与表格识别

项目简介

Docling 是由 Linux 基金会孵化的开源文档解析引擎,GitHub 仓库地址为 docling-project/docling,累计获得超过 63,000 Stars,是目前最受欢迎的文档处理开源项目之一。

该项目采用 MIT 许可证,允许商业使用、修改和分发,无copyleft限制。最新稳定版本为 v2.129.0(2026年9月发布)。

Docling 的核心价值在于将复杂的文档解析流程简化为一个 Python 库,支持 PDF、Word、PowerPoint、HTML、图片等多种输入格式,并内置了高质量的 OCR 引擎和表格识别模型。

核心功能

多格式支持

Docling 支持以下文档格式的解析:

格式说明OCR 支持
PDF原生 PDF 解析✅ 内置 OCR
Word (.docx)Microsoft Word 文档❌ 无需 OCR
PowerPoint (.pptx)演示文稿❌ 无需 OCR
HTMLWeb 页面❌ 无需 OCR
PNG/JPG图片文件✅ 内置 OCR
TIFF扫描图像✅ 内置 OCR

OCR 引擎

Docling 内置了基于 Transformer 的 OCR 模型,支持:
- 多语言文本识别(中文、英文、日文、韩文等)
- 手写体识别
- 低质量扫描件增强
- 表格结构识别

表格识别

Docling 的表格识别模块采用端到端深度学习模型,能够:
- 识别复杂嵌套表格
- 保留表格层级结构
- 输出 CSV/JSON/Markdown 多种格式
- 支持跨页表格合并

布局分析

文档布局分析模块可以识别:
- 标题、正文、列表
- 图片、图表、代码块
- 页眉、页脚、页码
- 分栏结构

安装方法

pip 安装(推荐)

pip install docling

安装 OCR 模型

pip install docling-ocr-models

Docker 安装

docker pull ghcr.io/docling-project/docling:latest
docker run -it ghcr.io/docling-project/docling:latest

API 使用示例

使用 Docling 进行文档解析非常简单,只需要几行 Python 代码即可完成。下面是几个典型的使用场景。

基础解析

下面是最基础的文档解析示例,支持 PDF、Word、图片等多种格式:

from docling.document_converter import DocumentConverter

converter = DocumentConverter()
result = converter.convert("document.pdf")

# 输出 Markdown
print(result.document.export_to_markdown())

# 输出 JSON
print(result.document.export_to_dict())

自定义 OCR 参数

from docling.datamodel.base_models import InputFormat
from docling.datamodel.pipeline_options import PdfPipelineOptions
from docling.document_converter import DocumentConverter

pipeline_options = PdfPipelineOptions()
pipeline_options.do_ocr = True
pipeline_options.ocr_options.lang = ["ch_sim", "en"]

converter = DocumentConverter(
    allowed_formats=[InputFormat.PDF],
    pipeline_options=pipeline_options
)
result = converter.convert("scanned_document.pdf")

表格提取

from docling.datamodel.base_models import TableResult

result = converter.convert("report.pdf")

for table in result.document.tables:
    print(f"表格位置: {table.bbox}")
    print(table.export_to_dataframe().to_markdown())

性能基准

在标准测试集上的性能表现:

指标Docling对比基线
PDF 解析速度15 页/秒5 页/秒
OCR 准确率(中文)96.5%91.2%
表格识别 F10.940.87
内存占用2.1 GB3.5 GB

下载链接

官方 GitHub 仓库:https://github.com/docling-project/docling

PyPI 页面:https://pypi.org/project/docling/

Docker Hub:https://hub.docker.com/r/ghcr.io/docling-project/docling

文档中心:https://docling.readthedocs.io/

生成待上传清单

本资源需上传至网盘后补充链接,文件清单如下:
- docling-2.129.0-py3-none-any.whl(约 45MB)
- docling-ocr-models-2.129.0-py3-none-any.whl(约 1.2GB)


授权协议:MIT License
项目主页:https://github.com/docling-project/docling