IBM Research 开源 · MIT 许可证

让文档处理
变得简单

解析数十种文档格式,深度理解 PDF 的布局、表格与公式,并与生成式 AI 生态无缝集成。

Docling 处理管线:从多种文档输入到统一文档模型,再导出到各类 AI 框架
一条命令,把文档变成 AI 可用的结构化数据
  • PDF
  • DOCX
  • PPTX
  • XLSX
  • HTML
  • EPUB
  • Apple Pages
  • ODF
  • EML
  • MSG
  • XBRL
  • LaTeX
  • PNG
  • TIFF
  • JPEG
  • WAV
  • MP3
  • MP4
  • WebM
  • WebVTT
  • DocLang
  • 纯文本
  • Markdown

不只是文本提取,是真正理解文档

从页面布局到表格结构,从扫描版 OCR 到图表理解,Docling 把原始文档转换成富有表达力的统一表示。

深度理解 PDF

页面布局、阅读顺序、表格结构、代码、公式、图片分类,逐页重建文档的逻辑结构。

Docling 架构:打包的布局与表格模型汇入统一的 DoclingDocument 类型化表示

图表理解

柱状图、饼图、折线图可转换为表格或代码,并补充详细描述。

文档中的图表被转换为结构化数据表

统一的 DoclingDocument

统一且富有表达力的文档表示格式,导出 Markdown、HTML、WebVTT、DocTags 与无损 JSON。

专用 XML schema

支持 DocLang、USPTO 专利、JATS 论文与 XBRL 财务报告等专用格式。

本地执行

全流程可在本地运行,适用于敏感数据与网络隔离环境,数据不出域。

完善的扫描版 OCR多种视觉语言模型(VLM)GraniteDoclingASR 音频转写MCP Server 接入智能体docling-serve API 服务命令行工具

三步开始

安装、转换、集成。从第一行命令到结构化 Markdown,只需几分钟。

pip install docling

需要 Python 3.10 或更高版本。支持 macOS、Linux 与 Windows,x86_64 与 arm64 架构均可运行。

最新变化

  • 视频文件解析

    支持 MP4、AVI、MOV、MKV、WebM,输出 ASR 转写文本与代表性关键帧。

  • ODF 文档解析

    OpenDocument 文本文档(.odt)、电子表格(.ods)、演示文稿(.odp)。

  • XBRL 财务报告

    解析可扩展商业报告语言文档,面向财务数据结构。

  • 邮件文件解析

    支持 .eml 与 .msg 邮件格式,保留正文与附件结构。

  • EPUB 电子书

    解析 EPUB 电子书文件,输出连续的结构化内容。

  • Apple Pages

    兼容两代容器格式(Pages 5+ 与 iWork '09)。

  • 纯文本与 Markdown 超集

    解析 .txt、.text 以及 .qmd、.Rmd 文件。

  • 图表理解

    柱状图、饼图、折线图可转换为表格或代码,并补充详细描述。

接入你已有的 AI 技术栈

与主流框架和工具的原生集成,让 AI 应用更快落地。

LangChainLlamaIndexCrew AIHaystackMCP

把下一份文档交给 Docling