Datalab推出Marker 2,文档转换速度提升5倍,准确率领先同类工具

1 阅读4分钟开源
Datalab推出Marker 2,文档转换速度提升5倍,准确率领先同类工具

概览

Datalab 今日正式发布 Marker 2, 完全重写的文档转换管线, 支持 PDF、图片、PPTX、DOCX、XLSX、HTML、EPUB 等多种格式, 可输出 Markdown、JSON、HTML 或块状结构。 全新架构围绕三大组件:Surya OCR 2(20 M 参数布局模型)、加速版 pdftext 以及统一的管线调度器,实现了显著的速度与精度提升。

主要特性

  • 三种转换模式
    • balanced:在 GPU 上使用 Surya VLM 进行布局识别并在文本质量欠佳时重新 OCR, 在 olmOCR‑bench 上取得 76.0% 总体得分。
    • fast:轻量化的 rf‑detr/onnx 布局检测 + pdftext, 仅 66.6% 但吞吐达 7.4 页/秒。
    • ‑disable_ocr:纯文本层提取,全部在 CPU 上运行,得分 43.6%,吞吐 23.7 页/秒。
  • 设备感知:默认 balanced 在 GPU,fast 在 CPU/MPS,可通过 --mode 手动覆盖。
  • 多工作进程共享 Surya 推理服务器,实现了单机多进程的吞吐放大。

基准对比

系统总体得分Born‑digital吞吐(页/秒)备注
Marker 2 balanced76.0%83.5%2.9超过 MinerU 5.4×
MinerU pipeline72.7%83.3%0.54与 Marker 在数字文档上持平
Docling50.3%64.0%2.1侧重治理与格式兼容
LiteParse (CPU)22.4%20.4%OCR 关闭时 1721 pg/s

在同等硬件(单块 B200 GPU)下,Marker 2 在速度与精度上均领先。 对于需要高准确率且不希望每页调用 API 的场景,balanced 模式提供了接近 Gemini Flash 3.5(85.8%)的表现,仅差 0.4 分。

授权与商业化

  • Marker 2 代码采用 Apache 2.0,模型权重使用 Modified AI Pubs OpenRAIL‑M,研究与个人使用免费,创业公司年收入 < 5 M 美元亦可免费使用,超出需付费商业授权。
  • MinerU、Docling、LiteParse 各自采用不同的开源许可证,商业使用门槛亦有差异,企业在选型时需结合自身收入规模与合规要求。

适用场景

  • 高吞吐文档处理:fast 与 ‑disable_ocr 在 CPU 上即可实现数十页/秒,适合大规模批处理。
  • 精细布局抽取:balanced 在复杂表格、数学公式等结构化文档上保持最高得分。
  • 成本敏感部署:无需 GPU 的 pure‑text 模式降低硬件投入。

结论

Marker 2 通过三模态设计兼顾速度、成本与准确率, 在公开基准 olmOCR‑bench 中实现了 5 倍以上的吞吐提升,并在多数子类目上超过同类开源工具。 对于希望在本地部署、保持可控成本的企业或研发团队,Marker 2 提供了最具性价比的选项。

本文是对第三方新闻源的主观解读。消息可能出现过时、不准确、歧义或错误的地方,仅供参考使用。点击此处查看消息源。