Datalab推出Marker 2,文档转换速度提升5倍,准确率领先同类工具
•1 阅读•4分钟•开源
LiteParseDatalabDoclingMarker 2MinerU
•1 阅读•4分钟•开源

概览
Datalab 今日正式发布 Marker 2, 完全重写的文档转换管线, 支持 PDF、图片、PPTX、DOCX、XLSX、HTML、EPUB 等多种格式, 可输出 Markdown、JSON、HTML 或块状结构。 全新架构围绕三大组件:Surya OCR 2(20 M 参数布局模型)、加速版 pdftext 以及统一的管线调度器,实现了显著的速度与精度提升。
主要特性
- 三种转换模式:
- balanced:在 GPU 上使用 Surya VLM 进行布局识别并在文本质量欠佳时重新 OCR, 在 olmOCR‑bench 上取得 76.0% 总体得分。
- fast:轻量化的 rf‑detr/onnx 布局检测 + pdftext, 仅 66.6% 但吞吐达 7.4 页/秒。
- ‑disable_ocr:纯文本层提取,全部在 CPU 上运行,得分 43.6%,吞吐 23.7 页/秒。
- 设备感知:默认 balanced 在 GPU,fast 在 CPU/MPS,可通过
--mode手动覆盖。 - 多工作进程共享 Surya 推理服务器,实现了单机多进程的吞吐放大。
基准对比
| 系统 | 总体得分 | Born‑digital | 吞吐(页/秒) | 备注 |
|---|---|---|---|---|
| Marker 2 balanced | 76.0% | 83.5% | 2.9 | 超过 MinerU 5.4× |
| MinerU pipeline | 72.7% | 83.3% | 0.54 | 与 Marker 在数字文档上持平 |
| Docling | 50.3% | 64.0% | 2.1 | 侧重治理与格式兼容 |
| LiteParse (CPU) | 22.4% | 20.4% | — | OCR 关闭时 1721 pg/s |
在同等硬件(单块 B200 GPU)下,Marker 2 在速度与精度上均领先。 对于需要高准确率且不希望每页调用 API 的场景,balanced 模式提供了接近 Gemini Flash 3.5(85.8%)的表现,仅差 0.4 分。
授权与商业化
- Marker 2 代码采用 Apache 2.0,模型权重使用 Modified AI Pubs OpenRAIL‑M,研究与个人使用免费,创业公司年收入 < 5 M 美元亦可免费使用,超出需付费商业授权。
- MinerU、Docling、LiteParse 各自采用不同的开源许可证,商业使用门槛亦有差异,企业在选型时需结合自身收入规模与合规要求。
适用场景
- 高吞吐文档处理:fast 与 ‑disable_ocr 在 CPU 上即可实现数十页/秒,适合大规模批处理。
- 精细布局抽取:balanced 在复杂表格、数学公式等结构化文档上保持最高得分。
- 成本敏感部署:无需 GPU 的 pure‑text 模式降低硬件投入。
结论
Marker 2 通过三模态设计兼顾速度、成本与准确率, 在公开基准 olmOCR‑bench 中实现了 5 倍以上的吞吐提升,并在多数子类目上超过同类开源工具。 对于希望在本地部署、保持可控成本的企业或研发团队,Marker 2 提供了最具性价比的选项。
本文是对第三方新闻源的主观解读。消息可能出现过时、不准确、歧义或错误的地方,仅供参考使用。点击此处查看消息源。