阿里开源 OvisOCR2——0.8B 参数的端到端文档解析模型,首次超越流水线方案

阿里发布了 OvisOCR2,一个仅 0.8B 参数的端到端文档解析模型。给定一份文档页面的图片,它可以直接生成按自然阅读顺序排列的 Markdown 输出,涵盖文字、公式、表格和视觉区域。

这是端到端模型首次在文档解析任务上超越传统的流水线方案(OCR + 版面分析 + 后处理的多步骤组合)。0.8B 的参数量意味着它可以在消费级 GPU 上运行,部署成本远低于传统的多模型流水线。

技术报告已公开,详细介绍了数据引擎——结合了经过筛选的真实文档数据和合成数据。


论文链接