阿里开源0.8B端到端文档解析模型OvisOCR2,登顶OmniDocBench v1.6

2026年07月24日 14:22
本文共计567个字,预计阅读时长2分钟。
来源/aibase 责编/MoRanShiguang 墨染时光

7月24日,阿里巴巴宣布开源发布仅0.8B参数规模的文档解析模型OvisOCR2。在权威文档解析基准OmniDocBench v1.6评估中,该模型以96.58的综合得分登顶,成为首个全面超越传统流水线方法的端到端文档解析模型,标志着文档智能技术领域迎来突破性范式转折。

QQ20260724-140219.jpg

作为RAG检索、智能问答与企业知识库的核心基础设施,文档解析长期由“版面分析+内容识别”的流水线串联模式主导,面临维护成本高、误差逐级累积及部署复杂等瓶颈。基于Qwen3.5-0.8B后训练的OvisOCR2突破了上述限制,仅凭单模型一次生成即可按自然阅读顺序输出包含文本、公式、表格与视觉区域的Markdown表示。

在技术实现上,模型结合真实与合成数据互补的技术路径,并通过监督微调(SFT)、强化学习(RL)、在线策略蒸馏(OPD)及模型融合四大手段充分释放紧凑模型的潜力。

目前,OvisOCR2已基于Apache2.0协议在Hugging Face及魔搭社区全面开源,兼容vLLM等主流推理框架,可无缝无感接入千问生态。凭借小参数高效能的部署优势,该模型的推出大幅降低了高精度文档解析的显存与算力门槛,推动文档智能从复杂的系统工程向更简洁的高效模型驱动演进。

来源:阿里开源0.8B文档解析模型OvisOCR2,端到端方案登顶OmniDocBench | AIbase

声明:本文来自aibase,版权归作者所有。文章内容仅代表作者独立观点,不代表爱力方立场,转载目的在于传递更多信息。如有侵权,请联系 copyright#agent.ren。

相关图文

热门资讯

推荐专栏

爱力方

爱力方

机器人前沿资讯及信息解读
机器人大讲堂

机器人大讲堂

中国顶尖的机器人专业媒体服务平台
关注爱力方,掌握前沿具身智能动态

© 2025 爱力方

https://www.agentren.cn/