技术路线新突破:阿里云开源发布0.8B文档解析模型OvisOCR2

凤凰网科技07-24 15:17

凤凰网科技讯 7月24日,阿里云正式开源发布文档解析模型OvisOCR2。该模型以综合得分96.58刷新OmniDocBench v1.6榜单纪录,成为首个超越传统流水线方法并登顶该榜单的端到端模型,标志着文档解析领域迎来重要技术路线突破。

此前文档解析领域由“流水线方法”主导,需依次调用版面分析、文字识别等多个模型,存在维护成本高、误差累积等问题。OvisOCR2采用端到端路线:输入文档图像后,模型一次性输出符合自然阅读顺序的Markdown格式结果,覆盖文本、公式、表格和视觉区域,一个模型完成过去多模型协作的工作。

该模型由Qwen3.5-0.8B后训练得到,仅0.8B参数量即实现SOTA性能。训练采用监督微调、强化学习、在线策略蒸馏和模型融合四阶段流程,并构建了真实与合成文档互补的数据引擎体系,以充分释放紧凑模型潜力。OvisOCR2已以Apache 2.0许可证开源,兼容vLLM等主流推理框架,可与Qwen3.5生态无缝衔接。

免责声明:本文观点仅代表作者个人观点,不构成本平台的投资建议,本平台不对文章信息准确性、完整性和及时性做出任何保证,亦不对因使用或信赖文章信息引发的任何损失承担责任。

精彩评论

我们需要你的真知灼见来填补这片空白
发表看法