Token导航 LogoToken导航TokenDH.com

OCR这条赛道,已经被百度文心打穿了

更新时间 2026-06-02来源 BubbleBrain正文 885字阅读约 3分钟5 张图片
我一直认为OCR 是AI时代最被低估的技术之一,因为 OCR 是帮助模型理解现实世界的第一步。
这两天刷OmniBench的时候,发现百度发布了新一代的OCR模型,PaddleOCR-VL-1.6。
作为文心的衍生模型,之前他们发布的1.5版本,体验下来效果就非常不错,现在它们新发的1.6版本又把自己之前的SOTA 再次刷新了,总指标达到了96.33%,比一众通用模型和专用OCR模型都高。
而在比较复杂的 Real5-OmniDocBench 评测中,PaddleOCR-VL-1.6达到了93.19% ,成功超越了上一个这么牛逼的自己。。。
我拿我之前测1.5版本的一个case 又测了一下「图5」。
新版本已经可以做到全部都识别准确了,比之前确实更厉害了。
稍微了解了下,这次的PaddleOCR-VL-1.6在表格、图表、古籍、生僻字、连笔字识别等很多复杂场景上都有显著的提升。
这个提升带来的巨大好处是,获取实体数据给模型训练变得更加容易,同时也增强了大模型自身的多模态能力。
因为随着大模型的不断发展,互联网数据已经远远不能满足模型的需要了。还需要大量且高质量的实体数据,比如图书馆里的书籍,还有很多古籍等等,
这些都是OCR发挥大用处的场景,PaddleOCR-VL-1.6 能直接帮助文心理解这些内容,不需要拆书,压平,标准化等处理,它就能准确识别、精准理解。
所以,它不仅仅只是一次普通的OCR升级,同时也在帮助文心大模型进一步强化获取知识的能力。
目前PaddleOCR-VL-1.6已经上线PaddleOCR官网,支持网页端和API调用。同时模型代码及权重也已经开源到GitHub和Huggingface了,模型本身只有0.9B大小,非常适合部署使用。
这一次,PaddleOCR-VL-1.6不仅再次刷新了全球OCR的纪录,更让人清楚地看到,中国团队在这条赛道上已经完全掌握了主动权。
它让大模型能够直接理解现实世界的文档,从图书馆古籍到企业档案,从扫描件到拍照文档,获取高质量数据的门槛大幅降低。未来,谁能更快、更准确地把现实世界的信息转化为可学习的数据,谁就能在大模型竞争中抢占先机。
图片
图片
图片
图片
图片
文章标签AI资讯
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多