【歪七扭八的文件,AI终于能看懂了!百度0.9B小模型登顶全球,专治“随手拍”】
又有重磅消息:1月29日,百度正式开源发布了新一代文档解析模型——PaddleOCR-VL-1.5。你可能觉得这不就是个技术更新吗?但这次,事情真不简单。简单来说,它用一个极小的“身躯”(仅0.9B参数),干翻了一众国内外大模型,在全球最权威的文档解析评测OmniDocBenchV1.5上,以整体精度94.5%拿下了全球综合性能第⼀,把Gemini-3-Pro、DeepSeek-OCR、GPT-5.2等这些大佬都甩在了身后。
更让人兴奋的是,这不仅仅是一次分数的超越。它解决了一个困扰我们多年的真实痛点:你手机随手拍的、歪歪扭扭甚至弯折的文档照片,AI终于能真正“看懂”了。
以往,传统OCR技术大多假设文档是平整的矩形,一旦遇到现实中倾斜、弯折、有透视变形的“异形”文档,识别结果往往“字对结构乱”——表格错行、段落混杂,数据无法直接使用。
而PaddleOCR-VL-1.5的核心突破,在于全球首次实现了“异形框定位”能力。即使文档是梯形、弯折或拍照变形的,它也能像人眼一样,精准框选出每一行文字、每一个表格单元格的真实轮廓,并还原其原始版面结构。这标志着OCR从“识别文字”迈向了“理解文档”。
这项突破的技术和产业价值是巨大的。目前,行业内绝大多数OCR模型仍只适用于扫描件等规则文档;而一些多模态大模型虽有文档理解意识,却难以稳定输出精确的几何结构信息。而百度这次,是首次在模型层面系统性地解决了异形框定位问题,并达到了稳定可用的水平。根据百度自建的真实场景测试集显示,它在扫描、弯折、屏幕拍照、光线变化、倾斜这五大高频难点场景中,表现全面领先,总指标领先第二名近3个百分点。
这背后,是百度在OCR领域长达数年的深耕与积累。截至2026年1月,百度在OCR领域的中国发明专利授权量已达900余件,位居国内第一梯队。可以说,PaddleOCR-VL-1.5的发布,不仅是一次技术的登顶,更是将OCR技术的应用边界,从理想的“扫描世界”真正推向了复杂的“现实世界”。政务档案数字化、金融票据自动处理、跨境业务单据审核……那些过去需要大量人工介入矫正的环节,将迎来效率的质变。
一月份,中国AI领域的发力可谓密集。从DeepSeek到百度,顶尖团队在垂直领域的技术竞速,正在将一个个曾经“卡脖子”的实用难题,变成我们手中的利器。这一次,百度用一个小巧而强悍的模型告诉我们:AI的进步,正越来越贴近地面,解决我们工作中那些最具体、最头疼的麻烦。



