昊梵体育网

连杨立昆都下场围观了,这个OCR什么来头?

最近有个挺有意思的现象。

大家都在盯大模型、视频生成和智能体,结果一个看起来已经没什么新故事的OCR项目,又冲回了 HuggingFace 全球趋势榜前三,还被图灵奖得主杨立昆转发了。

这个百度开源的 Unlimited OCR,目前 GitHub Star 已经超过 1.65 万,HuggingFace 下载量达到 224 万。

比起刚发布时短时间冲上榜,我更在意的是,它一个月后还能再次回到全球前三。热度能够持续,往往说明开发者真的在使用,也确实遇到了它所解决的问题,那就是长文档到底应该怎么读。

单页 OCR 早已不算难,麻烦的是几十页的论文、合同、财报和扫描件。过去常见的处理方式是逐页识别,再把结果拼起来。页数一多,跨页表格容易断,阅读顺序可能混乱,前后信息也很难保持连贯。为了记住更多历史内容,显存和推理成本还会继续增加。

Unlimited OCR 这次被讨论,主要因为它试着把逐页处理变成整份连续解析。模型始终关注原始文档,只保留最近一段生成内容作为工作记忆,因此解析越长,KV Cache 也不会一路膨胀。

这类进展没有生成视频那么吸睛,却更接近企业真正需要的能力。知识库、合同审查、财务分析、科研检索,甚至办公 Agent,第一步都是先把文档完整读明白。

AI 应用继续进入业务深水区后,决定体验的未必都是最显眼的能力。

Unlimited OCR这次持续受到关注,说明开发者重视这些基础能力。