[CL]《HPD-Parsing: Hierarchical Parallel Document Parsing》S Wei, J Wu, L Zhang, Q Xie… [paddleocr] (2026)
在文档解析领域,基于视觉语言模型(VLM)的统一解析器正面临效率瓶颈。过去的方法受困于单条路径的自回归生成模式,本质原因是将全局布局协调与局部内容解码混为一谈,导致处理长文档时推理延迟随字数呈线性激增。
本文的核心洞见是:把文档解析重新看作一个层级化并行过程。由此,主布局分支负责全局结构编排,并动态分发多个局部内容分支进行并发解码,结合多预测机制(P-MTP)这一关键操作使整体解码步数缩减了 18 倍。
这项工作真正留下的遗产是证明了层级并行架构在保持高精度的同时,能将文档解析吞吐量提升至原有基准的 3 倍以上。它为后来者打开的新门是将该范式扩展至多页文档理解与复杂信息提取,但尚未跨过的门槛是进一步降低每步解码所需的注意力计算开销。
arxiv.org/abs/2607.18839 机器学习 人工智能 论文 AI创造营








