[LG]《Concurrent Image Understanding and Generation: Self-Correcting Coupled Markov Jump Processes》M Le, A Comas, A Lattas, S Moschoglou… [Google] (2026)
在多模态生成领域,图文脱节的“模态漂移”是一个悬而未决的难题。过去的方法受困于单向顺序解码或互不干涉的并行分支,本质原因是标准掩码扩散模型缺乏实时跨模态反馈,且一旦取消掩码便无法撤回错误,导致图文逻辑难以在生成过程中对齐。
本文的核心洞见是:把图文生成重新看作一个耦合的马尔可夫跳跃过程。由此,跨模态注意力引导的置信度评分与重掩码跳跃这一关键操作使问题得以解开:系统能根据另一模态的反馈动态撤回矛盾的决策,在单次推理中实现图文的实时“协商”与自我修正。
这项工作真正留下的遗产是证明了理解与生成可以在统一随机过程中实现互惠耦合,且性能随去噪步数增加而单调提升。它为构建具备逻辑自洽性的通用多模态智能体打开了新门,但尚未跨过的门槛是将此耦合机制扩展至视频、音频等更高维度的连续模态。
arxiv.org/abs/2607.13188 机器学习 人工智能 论文 AI创造营







