昊梵体育网

当无人机睁开"全知之眼":Insta360等机构联合打造的全景视频AI

这项由Insta360研究院联合中国科学院自动化研究所、清华大学、武汉大学及美国加州大学默塞德分校共同完成的研究,以预印

这项由Insta360研究院联合中国科学院自动化研究所、清华大学、武汉大学及美国加州大学默塞德分校共同完成的研究,以预印本形式于2026年7月10日发布在arXiv平台,论文编号为arXiv:2607.09661。研究的核心成果是一个名为PanoWorld的系统,它解决了一个长期困扰AI视频生成领域的难题:如何让机器生成的全景视频,在摄像机大幅移动之后,仍然像真实拍摄一样保持场景的物理一致性。

普通人或许不太了解"全景视频生成"是什么,但你一定体验过它带来的痛点。当你戴上VR头显漫游一座虚拟城市,或者在无人机模拟器里驾驶飞行器穿越山谷,转弯之后景色突然"破碎"了,物体位置对不上,光影突然变了,甚至凭空出现了不该有的东西——这就是当前AI全景视频生成的最大短板。PanoWorld研究团队要解决的,正是这个让虚拟世界"穿帮"的根本问题。

一、全景视频为什么比普通视频难得多

普通手机拍出来的视频,就像从一扇窗户往外看,视野范围有限。而全景视频,则像是把你的头颅变成了一个透明水晶球,周围360度的景象全都被收录进来,上下左右无死角。这种记录方式在技术上叫做"等矩形投影",英文缩写是ERP。

把球面上的图像"压平"成一张矩形图,就像剥橘子皮再把它铺平一样,不可避免地会产生形变,尤其是顶部和底部会被拉伸得很厉害。这种形变给AI带来了巨大的学习困难,因为普通AI都是在"窗户视角"的普通图片上训练的,它对这种球面压平后的奇怪形状根本不熟悉。

更麻烦的是"长时记忆"问题。当无人机飞行了很长一段距离之后,AI如何记住"刚才飞过的那栋楼长什么样",并在摄像机转回来的时候保持一致?这就像你蒙眼转了好几圈之后,仍然要准确指出身后那栋楼的位置和外观——人类靠空间感,AI则需要一套精密的"记忆检索"机制。现有方法大多借用普通摄像机的那套逻辑来处理这个问题,结果在全景视频里经常出现"记忆错位",转个弯回来,之前的场景面目全非。

PanoWorld的出发点,是从全景图像本身的一个特殊性质入手,找到了一把解开这个难题的钥匙。

二、旋转不过是换了件外衣:PanoWorld的核心洞见

研究团队注意到,全景图像有一个非常独特的性质——旋转等变性。用一个生活化的类比来理解这件事:把地球仪转一圈,上面的地图内容没有变,只是你看到的区域移动了。全景图也是如此,当摄像机发生旋转时,图像中的内容其实没有真正改变,只是"流动"到了图像的另一个位置,形变的模式也相应地移动了。

这个发现意义重大。它意味着,摄像机的旋转运动,完全可以通过一个数学变换(对图像做个坐标变换)来处理,根本不需要AI去"理解"它。真正需要AI费心学习的,只有摄像机的平移运动——也就是在三维空间里真实地向前、向后、向上、向下移动。因为平移会改变近处和远处物体之间的相对位置关系,产生所谓的"视差"效果,这才是需要AI真正去建模的复杂现象。

于是,研究团队为PanoWorld设计了一个叫做"运动解耦"的机制:在训练和推理过程中,旋转运动被从轨迹里剥离出来,作为一个纯粹的几何变换直接处理,而AI只需要专注于平移运动的建模。这就像让一个画家只专心研究透视和光影变化,而不用操心画布本身是否被旋转了——因为旋转可以单独处理,不影响作画本身的难度。

围绕这一核心洞见,PanoWorld包含了两个具体的技术模块,分别处理"当前动作建模"和"长时记忆"这两个问题。

三、密集全景射线条件化:告诉AI每一束光从哪里来

第一个模块叫做DPRC,中文可以理解为"密集全景射线条件化"。为了让读者理解这个模块在做什么,不妨把摄像机想象成一个站在圆球中心的人,球的每个方向都有一束光从那个方向射入眼睛。全景摄像机捕捉的,就是来自所有方向的这些光线携带的颜色和亮度信息。

当摄像机在空间中移动时,这些光线的"起源方向"和"携带信息"都会发生变化。一棵近处的树,向右平移之后,它就会从视野左边移到右边;而远处的山,几乎不会动。这种近处动、远处不动的差异,就是人类感知三维世界深度的重要线索,也叫视差。

DPRC的核心操作是:对全景图中的每一个像素点,都计算出对应的那束"光线"的方向,以及当摄像机按照指定轨迹移动时,这束光线与摄像机位移之间的精确几何关系。具体来说,对于图像上坐标为(i, j)的像素,研究团队通过球面坐标公式计算出对应的仰角θ和方位角φ,进而得到一个三维单位向量rcam,代表这束光线的方向。然后,对于每一束光线,以该光线方向为Z轴,构建一个局部的三维坐标系,并在这个坐标系里描述摄像机的平移向量。这个局部化的平移描述,让AI能够精确感知"摄像机的移动对这一方向的视觉内容造成了什么影响"。

这些几何信息通过一种叫做"投影位置编码"的方式,注入到AI模型的内部,像一张精密地图一样,引导AI在生成每一帧图像时,都能正确地"知道"光线应该从哪个方向打来、应该看到什么。这种方式比传统的光流方法更精确,因为它直接对应了全景图像的球面几何原理,而不是用平面图的逻辑去近似处理。

四、几何感知记忆增强:让AI像有"位置感"的人一样记住曾经见过的景色

第二个模块叫做GMA,可以理解为"几何感知记忆增强"。这个模块解决的是长时记忆问题:当无人机飞出去很远再飞回来,AI怎么"记住"之前看到的场景?

GMA的工作方式,类似于一种有"方向感"的照片存档系统。每当AI处理一帧图像,这帧图像对应的视觉特征就会被存入一个"记忆库",同时记录下当时摄像机的位置和每个方向的光线信息。当AI需要生成新的一帧时,它会用当前位置和方向的光线信息去检索记忆库,找到"曾经从相近方向看到的内容",作为参考。

这里有个精妙的设计:记忆库里的内容和当前查询,都用同一套"光线坐标系"来描述。这意味着,当摄像机再次朝着某个方向飞行,或者从某个角度望向远处的地标时,记忆检索是基于三维空间的几何对应关系,而不是基于图像像素的表面相似性。就好比一个有方向感的人,不是靠"这个画面看起来像我之前拍的照片"来认路,而是靠"我现在面朝北方、距离那栋楼大约两公里"来唤起对应的记忆。

为了防止记忆检索出错——比如检索到根本看不见的方向的记忆——GMA还设计了一个"置信度引导的门控机制"。简单来说,AI会计算每一条"记忆线索"的可靠程度:如果当前视角和记忆中的视角重叠度很高(几何上高度吻合),就给这条记忆较高的权重;如果几乎没有重叠,就忽略它,避免引入错误的视觉内容。最终生成的每一帧,都是把当前AI自己的判断和高置信度历史记忆按权重融合的结果,保证了场景的物理一致性。

五、三阶段训练:像教练一样循序渐进地培养AI能力

PanoWorld的两个模块不是同时训练的,而是按照一个精心设计的三阶段流程,逐步培养起来的。这个安排,类似于培养一个运动员:先打基本功,再学核心技术,最后整合提升。

第一阶段,研究团队用LoRA微调技术(一种轻量级的AI模型调整方法)对底层视频生成模型进行全景适配训练。LoRA就像给一个在普通照片上训练的画家上一堂"球面几何速成课",让他理解全景图特有的极点形变和左右边界连续性问题。为了让这堂课特别有针对性,训练时采用了一种"纬度感知重建损失"——越靠近图像顶部和底部(对应球面的南北极),这些形变最严重的区域,训练时给予更高的关注权重。

第二阶段,冻结第一阶段学到的视觉基础,专门训练DPRC动作模块。这一阶段被细分为三个子步骤:先用最简单的直线运动数据入门,让AI建立"平移会产生视差"的基本感知,同时通过对图像和轨迹做90度、180度旋转的数据增强,强迫AI学会应对各种方向的平移;接着用全部真实世界数据继续训练,适应复杂的飞行动态;最后用精确合成数据进行精细打磨,提升轨迹控制的精度。

第三阶段,冻结前两个阶段的全部参数,只训练GMA记忆模块。这一阶段同样分两步:先用较短的帧对训练基础的空间重建能力,再用161帧的长序列训练完整的记忆驱动生成能力。

六、World360数据集:给AI准备的"真实世界飞行训练场"

现有的全景视频数据集大多是室内场景或街道平面视角,场景变化相对单调,光照条件也比较稳定,根本撑不起需要在高空、多高度、复杂天气下运行的全景世界模型。研究团队因此专门构建了World360数据集。

这个数据集包含12万条高质量序列。其中7万条来自真实世界,由特制的全景无人机(Anti-Gravity系列)在公园、道路、人工湖、建筑群等多种户外环境中实际飞行采集,涵盖了各种复杂的六自由度飞行轨迹。另外5万条来自高保真仿真,由AirSim360平台在8个不同的户外虚拟场景中生成,提供了精确无误的相机位姿和深度信息标注。

为了保证数据质量,研究团队设计了一套细致的数据处理流水线。真实数据在采集后要经历时间对齐(把59.94帧/秒的全景摄像机和200Hz的惯性导航系统数据精确同步)、旋转解耦(把摄像机的自转从视频中剥离出来)、姿态噪声抑制(用卡尔曼滤波器去除飞行时的抖动和GPS漂移)、空间均匀重采样(把按时间等间隔采样改为按飞行距离等间隔采样,每0.05米一帧,消除悬停时的冗余帧)等多道工序,最终切割成81帧或161帧的训练片段。

数据还配备了文本描述。研究团队用Qwen3-VL视觉语言模型对每条视频提取环境描述(严格要求不描述摄像机运动,只描述场景环境),并按长度区分为"简洁版"和"详细版"两种,供模型训练时随机切换使用。此外,所有数据都经过了多维度的照明质量过滤:过暗(平均亮度低于30)、对比度过低(标准差低于20)、过曝(超过40%像素强度超过250)的片段都会被剔除,确保AI学到的是物理上合理的光照规律。

相比之下,现有的其他全景数据集,如360-1M虽然有超过百万条,但几乎都是街道平面视角,没有高度变化,也没有精确的位姿标注。World360是目前已知唯一同时具备真实多高度航拍、精确位姿、深度信息和高质量文本标注的全景世界模型数据集。

七、实验结果:数字背后的真实表现

研究团队从World360中抽取了90条涵盖前进、后退、侧移、上升、下降、弧形飞行、环形飞行等多种轨迹类型的评测序列,与三个最先进的对比方法——Imagine360、Matrix-3D和OmniRoam——进行了全面比较。

在视觉质量方面,PanoWorld在分布保真度指标FID上达到了27.64,而Matrix-3D为34.63、OmniRoam为60.77、Imagine360更是高达81.18(FID越低越好)。专门针对全景图极点区域的FIDpole指标,PanoWorld为47.21,而Matrix-3D为67.88,OmniRoam为85.25。这意味着PanoWorld在全景图最难处理的"头顶"和"脚下"区域,也能保持较好的结构完整性。在时间对齐指标FAED上,PanoWorld以2.63大幅领先于Matrix-3D的3.39和OmniRoam的3.36。

在轨迹控制精度方面,研究团队采用了PSNR(峰值信噪比)指标来衡量生成视频与真实飞行视频之间的相似度——这个值越高,说明AI生成的内容越接近真实飞行看到的样子。在视频第20至25帧窗口内,PanoWorld的PSNR为22.83,Matrix-3D为20.47,OmniRoam为18.51。更重要的是,在视频末段(第75至80帧),PanoWorld依然保持在20.92,而Matrix-3D降到了18.02,OmniRoam更是滑落至17.02。这说明随着飞行时间延长,PanoWorld的场景一致性远比对手稳定。

研究团队还用了一个叫做ViPE的工具,从生成的视频中反推出摄像机轨迹,再与真实轨迹对比。从对比图中可以直观地看出,PanoWorld重建出的飞行轨迹与真实轨迹高度吻合,而Matrix-3D和OmniRoam的轨迹都出现了明显的偏离和漂移。定性比较结果同样印证了这一点:在上升运动场景中,Matrix-3D的画面出现了明显的模糊和"空洞"(场景结构崩塌);在垂直飞行场景中,由于OmniRoam是在固定高度数据上训练的,它根本无法正确响应上下移动的指令,画面出现了严重的重影和伪影;而PanoWorld在弧形、上升、后退等各种复杂运动中,都保持了清晰的场景结构和正确的透视关系。

消融实验(即通过逐一去掉模块来验证每个模块的贡献)进一步证实了GMA记忆模块的价值。去掉GMA之后,PSNR在第20到25帧窗口从22.83下降到21.92,在末段从20.92下降到19.85;而如果用随机记忆代替GMA(即不管几何关系随机检索历史帧),PSNR更是暴跌到15.51。这说明GMA的几何对齐记忆检索机制,对于维持长程一致性至关重要,随机记忆不仅没有帮助,反而会主动破坏场景结构。

八、实时生成扩展:8秒出一段161帧全景视频

PanoWorld的完整模型生成一段81帧的全景视频需要约4分48秒,这在工业应用场景中还是偏慢。研究团队因此做了一个"实时化"的扩展版本,利用一种叫做Causal Forcing(因果强制)的技术,把完整模型压缩成一个轻量级的快速生成器。

Causal Forcing的核心思想是"师生蒸馏":用训练好的完整模型作为"老师",通过让"学生模型"模仿老师的输出分布,让学生在只需4步推理的情况下就能达到与老师相近的生成质量(老师需要数十步甚至更多)。具体实现时,研究团队把视频的21个潜在帧拆分成1帧干净的条件帧加上4组×5帧的生成块,每次只生成5帧,滚动向前推进,就像一列火车一节一节地往前走。

通过进一步的"滚动强制推理"扩展,这个实时模型还能生成161帧的长视频(约5.37秒钟的画面)。整个生成过程在单张NVIDIA H20显卡上只需8秒,相比完整模型的4分48秒提速约36倍,相比Matrix-3D的16.5分钟提速超过120倍,相比OmniRoam的31分钟提速约230倍。实时化版本的画质损失非常有限,FID从27.64小幅升至28.07,PSNR从22.83略降到21.93,在实际使用中几乎感知不到区别。

九、局限与未来:诚实面对还没解决的问题

研究团队在论文中坦诚地指出了PanoWorld目前的两个主要局限。

第一个问题出在"第一帧直接复制"的设计上。为了省去对初始帧的生成时间,PanoWorld直接把用户提供的真实照片作为第一帧拼进生成序列,但从第二帧开始就完全由AI生成。真实照片和AI生成图像之间存在一个难以消除的"风格鸿沟"——真实照片往往细节更丰富、噪声结构更自然,而AI生成的帧则有自己的视觉风格。这个接缝会在视频开头造成一个轻微的"质量跳变",并随着时间累积,影响长序列的整体一致性。

第二个问题是对初始帧的过度依赖。整个场景的"世界观"由第一帧确立,如果后续飞行轨迹延伸到了初始帧完全无法预判的全新区域(比如突然飞到一座完全不同风格的城市上空),AI的表现就会变得不稳定。

针对这两个问题,研究团队提出了两个未来研究方向:一是开发轻量级的"边界精修模块",平滑真实帧和AI生成帧之间的过渡;二是设计"动态记忆管理机制",让AI在飞行过程中不断把新生成的高置信度帧更新进记忆库,并主动遗忘过时的旧内容,从而支持在更大规模的开放世界中持续探索。

说到底,PanoWorld做的事情,是用一个非常巧妙的角度重新审视了全景视频生成的核心难题。旋转不是问题,因为它只是一种几何变换;真正的问题是平移产生的视差,以及长时飞行后如何保持场景记忆。把一个复杂的整体问题分解成几个可以分别击破的子问题,再用"光线几何"这根统一的线索把所有模块串联起来——这种思路让PanoWorld在几乎所有评测指标上都明显超过了现有方法,尤其是在长程一致性这个最难的维度上优势最为突出。

当然,目前这个系统还没有完美解决所有问题,第一帧的质量跳变和超长距离飞行的场景漂移依然存在。但从整体来看,它代表了全景世界模型领域一个清晰的前进方向:不是强行把普通摄像机的那套方法套用在全景图上,而是从球面图像本身的几何性质出发,重新设计每一个环节。对于正在快速发展的VR、无人机模拟、具身智能等应用场景来说,这种物理一致的全景世界生成能力,很可能成为下一代沉浸式体验的重要基础设施。有兴趣深入了解技术细节的读者,可以通过arXiv编号2607.09661查阅完整论文。

Q&A

Q1:PanoWorld生成的全景视频和普通AI视频生成有什么区别?

A:PanoWorld专门针对360度全景视频设计,核心区别有两点。第一,它能在摄像机大幅移动后保持场景的物理一致性,不会出现转个弯场景就"破碎"的问题。第二,它理解球面几何,会正确处理全景图特有的极点形变问题,而不是把普通平面视频的处理逻辑强行套用在全景图上。

Q2:World360数据集和现有全景数据集最大的区别是什么?

A:现有大型全景数据集(比如360-1M)虽然数量庞大,但几乎都是街道平面视角拍摄的,高度变化很小,也没有精确的摄像机位置标注。World360是目前已知唯一同时包含真实多高度无人机航拍、精确六自由度位姿标注、深度信息和文本描述的全景数据集,并且经过了严格的曝光质量过滤,更适合训练需要应对复杂空中场景的全景世界模型。

Q3:PanoWorld实时化版本的速度提升是怎么实现的?

A:实时化版本使用了"Causal Forcing"技术,本质是师生压缩:让完整模型作为老师,训练一个只需4步推理的轻量学生模型来模仿老师的输出。生成时采用滚动窗口方式,每次只生成5帧,循环推进,单张H20显卡8秒即可生成161帧全景视频,相比原始完整模型提速约36倍,画质损失非常有限。