尧图网络科技YAOTU DIGITAL 获取报价
获取报价
首页 / 资讯中心 / 文章详情

CVPR27方向预测——当世界模型“跨不出”视角:基于CrossGeo的几何锚定世界模型

发布时间:2026/9/27 1:51:52

资讯中心
01
ARTICLE

CVPR27方向预测——当世界模型“跨不出”视角:基于CrossGeo的几何锚定世界模型

CVPR27方向预测——当世界模型“跨不出”视角:基于CrossGeo的几何锚定世界模型
CVPR27方向预测——当世界模型“跨不出”视角基于CrossGeo的几何锚定世界模型数据集与Pipeline仓库https://github.com/ZhongyaoTuo/crossgeo论文链接https://arxiv.org/abs/2605.07978Cross3R模型代码待开源独立于数据集仓库一、世界模型的“视角盲区”2026年世界模型World Model已经成为人工智能领域最核心的研究议程之一。从LeCun将世界模型定位为通向自主智能的关键路径到Meta、Google DeepMind、OpenAI等机构在视频世界模型、具身世界模型和自动驾驶世界模型上的密集投入这一领域的共识正在形成智能体需要的不仅是对当前观测的理解更是对环境如何随行动而演化的内部模拟能力。这一共识催生了大量令人印象深刻的工作。DriveDreamer-Policy将深度生成、未来视频生成和运动规划统一在一个模块化架构中使几何成为世界模型中“可查询的模态”。PAIWorld在WorldArena排行榜上取得第一其核心贡献是在扩散Transformer中增强了几何感知使多视角3D一致性达到SOTA。Cosmos、Wan2.1等视频基础模型进一步将世界模型的生成能力推向更高分辨率和更长时程。但当你审视这些模型所处理的“世界”时一个结构性的盲区就会浮现当前几乎所有世界模型都工作在“同一尺度、同一投影模型”的观测空间内。DriveDreamer-Policy处理的是车载相机沿道路行驶产生的连续视频流所有帧共享透视投影模型和近似相同的物理尺度。PAIWorld处理的是机械臂的头部相机和腕部相机视角差异虽然存在但物理尺度差异不超过一个数量级。Cosmos等通用视频世界模型更是假设输入和输出的所有帧来自相似的相机配置。这不是研究者的疏忽而是数据基础设施的约束。要训练一个能够跨尺度、跨投影模型进行预测的世界模型需要同步的跨尺度观测数据——卫星在5,726米高空的正交视图、无人机在30–120米高度的倾斜透视视图、地面相机在1.5米高度的水平透视视图三者必须在同一个物理坐标系中精确对齐。这样的数据在CrossGeo出现之前几乎不存在。现有世界模型评估基准同样暴露了这一盲区。TriWorldBench2026年9月首次将三视角一致性引入具身世界模型评估通过同步的头部、左腕和右腕视频使用19项指标评估三视角一致性、任务对齐、物理与3D一致性等维度。但TriWorldBench的三个视角全部在机械臂操作场景中物理尺度差异不超过一个数量级。WorldLensCVPR 2026覆盖了从像素质量到4D几何到闭环驾驶的全谱系评估但其所有维度都基于驾驶场景。WorldOlympiad的几何赛道通过高斯泼溅重建生成视频并评估结构一致性和跨视角相干性但同样局限于单尺度场景。世界模型领域缺失的正是一个跨越数量级以上的尺度差异、跨越正交和透视两种投影模型的“世界”。CrossGeo提供了这个“世界”——三视角同步观测、完整6自由度位姿、稠密度量深度覆盖85个全球场景。这意味着世界模型第一次可以在一个真实地理环境中、具有精确几何标注的、跨越三个数量级尺度的场景中进行训练和评估。二、相关工作图谱世界模型的技术版图与跨视角盲区2.1 世界模型的分类框架根据State of World Models 2026的分类当前世界模型可以分为几个主要家族决策耦合型如DreamerV3、LeWorldModel将世界模型直接嵌入强化学习循环学习环境的潜在动态以支持策略优化生成型如WorldDreamer、Cosmos通过大规模视频生成来模拟环境演化几何感知型如DriveDreamer-Policy、PAIWorld将显式的3D几何表示嵌入生成过程使预测不仅视觉上合理而且在几何上一致。在这三个家族中几何感知型世界模型与CrossGeo的关联最为直接。它们的核心洞察是仅靠像素级的生成质量不足以支撑可靠的下游决策世界模型必须维护一个几何上一致的场景表示。DriveDreamer-Policy将深度作为“可查询的模态”使视频生成和运动规划可以联合优化。PAIWorld通过增强扩散Transformer的几何感知在多视角3D一致性上取得了显著改善。2.2 跨视角生成作为世界模型的“前身”跨视角生成Cross-View Generation可以被视为跨尺度世界模型的前身。Sat2VidICCV 2021从单张卫星图生成街景全景视频通过3D点云同时约束几何一致性和时序一致性。但其自身也承认当处理立交桥或突出屋顶等结构时基于2.5D高度图的表示会失效且点云大小随视频帧数增长而爆炸限制了大规模场景的扩展。CrossViewDiff2024设计了卫星场景结构估计和跨视角纹理映射模块通过增强的跨视角注意力在去噪过程中注入几何控制但其控制是“软注入”而非“硬校正”。SatDreamer360ICLR 2026将跨视角生成推进到360°全景序列利用三平面场景表示、射线引导的像素注意力和全景对极约束时序注意力在扩散模型内部生成几何对齐且跨帧一致的序列。这些工作的共同特征是它们生成的是“地面视角的图像序列”而非一个可以被智能体查询和交互的“世界”。世界模型不仅需要生成图像还需要支持反事实推理“如果我往左转而不是往右转会看到什么”、空间查询“那个建筑在哪个方向”和动作规划“我应该怎么走才能到达目标”。2.3 跨视角一致性的评估进展世界模型评估领域正在快速认识到跨视角一致性的重要性。TriWorldBench的19项指标中三视角一致性是核心维度之一它评估的是“合理但独立的视频是否也构成了对同一任务的一致预测”。Selective Cross-View Consistency2026年8月研究了World Action Models中跨视角一致性应该施加在哪些输出坐标上发现一致性损失应用于视角协变坐标如预测的未来场景是有害的而应用于视角不变坐标如动作块则是有效的。这些工作揭示了一个深层问题跨视角一致性不是一个“单一指标”而是一个需要精细定义的多维度概念。对于不同任务视频生成、动作预测、空间推理一致性的含义和度量方式完全不同。世界模型需要一种能够统一这些不同维度的评估框架。2.4 现有工作的共同缺口综合以上脉络可以识别出三个未被填补的缺口缺口一跨尺度世界模型的缺失。所有现有世界模型——无论是驾驶、机械臂还是通用视频——都工作在单一物理尺度范围内。当世界模型需要同时处理卫星的5,726米高度和地面的1.5米高度时其内部表示、动态预测和一致性维护机制都需要重新设计。缺口二正交-透视投影的联合建模。卫星图像使用正交投影地面和无人机图像使用透视投影。现有世界模型的光栅化、注意力机制和损失函数几乎全部假设单一投影模型。Cross-View Splatter通过将卫星分支降维为高度图来回避这个问题但这是对卫星几何信息的“降维使用”。缺口三以卫星为全局锚的度量一致性。现有世界模型中的尺度一致性依赖于输入序列内部的相对关系。当输入跨越三个数量级时局部尺度估计的误差会在跨尺度传播中放大。卫星图提供了已知的物理尺度300米瓦片可以作为跨尺度世界模型的“度量锚点”——但这需要在世界模型的架构中显式地引入这一锚点。三、技术方案GeoWorld — 几何锚定的跨尺度世界模型3.1 核心思想本文提出的框架暂命名为GeoWorld的核心思想是将CrossGeo的三视角6自由度标注作为世界模型的“几何骨架”构建一个能够在卫星正交、无人机透视、地面透视三个尺度和两种投影模型之间进行动态预测和反事实推理的世界模型。与现有世界模型的根本区别在于现有模型预测的是“下一个观测”GeoWorld预测的是“在跨视角约束下的下一个观测”——每一步预测都必须与卫星坐标系中的全局几何保持一致且必须在三个视角之间维持几何一致性。3.2 系统架构GeoWorld包含四个协同组件组件一跨视角几何编码器Cross-View Geometry Encoder。世界模型的第一步是将多视角观测编码为一个统一的潜在状态表示。GeoWorld的编码器接收卫星图、无人机图和地面图作为输入利用Cross3R的跨视角定位能力将它们映射到卫星坐标系中然后构建一个三尺度特征金字塔卫星分支编码全局布局正交投影无人机分支编码中间尺度的3D结构透视投影地面分支编码局部细节透视投影。三个分支的特征在卫星坐标系中对齐后通过交叉注意力融合为一个统一的潜在状态。关键设计是投影感知的位置编码卫星分支的位置编码使用正交网格坐标透视分支的位置编码使用透视投影后的归一化坐标。两种编码在融合前通过一个学习的投影校正模块对齐确保同一物理位置在三个分支中具有一致的潜在表示。组件二动态预测器Dynamics Predictor。这是世界模型的核心——给定当前潜在状态和一个动作相机运动、智能体移动预测下一时刻的潜在状态。GeoWorld的预测器采用分层动态建模卫星层的动态预测主要捕获全局布局的变化如车辆移动导致的道路占用变化无人机层的动态预测捕获中等尺度的3D结构变化如建筑遮挡关系的变化地面层的动态预测捕获局部细节的变化如行人运动、光照变化。三层动态通过卫星坐标系的约束进行耦合确保预测结果在全局几何上一致。组件三几何一致性验证器Geometric Consistency Verifier。与现有世界模型仅通过像素级损失约束预测结果不同GeoWorld引入了一个显式的几何一致性验证器。给定预测的下一时刻潜在状态验证器将其解码为三个视角的预测图像和深度图然后通过以下检查(a) 从卫星视角和地面视角分别渲染的深度图在重叠区域是否一致(b) 预测的地面相机6自由度位姿是否与卫星坐标系中的运动轨迹一致© 预测的无人机位置是否在地面相机和卫星相机的几何约束范围内。验证器的反馈用于修正预测器的输出形成一个“预测-验证-修正”的闭环。组件四反事实推理接口Counterfactual Reasoning Interface。世界模型的核心价值在于支持反事实推理——回答“如果我做了不同的动作会看到什么”GeoWorld通过一个条件化的潜在状态解码器支持这一功能给定一个反事实动作如“将地面相机向左旋转30度”解码器生成对应的预测观测同时通过几何一致性验证器确保预测结果在卫星坐标系中仍然合理。3.3 三个核心任务任务一跨尺度动态预测Cross-Scale Dynamics Prediction。给定当前时刻的三视角观测和一个动作序列预测未来时刻的三视角观测。评估指标包括预测图像与真实图像的PSNR/SSIM/LPIPS、预测深度图与CrossGeo深度标注的MAE、以及预测位姿与真实位姿的6自由度误差。这个任务的独特挑战在于跨尺度误差传播卫星层预测的微小位置误差如1米在地面层可能对应数十像素的偏移在地面层预测的微小角度误差如1度可能对应卫星层数十米的位置偏移。GeoWorld需要通过几何一致性验证器来抑制这种误差传播。任务二跨视角反事实推理Cross-View Counterfactual Reasoning。给定一个地面视角的观测和一个反事实动作“如果从这个位置向北看会看到什么”预测该动作下的地面观测并同时预测对应的无人机和卫星视角的变化。这要求世界模型在三个坐标系中同时进行反事实推理而不仅仅是生成一个地面图像序列。这个任务与CrossViewDiff和SatDreamer360的生成任务有本质区别后者生成的是“合理的”地面图像GeoWorld生成的是“几何一致的”三视角预测。如果地面视角的反事实预测显示“前方有一条路”那么无人机视角的预测必须显示该区域确实存在道路卫星视角的预测必须显示该道路在卫星图中的对应位置。任务三世界模型驱动的跨视角导航World-Model-Driven Cross-View Navigation。给定一个卫星图上的目标位置和地面智能体的初始视角世界模型需要(a) 通过反事实推理预测不同行动路径下的观测序列(b) 通过几何一致性验证器评估每条路径的可行性© 选择最优路径并执行。这个任务将世界模型从“被动的预测器”转变为“主动的规划器”。与传统跨视角导航方法如基于拓扑地图或语义地图的导航的关键区别在于世界模型在每一步预测中都维护跨视角的几何一致性而非仅依赖预构建的地图。这意味着即使卫星图与地面观测之间存在外观差异世界模型仍然可以通过几何约束来指导导航。四、创新点创新点一首个跨尺度跨投影的世界模型框架现有世界模型——无论是驾驶世界模型、机械臂世界模型还是通用视频世界模型——都工作在单一物理尺度和单一投影模型下。GeoWorld是首个将卫星正交5,726米、无人机透视30–120米、地面透视1.5米三个尺度、两种投影模型统一在一个世界模型架构中的框架。三尺度分层动态建模和投影感知位置编码是实现这一统一的关键技术。创新点二以卫星为度量锚的几何一致性验证现有世界模型的一致性约束主要基于像素级损失或潜在空间距离缺乏对全局几何一致性的显式验证。GeoWorld的几何一致性验证器以卫星坐标系作为全局度量锚点通过跨视角深度一致性、位姿轨迹一致性和几何约束检查来验证预测结果的几何合理性。这个设计直接回应了Selective Cross-View Consistency的发现跨视角一致性应该施加在正确的坐标上而卫星坐标提供了最自然的“视角不变”参考。创新点三三视角6自由度标注支撑的世界模型评估现有世界模型评估基准WorldLens、WorldModelBench、TriWorldBench虽然开始关注几何一致性但缺乏精确的6自由度标注。TriWorldBench使用机械臂的头部和腕部相机视角差异有限WorldLens基于驾驶场景尺度单一。CrossGeo的三视角6自由度标注使得GeoWorld可以在真实地理环境中、跨越三个数量级尺度、具有精确几何真值的条件下评估世界模型的几何一致性。创新点四基于CrossGeo pipeline的可扩展世界模型评估CrossGeo的采集pipeline使得GeoWorld的评估环境可以按需扩展。研究者可以用同一套工具采集特定城市、特定地形如山区、沿海、工业区的三视角数据验证世界模型在不同地理环境下的泛化能力。这与现有世界模型基准使用固定数据集的做法形成了方法论上的差异。五、面临的挑战与开放问题挑战一三尺度潜在表示的尺度归一化。卫星、无人机、地面的特征具有完全不同的空间频率和语义粒度。卫星特征编码的是道路拓扑和建筑布局地面特征编码的是纹理细节和局部几何。如何在一个统一的潜在空间中表示这三个尺度的信息同时保持每个尺度的独特结构是一个需要实验验证的架构设计问题。挑战二跨尺度误差传播的抑制。如前所述卫星层预测的微小误差在地面层可能被放大数十倍。几何一致性验证器需要设计有效的误差检测和修正策略避免误差在跨尺度传播中累积。可能的方案包括在潜在空间中维护一个卫星坐标系的“全局误差估计”并根据该估计动态调整各尺度的预测权重。挑战三反事实推理的计算成本。对每个反事实动作生成三视角预测需要大量的前向传播。在实际应用中如实时导航可能需要限制反事实推理的深度和广度或者训练一个专门的“快速反事实解码器”来降低计算开销。挑战四Cross3R代码尚未开源。如果Cross3R代码在投稿截止前仍未发布可以用CrossGeo数据训练一个轻量级的跨视角定位网络作为几何编码器的替代实现。CrossGeo数据集的先行开源使这一路径完全可行。六、发表策略建议目标会议CVPR / ICCV / NeurIPS / ICLR。论文标题建议“GeoWorld: Geometry-Anchored World Models Across Satellite, Drone, and Ground Views”核心贡献的表述框架首个跨尺度跨投影的世界模型框架统一卫星正交、无人机透视和地面透视三个尺度以卫星为度量锚的几何一致性验证器和三尺度分层动态建模方法基于CrossGeo三视角6自由度标注的跨尺度世界模型评估协议在跨大陆测试集上的全面评估与消融实验风险与应对风险一与世界模型主流工作的距离。当前世界模型的主流是驾驶场景和机械臂操作GeoWorld的“跨尺度”设定相对小众。需要在论文中清晰地论证跨尺度世界模型不是“小众问题”而是地理空间智能、无人机自主导航、灾害响应等真实应用的核心需求。CrossGeo的85个全球场景为这种论证提供了数据基础。风险二TriWorldBench的竞争。TriWorldBench已经建立了“三视角世界模型评估”的先例。GeoWorld需要在“跨尺度”和“真实地理环境”两个维度上建立清晰的差异化。建议在论文中做一个系统性的对比表明确展示GeoWorld在尺度范围、投影模型多样性、地理覆盖和6自由度标注精度等维度上的独特性。风险三Cross3R代码未开源。如前所述可以用CrossGeo数据训练轻量级跨视角定位网络作为替代实现。结语世界模型的核心承诺是让智能体能够在内部模拟环境中“预演”未来从而在不付出真实代价的情况下做出更好的决策。但这个承诺有一个隐含的前提智能体的内部模拟环境必须与真实世界的几何结构保持一致。当一个智能体的观测跨越了从卫星到地面的三个数量级尺度时维护这种几何一致性就成为了世界模型面临的核心挑战。GeoWorld的核心思想可以概括为一句话让卫星成为世界模型的“度量尺”让三视角几何一致性成为世界模型的“正确性判据”。卫星图提供了一个全球可及、度量精确、不依赖外部基础设施的参考坐标系。当世界模型以卫星坐标系为锚点时跨尺度预测的误差传播可以被有效抑制反事实推理的几何合理性可以被显式验证。CrossGeo的pipeline使得GeoWorld的评估可以从“在固定数据集上验证”扩展到“在全球场景中评估”。当一个研究者不需要等待别人采集数据而是可以用同一套工具采集自己需要的三视角数据时世界模型的研究就从“在有限条件下优化指标”转向“在开放世界中检验假设”。数据集与Pipeline仓库https://github.com/ZhongyaoTuo/crossgeo论文链接https://arxiv.org/abs/2605.07978Cross3R模型代码待开源独立于数据集仓库
02
RELATED NEWS

相关资讯

更多网站建设与数字化升级内容

03
WHY YAOTU

想打造同款高转化官网?

懂行业、懂生意,从建站到增长一站式陪跑

◈

场景化定制

不做模板站,围绕你的业务场景量身设计,小众不撞款。

◐

营销型架构

以转化目标组织内容与路径,让官网真正带来询盘。

▲

全周期服务

设计、开发、运营、运维一体,上线只是开始。

免费获取你的建站方案

留下需求,专属顾问 24 小时内为你输出方案建议。