尧图网络科技YAOTU DIGITAL 获取报价
获取报价
首页 / 资讯中心 / 文章详情

论文分享:面向遥感影像旋转目标视觉定位的统一框架与数据集

发布时间:2026/9/28 20:42:41

资讯中心
01
ARTICLE

论文分享:面向遥感影像旋转目标视觉定位的统一框架与数据集

论文分享:面向遥感影像旋转目标视觉定位的统一框架与数据集
论文分享面向遥感影像旋转目标视觉定位的统一框架与数据集论文分享A Unified Framework and Dataset for Oriented Object Visual Grounding in Remote SensingArxiv: https://arxiv.org/abs/2609.28230作者Zeyu Ding、Yong Zhou、Jiaqi Zhao、Wen-Liang Du、Xixi Li、Hancheng Zhu、Rui Yao、Abdulmotaleb El Saddik研究方向遥感视觉语言、指代表达理解、旋转目标检测代码AI4RS GitHub 和 Eagle_o2_vg时间2026年9月27日一句话概括论文聚焦遥感图像中的旋转目标视觉定位给定一句自然语言描述在图像中找到对应目标并用带方向的旋转框精确表示。作者提出 O²-VG 系列模型将判别式定位、无文本提示的通用旋转候选框生成、视觉语言模型生成式定位组合成一套框架同时构建了配套数据集 DIOR-R-RSVG。研究背景与问题视觉定位visual grounding要求模型根据表达式定位图像中的目标。例如“图像左侧的飞机”不仅要求识别“飞机”还要理解“左侧”这一空间关系。遥感影像中的目标常呈任意方向分布且具有尺度变化大、排列密集等特点。常见的水平框HBB会包含较多背景区域对斜向或细长目标尤其不精确。旋转框OBB通过中心、宽高和角度描述目标更适合这一场景。论文指出了两类现有方法的不足判别式视觉定位通常基于水平框和专用任务头生成式视觉语言模型虽然接口灵活但逐 token 输出坐标速度较慢也可能生成结构不合法的框。此外已有遥感指代表达数据与旋转框标注之间缺少直接配对。核心方法O²-VG 模型家族模型作用核心设计O²-VG-Trans判别式视觉定位基线通过跨模态 Transformer 融合图像与文本特征依据表达式选择查询再直接预测旋转框。O²-VG-Uni通用旋转候选框生成与目标检索不依赖具体文本提示生成前景旋转框保留候选框的语义嵌入可缓存后用文本特征检索目标。O²-VG-VLM生成式视觉语言定位将 O²-VG-Uni 的候选框作为提示输入 VLM以多 token 预测并行生成旋转框坐标。O²-VG-Trans用语言引导旋转框定位模型以 ResNet 提取多尺度图像特征以冻结的 BERT 编码指代表达再通过跨模态编码器交换图像与文本信息。语言特征参与候选查询选择解码器进一步融合视觉与文本上下文最终输出目标类别匹配分数和旋转框。旋转参考框周围的采样点也随目标角度旋转以适配任意方向的目标。这一机制让模型能够更精准地贴合斜向或细长目标减少背景干扰。O²-VG-Uni先找“可能的物体”再按语义检索O²-VG-Uni 分两阶段训练第一阶段利用类别文本对齐视觉表征第二阶段冻结视觉分支并使用可学习的 objectness prompt 来提取前景目标。推理时可以先缓存候选框及其特征再用文本嵌入计算相似度完成目标检索。这样候选框生成与用户查询解耦可支持复用候选结果的检索流程。O²-VG-VLM框内并行块间保持因果顺序O²-VG-VLM 使用 Moon-ViT 图像编码器和 Qwen2.5 语言解码器。旋转框的中心、宽、高和角度被离散化为 token。模型将一个 OBB 表示为 7-token 块边界标记加五个框参数块内并行预测不同块之间仍按因果顺序生成因此后续块可以依赖此前已经确定的内容。论文给出三种推理模式逐 token 解码的Slow、直接并行生成框块的Fast以及默认并行、遇到低置信度或不确定坐标时回退到逐 token 解码的Hybrid。这一设计试图在输出速度和结构可靠性之间取得平衡。数据集DIOR-R-RSVGDIOR-R-RSVG 将遥感图像、指代表达和旋转框配成三元组。其构建从 DIOR-RSVG 的图像、表达式和水平框出发与 DIOR-R 中同图、同类别的旋转框进行匹配自动匹配后再人工检查并复核未匹配和失败样本。项目统计图像数17,402 张800 × 800 像素表达式 / 旋转框数38,320 对训练集26,991验证集3,829测试集7,500类别数20表达式平均长度7.5 个词实验结果主要定位指标是Prτ旋转 IoU 不低于阈值 τ 的样本比例、meanIoU样本级旋转 IoU 平均值和 cumIoU汇总交并面积后计算的 IoU。以下数字为论文稿报告值单位为百分比。判别式模型O²-VG-Trans数据集Pr0.5meanIoUcumIoUVRSBench67.7155.0161.14AVVG18.0014.5916.64DIOR-R-RSVG67.2356.7367.33论文报告其在三套数据集上均优于比较的 Rotated GiT、Rotated GDINO 和 Rotated EGDINO。消融实验中移除跨模态编码器融合后 meanIoU 从 56.73 降至 51.87改为静态查询选择后降至 53.67说明早期视觉语言交互和语言引导查询对性能有明显贡献。生成式模型O²-VG-VLM数据集Pr0.5meanIoUcumIoU参数规模表中 BPSVRSBench69.6759.8459.363B12AVVG31.2926.4427.523B12DIOR-R-RSVG78.3567.8574.663B12在论文的对比实验中O²-VG-VLM 的定位指标高于 GeoChat 和 GeoGround且模型规模为 3B对比方法为 7B。推理模式对比显示Fast 模式比 Slow 模式快表中分别为 13 和 2但定位精度略低Hybrid 模式的速度接近 Fast精度通常介于 Fast 与 Slow 之间。例如 DIOR-R-RSVG 上三种模式的 meanIoU 分别为 68.64、67.57、67.85。引入 O²-VG-Uni 候选框后该数据集的 meanIoU 从 61.90 提升到 67.85表明候选框先验对生成式定位有帮助。O²-VG-Uni候选框召回与检索使用 100 个候选框时O²-VG-Uni 在 VRSBench、AVVG、DIOR-R-RSVG 上的 AR₅₀:₉₅ 分别为 55.48、73.61、59.76使用 300 个候选框时分别为 56.41、75.36、60.78。论文还报告了目标检索 F1三套数据集依次为 56.86、3.65、49.25。AVVG 上的检索分数显著偏低提示跨数据集迁移或检索阈值仍有改进空间。论文的主要贡献提出覆盖判别式定位、通用候选框和生成式定位的 O²-VG 模型家族。将 OBB 几何先验与视觉语言模型结合并以块内多 token 预测提升生成效率。构建包含表达式与旋转框配对标注的 DIOR-R-RSVG补充遥感旋转视觉定位数据资源。在 VRSBench、AVVG 和 DIOR-R-RSVG 上进行定位、候选框和检索实验展示不同方案的适用能力。个人解读与讨论这项工作的重点不只是把输出框从水平框改成旋转框而是尝试把旋转几何、语言条件定位和生成式接口放进同一条技术路线。三种模型的分工也比较清楚Trans 提供强判别式定位器Uni 把视觉候选框变成可复用的中间表示VLM 则借助这些候选框减少生成搜索难度。多 token 预测是生成部分最值得关注的设计。一个旋转框的坐标和边界标记天然构成固定结构块块内联合预测有利于并行解码块间因果约束则保留多目标输出的顺序依赖。实验也显示了速度与精度的折中Fast 更快Slow 更准Hybrid 尝试在两者之间平衡。分享总结O²-VG 将遥感视觉定位从水平框扩展到旋转框并以“跨模态判别定位—通用候选框—生成式多 token 定位”形成一套互补方案。论文报告的结果表明旋转候选框先验能够提升生成式定位效果多 token 预测能显著提高解码速度DIOR-R-RSVG 则为该任务提供了较大规模的表达式与 OBB 配对数据。
02
RELATED NEWS

相关资讯

更多网站建设与数字化升级内容

03
WHY YAOTU

想打造同款高转化官网?

懂行业、懂生意,从建站到增长一站式陪跑

◈

场景化定制

不做模板站,围绕你的业务场景量身设计,小众不撞款。

◐

营销型架构

以转化目标组织内容与路径,让官网真正带来询盘。

▲

全周期服务

设计、开发、运营、运维一体,上线只是开始。

免费获取你的建站方案

留下需求,专属顾问 24 小时内为你输出方案建议。