尧图网络科技YAOTU DIGITAL 获取报价
获取报价
首页 / 资讯中心 / 文章详情

计算机视觉26:单目深度与几何估计

发布时间:2026/9/29 21:55:52

资讯中心
01
ARTICLE

计算机视觉26:单目深度与几何估计

计算机视觉26:单目深度与几何估计
单目深度与几何估计深度图是一个单通道图像,每个像素表示到相机的距离。过去,不借助立体视觉或 LiDAR 从单个 RGB 帧预测深度是不可能的事。2026 年,一个冻结的 ViT 编码器加上轻量级预测头就能达到与真实值相差仅几个百分点的精度。类型:构建 + 使用语言:Python前置条件:第4阶段第14课 (ViT)、第4阶段第17课 (自监督视觉)、第4阶段第07课 (U-Net)时长:~60 分钟学习目标区分相对深度和度量深度,并说明各个生产模型(MiDaS、Marigold、Depth Anything V3、ZoeDepth)分别解决的是哪种使用 Depth Anything V3(DINOv2 骨干网络)对任意单张图像进行无需标定的深度预测解释为什么单目深度可以从单张图像中推算(透视线索、纹理梯度、学习的先验),以及它无法恢复什么(绝对尺度、被遮挡的几何)使用深度图和针孔相机内参将 2D 检测提升为 3D 点问题描述深度是 2D 计算机视觉中缺失的维度。给定 RGB 图像,你知道物体在图像平面上的位置;但你不知道它们有多远。深度传感器(立体相机、LiDAR、飞行时间传感器)可以直接解决这个问题,但价格昂贵、易损坏且量程有限。单目深度估计 — 从单个 RGB 帧预测深度 — 过去产生模糊、不可靠的输出。到 2026 年,大规模预训练编码器改变了这一局面:Depth Anything V3 使用冻结的 DINOv2 骨干网络,产出的深度图可泛化到室内、室外、医学和卫星等多个领域。Marigold 将深度估计重新定义为条件扩散问题。ZoeDepth 回归真实的度量距离。深度也是 2D 检测通往 3D 理解的桥梁:将检测框的像素乘以深度,就能将 2D 物体提升到 3D 点云。这是每个 AR 遮挡系统、每个避障管道、每个"拿起杯子"的机器人的核心技术。核心概念相对深度 vs 度量深度相对深度— 有序的z值,没有真实世界单位。“像素 A 比像素 B 更近,但距离比值没有锚定到米。”度量深度— 以米为单位的绝对距离。需要模型学习图像线索与真实距离之间的统计关系。MiDaS 和 Depth Anything V3 产出相对深度。Marigold 产出相对深度。ZoeDepth、UniDepth 和 Metric3D 产出度量深度。度量模型对相机内参敏感;相对模型则不敏感。编码器-解码器模式
02
RELATED NEWS

相关资讯

更多网站建设与数字化升级内容

03
WHY YAOTU

想打造同款高转化官网?

懂行业、懂生意,从建站到增长一站式陪跑

◈

场景化定制

不做模板站,围绕你的业务场景量身设计,小众不撞款。

◐

营销型架构

以转化目标组织内容与路径,让官网真正带来询盘。

▲

全周期服务

设计、开发、运营、运维一体,上线只是开始。

免费获取你的建站方案

留下需求,专属顾问 24 小时内为你输出方案建议。