让机器人真正看懂环境基于Every-Embodied的SAM分割与深度估计快速入门【免费下载链接】every-embodied仅需Python基础从0构建自己的具身智能机器人从0逐步构建VLA/OpenVLA/SmolVLA/Pi0 深入理解具身智能项目地址: https://gitcode.com/gh_mirrors/ev/every-embodiedEvery-Embodied 是一个面向新手与零基础用户具身智能开源教程项目带你用 Python 从 0 构建自己的机器人。本文以其中的「SAM 分割与单目深度估计」实战章节为入口用最短篇幅讲清楚机器人如何把SAM 分割与深度估计组合起来实现从看清物体到理解空间的三维感知。一句话核心SAM 负责回答这是什么物体、边界在哪深度估计负责回答它离我有多远两者结合才是完整的三维物体感知。一、为什么机器人要同时做分割和深度只给机器人一张 RGB 照片是不够的它既要认识物体又要知道距离才能规划抓取和避障。感知方式机器人能获取的信息局限性仅 SAM 分割这里有一个杯子2D 区域无距离感不知道杯子在桌边还是房间另一头仅深度估计这块区域离我比较近无物体概念边缘模糊容易抓空SAM 深度这个轮廓清晰的杯子中心距离我 0.8 米互补增强实现 3D 物体感知下面这张通用机器人模型架构图可以帮助理解感知看、抓取、导航都建立在对环境的理解之上。二、SAM 分割点一下毫秒级抠出物体SAMSegment Anything Model是计算机视觉领域的瑞士军刀它的三段式结构非常适合新手理解图像编码器ViT-H对整张图做深度特征提取一张图只需运行一次提示编码器把你的点击点、框选Box等提示转成向量掩码解码器Mask Decoder极其轻量毫秒级生成分割掩码——这就是交互 Demo 能实时响应的原因。在 Every-Embodied 的交互式实战里体验非常简单加载一张测试图片模型预先算好深度图并初始化 SAM左键点击物体前景、右键点击排除区域背景实时生成红色半透明 Mask 白色轮廓并打印该物体的平均深度。下图是一个典型场景理解结果每个物体都被独立抠出并着色机器人由此知道房间里有哪些东西。三、单目深度估计只用一张照片猜出距离 硬件深度相机结构光/双目可以直接测距但成本不低激光雷达则靠光速 × 飞行时间换算距离擅长全局测距但难以描述哪个物体在哪个深度而单目深度估计只需要一个普通摄像头。教程选用 DPTDense Prediction Transformer它靠学习上下文线索推断远近遮挡关系A 挡住 B说明 A 更近透视关系道路远端汇聚成一点相对大小同样大小的车看着小的离得远。下面是原图与 DPT 深度估计结果的直观对比新手必知的反直觉现象深度图里越亮越近、越黑越远。因为模型输出的是逆深度1/距离天空距离无穷远1/∞≈0所以是黑色近处物体数值大呈高亮黄色。记住口诀即可不会踩坑。四、组合起来轮廓 距离 三维物体感知单独看深度图边缘是模糊的单独看分割又缺少距离。两者融合后SAM 给出像素级精确的物体轮廓修正深度图的边缘模糊用 Mask 圈出物体区域取该区域的平均深度值得到物体中心距离我 0.8 米这样的结构化信息机器人由此可以规划从哪里下手、走什么路径去抓取。下图展示了室内场景中深度估计的空间层次近处阳台栏杆呈亮黄色远处房间内部偏暗紫层次清晰。五、新手环境配置三步跑通 SAM 深度估计 完整命令与说明见项目教程 01-sam和深度估计.md这里只给最小步骤第 1 步获取仓库并进入项目目录git clone https://gitcode.com/gh_mirrors/ev/every-embodied第 2 步安装依赖核心依赖为 PyTorch、Transformers、OpenCV教程中一条pip install命令即可装齐SAM 库的安装命令也在同一小节照抄即可。第 3 步下载 SAM 权重并运行下载 SAM ViT-H 权重文件sam_vit_h_4b8939.pth约 2.4 GB下载地址写在教程第四节的wget命令中准备一张测试图片替换脚本中的IMAGE_PATH运行交互式脚本即可在窗口里指哪分哪、实时测距。⚠️ 单目深度估计输出的是相对深度如 0~1 的数值若需要真实米制距离需借助相机参数或一个已知参考点对齐尺度——这一点教程中有明确说明。六、新手常见问题 ❓问题快速回答深度图为什么亮的反而近输出的是逆深度1/距离越近数值越大越亮深度图边缘为什么模糊单目模型固有局限用 SAM 的精确 Mask 来修正SAM 为什么能做到实时图像特征只算一次Mask 解码器极轻毫秒级出结果没有 GPU 能跑吗可以脚本会自动回退到 CPU只是交互会变慢七、下一步从看懂到抓对 掌握 SAM 深度估计后感知链路已经打通。Every-Embodied 的同一章节还提供了三个进阶方向抓取注意力热图在分割基础上定位抓哪里见 02-抓取注意力热图.md视频流式三维重建从单帧感知扩展到动态场景见 03-LingBot-Map视频流式三维重建.md视觉语言定位用自然语言指物见 04-Locate-Anything视觉语言定位.md。下图是抓取目标热图的直观效果机器臂视野中的杯子被高亮锁定这正是分割 深度感知向抓取决策延伸的一步。如果想先把具身智能的全貌看一遍建议从项目入门章节 01具身智能概述.md 读起再回到本文动手实践。【免费下载链接】every-embodied仅需Python基础从0构建自己的具身智能机器人从0逐步构建VLA/OpenVLA/SmolVLA/Pi0 深入理解具身智能项目地址: https://gitcode.com/gh_mirrors/ev/every-embodied创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考