尧图网络科技YAOTU DIGITAL 获取报价
获取报价
首页 / 资讯中心 / 文章详情

GroundingDINO 零样本开集检测快速指南:一句话定位任意目标

发布时间:2026/9/16 12:29:46

资讯中心
01
ARTICLE

GroundingDINO 零样本开集检测快速指南:一句话定位任意目标

GroundingDINO 零样本开集检测快速指南:一句话定位任意目标
GroundingDINO 零样本开集检测快速指南一句话定位任意目标【免费下载链接】GroundingDINO[ECCV 2024] Official implementation of the paper Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection项目地址: https://gitcode.com/GitHub_Trending/gr/GroundingDINOGroundingDINO 是 ECCV 2024 论文《Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection》的官方 PyTorch 实现。它接收「图片 句子」作为输入输出图中目标的边界框和置信度解决的核心问题是传统检测器只能识别固定类别而它让你用自然语言描述目标。固定类别表的局限Faster R-CNN、DETR 这类检测器在训练时就绑定了类别表认识 cat、dog但不认识「左边那只狮子」或「举着红伞的人」。已有的零样本方法大多只把「类别名」迁移到新类别提示词一旦变成描述句就开始失准。Grounding DINO 的路线不同它把 DINO 检测框架与 GLIP 式的 grounded pre-training 结合把指代表达理解Referring Expression Comprehension直接纳入训练目标让句子到框的映射成为模型的基本能力。句子和图像如何融合成框模型由五部分组成文本 backbone、图像 backbone、特征增强层feature enhancer、语言引导的查询选择、跨模态解码器。句子和图片各自过 backbone 后先进入特征增强层做双向交叉注意力让图像特征「知道」句子在问什么接着语言引导的查询选择从句子中挑出最相关的查询跨模态解码器逐层用文本交叉注意力、图像交叉注意力和自注意力把它们迭代成框。最终输出 900 个框每个框对句子中的每个词都有一个相似度分数——你只需两个阈值框的最高相似度超过 box_threshold 才保留超过 text_threshold 的词作为类别名。GroundingDINO 整体框架block 1 为模型总览block 2 是特征增强层block 3 是跨模态解码器层从类别名到描述句都能用一句话检测任意类别不用维护类别表输入chair . person . dog .就能拿到对应框。Swin-T 权重在 COCO 上零样本 48.4 AP没用过 COCO 数据训练最大的 GroundingDINO-L 达到 52.5 AP。适合快速扫描新类别图片或给无标注数据打标。用描述句定位特定个体不只认类别名写「the left lion」能指认出图中特定的一只狮子「the bottom man with his head up」能锁定某个具体的人。适合视觉问答、指代消解这类「要那一个不是那类」的需求。从闭集检测、零样本新类别到指代表达理解再到与 Stable Diffusion 协作的图像编辑在 COCO 上复现零样本 AP 仓库自带 demo/test_ap_on_coco.py跑 COCO val2017 零样本评测Swin-T 权重的官方参考值约 48.5。如果微调GroundingDINO-T 是 57.2 APGroundingDINO-L 在 test-dev 上 62.6/63.0 AP。COCO 结果表GroundingDINO-L 零样本 60.7 AP含 COCO 预训练版微调 62.6/63.0 AP没有 GPU 也能跑脚本支持--cpu-only开关安装时若没有设置 CUDA_HOME算子会自动以 CPU 模式编译无 GPU 的机器可以直接体验只是速度慢一些。用 Gradio 起一个本地 Web 演示demo/gradio_app.py 把模型包成了 Gradio 网页界面启动脚本、浏览器打开、传图输字就能看到检测效果适合快速给团队演示。最快上手路径3 条命令出第一张结果 git clone https://gitcode.com/GitHub_Trending/gr/GroundingDINOcd GroundingDINO pip install -e .然后从官方 release 下载 Swin-T 检查点groundingdino_swint_ogc.pth放到weights/目录下。最后跑单图推理脚本输入就用仓库自带的猫狗示例图demo/inference_on_a_image.py 的示例输入 .asset/cat_dog.jpeg一只猫和一只狗python demo/inference_on_a_image.py \ -c groundingdino/config/GroundingDINO_SwinT_OGC.py -p weights/groundingdino_swint_ogc.pth \ -i .asset/cat_dog.jpeg -o logs/demo -t cat . dog .标注结果会写到logs/demo/pred.jpg。-t文本提示词建议用「. 」分隔多个类别句尾补一个句号效果更稳。想在代码里集成直接看 groundingdino/util/inference.py 里的load_model、load_image、predict、annotate四个函数即可。深入一步把检测结果喂给图像编辑配合 Stable Diffusion 做局部重绘 ️demo/image_editing_with_groundingdino_stablediffusion.ipynb 演示了完整管线先用 GroundingDINO 检测出目标区域再把区域交给 Stable Diffusion 做 inpainting。比如检测图里的 pandas然后把它们替换成 dogs and birthday cakes检测出 face 后换成短发。检测精度直接决定编辑区域准不准。GroundingDINO Stable Diffusion 示例先检测中列再对检测区域做生成式重绘配合 GLIGEN 做可控生成demo/image_editing_with_groundingdino_gligen.ipynb 把重绘后端换成 GLIGEN编辑时能指定文本落点和参考图像适合对生成内容的位置、外观有精确约束的场景。两个 notebook 都是「检测负责找位置、生成模型负责填内容」的组合拆开看容易理解。边界在哪去哪继续先说清楚局限仓库目前只发布推理代码和官方检查点README 的 TODO 里训练代码仍是未完成项权重文件不在仓库内需要单独下载。进阶入口跑通推理后看 demo/ 目录里的评测与编辑脚本模型配置参考 groundingdino/config/GroundingDINO_SwinT_OGC.py更多说明见 README.md。【免费下载链接】GroundingDINO[ECCV 2024] Official implementation of the paper Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection项目地址: https://gitcode.com/GitHub_Trending/gr/GroundingDINO创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
02
RELATED NEWS

相关资讯

更多网站建设与数字化升级内容

03
WHY YAOTU

想打造同款高转化官网?

懂行业、懂生意,从建站到增长一站式陪跑

场景化定制

不做模板站,围绕你的业务场景量身设计,小众不撞款。

营销型架构

以转化目标组织内容与路径,让官网真正带来询盘。

全周期服务

设计、开发、运营、运维一体,上线只是开始。

免费获取你的建站方案

留下需求,专属顾问 24 小时内为你输出方案建议。