可以媲美YOLO的开源实时目标检测模型:RF-DETR,在 COCO 上达到 SOTA 水平,并专为微调设计

news2025/3/30 15:23:17

RF-DETR:SOTA 实时目标检测模型

RF-DETR 是由 Roboflow 开发并基于 Transformer 的实时目标检测模型架构,采用 Apache 2.0 许可证发布。

RF-DETR 是第一个在 Microsoft COCO 基准测试中超过 60 AP 的实时模型,同时在基础尺寸下具有竞争力。它还在 RF100-VL 目标检测基准测试中实现了最先进的性能,该基准测试衡量模型对现实世界问题的领域适应性。RF-DETR 的速度与当前实时目标检测模型相当。

( 60AP 是什么概念,知识补充:

当一个模型在 COCO 基准测试中达到 60 AP 时,意味着它的平均精度达到了 60%,这是一个非常高的水平。以下是几个关键点来理解这个分数的意义:

(1)高难度的评估标准

COCO 的 AP 计算方式非常严格,因为:

  • 它不仅考虑了 IoU=0.5 的情况,还综合了更高 IoU 阈值(如 0.75)的表现。
  • 模型需要在不同大小的目标上都能有良好的表现。

(2)与现有方法对比

在 COCO 目标检测任务中,60 AP 已经接近甚至超过了许多经典模型的表现。例如:

  • Faster R-CNN (早期的经典模型)在 COCO 上的 AP 大约在 30-40 左右。
  • YOLOv5/v7 等现代模型在默认配置下可以达到 50 AP 左右。
  • SOTA 模型 (如 Swin Transformer、DINO 等)在某些情况下可以达到 60 AP 或更高。

因此,60 AP 表明你的模型已经处于当前最先进的水平,尤其是在复杂场景和高精度要求的情况下。

(3)实际应用中的价值

60 AP 不仅是一个理论上的高分,也意味着模型在实际应用中可能具有很高的可靠性。例如:

  • 在自动驾驶领域,模型需要对小目标(如行人、交通标志)进行精准检测。
  • 在视频监控中,模型需要在复杂背景中准确定位目标。

基于DETR架构结合了DINOv2,在T4 GPU上处理每张图片约6毫秒,

有两个版本:
RF-DETR-base:参数量29M
RF-DETR-large:参数量128M

RF-DETR 足够小巧,可以在边缘设备上运行,能同时兼顾精度和实时性,使其成为需要强大准确性和实时性能的部署的理想模型。

实时推理:

模型变体:

RF-DETR 有两种变体:RF-DETR-B 29M RFDETRBase 和 RF-DETR-L 128M RFDETRLarge 。初始化任一类别时,将自动加载相应的 COCO 预训练检查点。

输入分辨率:

两种模型变体都支持可配置的输入分辨率。通常,更高的分辨率可以通过捕捉更多细节来提高预测质量,尽管它可能会减慢推理速度。您可以通过在初始化模型时传递 resolution 参数来调整分辨率。 resolution 的值必须是 56 的倍数。

训练:

1、数据集结构

RF-DETR 期望数据集采用 COCO 格式。将您的数据集分为三个子目录: train 、 valid 和 test 。每个子目录应包含自己的 _annotations.coco.json 文件,该文件包含该特定分割的注释,以及相应的图像文件。以下是目录结构的示例:

dataset/
├── train/
│   ├── _annotations.coco.json
│   ├── image1.jpg
│   ├── image2.jpg
│   └── ... (other image files)
├── valid/
│   ├── _annotations.coco.json
│   ├── image1.jpg
│   ├── image2.jpg
│   └── ... (other image files)
└── test/
    ├── _annotations.coco.json
    ├── image1.jpg
    ├── image2.jpg
    └── ... (other image files)

Roboflow 允许您从头开始创建目标检测数据集或将现有数据集从 YOLO 等格式转换为 COCO JSON 格式进行训练。您还可以探索 Roboflow 宇宙,以找到适用于各种用例的预标记数据集。

2、微调

您可以从预训练的 COCO 检查点微调 RF-DETR。默认情况下,将使用 RF-DETR-B 检查点。为了快速开始,请参阅我们的微调 Google Colab 笔记本。

from rfdetr import RFDETRBase
model = RFDETRBase()
model.train(dataset_dir=<DATASET_PATH>, epochs=10, batch_size=4, grad_accum_steps=4, lr=1e-4)

3、批大小(Batch size)

不同的 GPU 拥有不同数量的 VRAM(视频内存),这限制了它们在训练过程中一次可以处理的数据量。为了使训练在任何机器上都能良好工作,您可以调整两个设置: batch_size 和 grad_accum_steps 。这些设置控制每次处理多少个样本。关键是保持它们的乘积等于 16——这是我们推荐的总体批处理大小。例如,在像 A100 这样的强大 GPU 上,设置 batch_size=16 和 grad_accum_steps=1 。在像 T4 这样的较小 GPU 上,使用 batch_size=4 和 grad_accum_steps=4 。我们使用一种称为梯度累积的方法,该方法通过逐步收集更新并在调整权重之前模拟较大批次的训练来让模型模拟使用较大批次的训练。

4、多 GPU 训练

您可以使用 PyTorch 的分布式数据并行(DDP)在多个 GPU 上微调 RF-DETR。创建一个 main.py 脚本来初始化您的模型,然后像往常一样调用 .train() ,然后在终端中运行它。

python -m torch.distributed.launch \
--nproc_per_node=8 \
--use_env \
main.py

将 8 中的 --nproc_per_node argument 替换为你想使用的 GPU 数量。这种方法为每个 GPU 创建一个训练进程,并自动分配工作负载。请注意,你的有效批量大小会乘以 GPU 的数量,因此你可能需要调整你的 batch_size 和 grad_accum_steps 以保持相同的整体批量大小。

5、结果检查点

在训练过程中,将在指定的输出目录中保存两个模型检查点(常规权重和基于 EMA 的权重集)。EMA(指数移动平均)文件是模型权重随时间平滑的版本,通常能带来更好的稳定性和泛化能力。

6、载并运行微调模型

from rfdetr import RFDETRBase
model = RFDETRBase(pretrain_weights=<CHECKPOINT_PATH>)
detections = model.predict(<IMAGE_PATH>)

7、ONNX 导出

RF-DETR 支持将模型导出为 ONNX 格式,这可以实现与各种推理框架的互操作性,并可以提高部署效率。要导出您的模型,只需初始化它并调用 .export() 方法即可。

from rfdetr import RFDETRBase
model = RFDETRBase()
model.export()

开源地址:
https://github.com/roboflow/rf-detr?tab=readme-ov-file#fine-tuning

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://www.coloradmin.cn/o/2322557.html

如若内容造成侵权/违法违规/事实不符,请联系多彩编程网进行投诉反馈,一经查实,立即删除!

相关文章

【hadoop】hadoop streaming

API&#xff1a; https://hadoop.apache.org/docs/stable/hadoop-streaming/HadoopStreaming.html&#xff08;hadoop3&#xff09; https://cwiki.apache.org/confluence/display/HADOOP2/HadoopStreaming&#xff08;hadoop2&#xff09; hadoop version查看hadoop版本&#…

Unity-RectTransform设置UI width

不知道有没人需要这样的代码&#xff0c;就是.sizeDelta //不确定是不是英文翻译的原因&#xff0c;基本很难理解&#xff0c;sizeDeltaSize&#xff0c;//未必完全正确&#xff0c;但这么写好像总没错过 //image 在一个UnityEngine.UI.Image 的数组内foreach (var image in l…

【现代深度学习技术】现代卷积神经网络04:含并行连接的网络(GoogLeNet)

【作者主页】Francek Chen 【专栏介绍】 ⌈ ⌈ ⌈PyTorch深度学习 ⌋ ⌋ ⌋ 深度学习 (DL, Deep Learning) 特指基于深层神经网络模型和方法的机器学习。它是在统计机器学习、人工神经网络等算法模型基础上&#xff0c;结合当代大数据和大算力的发展而发展出来的。深度学习最重…

链表-LeetCode

这里写目录标题 1 排序链表1.1 插入法 O&#xff08;n&#xff09;1.2 归并排序 1 排序链表 1.1 插入法 O&#xff08;n&#xff09; /*** Definition for singly-linked list.* struct ListNode {* int val;* ListNode *next;* ListNode() : val(0), next(nullpt…

【STL】vector介绍(附部分接口模拟实现)

文章目录 1.介绍2.使用2.1 vector的构造2.2 vector空间相关接口2.2.1 size()2.2.2 capacity()2.2.3 empty()2.2.4 resize()2.2.5 reserve() 2.3 vector的增删查改2.3.1 push_back()2.3.2 insert()2.3.3 pop_back()2.3.4 erase()2.3.5 swap()2.3.6 operator[]注&#xff1a;关于…

一周掌握Flutter开发--8. 调试与性能优化(上)

文章目录 8. 调试与性能优化核心技能8.1 使用 Flutter DevTools 分析性能8.2 检查 Widget 重绘&#xff08;debugPaintSizeEnabled&#xff09;8.3 解决 ListView 卡顿&#xff08;ListView.builder itemExtent&#xff09; 其他性能优化技巧8.4 减少 build 方法的调用8.5 使用…

游戏引擎学习第182天

回顾和今天的计划 昨天的进展令人惊喜&#xff0c;原本的调试系统已经被一个新的系统完全替换&#xff0c;新系统不仅能完成原有的所有功能&#xff0c;还能捕获完整的调试信息&#xff0c;包括时间戳等关键数据。这次的替换非常顺利&#xff0c;效果很好。 今天的重点是在此基…

C语言_数据结构_二叉树

【本节目标】 树的概念及结构 二叉树的概念及结构 二叉树的顺序结构及实现 二叉树的链式结构及实现 1. 树的概念及结构 1.1 树的概念 树是一种非线性的数据结构&#xff0c;它是由n&#xff08;n>0&#xff09;个有限结点组成一个具有层次关系的集合。把它叫做树是因为…

Compare全目录文件比较内容(项目中用到过)

第一步&#xff1a;找到“会话”——“会话设置” 会话设置弹框信息 第二步&#xff1a;选择“比较”tab标签 比较内容&#xff1a;选中二进制比较 第三步&#xff1a;选中所有文件 第四步&#xff1a;右键选中“比较内容” 第五步&#xff1a;选中“基于规则的比较”

3.26[a]paracompute homework

5555 负载不平衡指多个线程的计算量差异显著&#xff0c;导致部分线程空转或等待&#xff0c;降低并行效率。其核心矛盾在于任务划分的静态性与计算动态性不匹配&#xff0c;尤其在处理不规则数据或动态任务时尤为突出。以稀疏矩阵的向量乘法为例&#xff0c;假设其非零元素分…

视觉大模型CLIP论文精读

论文&#xff1a;Learning Transferable Visual Models From Natural Language Supervision 代码&#xff1a;https://github.com/openai/CLIP 摘要 最先进的计算机视觉系统是针对预测一组固定的、预先确定的对象类别进行训练的。这种受限的监督形式限制了它们的通用性和可用…

链表的创建:头插法与尾插法详解(数据结构)

C 链表的创建&#xff1a;头插法与尾插法详解 链表&#xff08;Linked List&#xff09;是一种重要的数据结构&#xff0c;适用于插入和删除操作频繁的场景。本文介绍 两种常见的链表构建方法&#xff1a; 尾插法&#xff08;Append / Tail Insertion&#xff09;&#xff1a;…

深入解析 Java 类加载机制及双亲委派模型

&#x1f50d; Java的类加载机制是确保应用程序正确运行的基础&#xff0c;特别是双亲委派模型&#xff0c;它通过父类加载器逐层加载类&#xff0c;避免冲突和重复加载。但在某些特殊场景下&#xff0c;破坏双亲委派模型会带来意想不到的效果。本文将深入解析Java类加载机制、…

MySQL数据库精研之旅第四期:解锁库操作高阶技能

专栏&#xff1a;MySQL数据库成长记 个人主页&#xff1a;手握风云 目录 一、查看所有表 1.1. 语法 二、创建表 2.1. 语法 2.2. 示例 2.3. 表在磁盘上对应的⽂件 三、查看表结构 3.1. 语法 3.2. 示例 四、修改表 4.1. 语法 4.2. 示例 五、删除表 5.1. 语法 5.2.…

【DevOps】DevOps and CI/CD Pipelines

DevOps 是一种将开发与运维实践相结合的模式&#xff0c;旨在缩短软件开发周期并交付高质量软件。 DevOps 是什么&#xff1f; 开发团队与运维团队之间的协作 • 持续集成与持续交付&#xff08;CI/CD&#xff09; • 流程自动化 • 基础设施即代码&#xff08;IaC&#xff09;…

VS自定义静态库并在其他项目中使用

1、VS创建一个空项目或者静态库项目 2、右键项目 属性 修改生成文件类型 3、生成解决方案 4、复制.h文件和.lib文件作为静态库 5、创建一个新项目 测试使用新生成的静态库 在新项目UseStaticLib中加一个新文件夹lib&#xff0c;lib中放入上面的.h和.lib文件。 6、vs中右…

力扣32.最长有效括号(栈)

32. 最长有效括号 - 力扣&#xff08;LeetCode&#xff09; 代码区&#xff1a; #include<stack> #include<string> /*最长有效*/ class Solution { public:int longestValidParentheses(string s) {stack<int> st;int ans0;int ns.length();st.push(-1);fo…

vue3 项目中预览 word(.docx)文档方法

vue3 项目中预览 word&#xff08;.docx&#xff09;文档方法 通过 vue-office/docx 插件预览 docx 文档通过 vue-office/excel 插件预览 excel 文档通过 vue-office/pdf 插件预览 pdf 文档 安装插件 npm install vue-office/docx vue-demi示例代码 <template><Vu…

DHCP(Dynamic Host Configuration Protocol)原理深度解析

目录 一、DHCP 核心功能 二、DHCP 工作流程&#xff08;四阶段&#xff09; 三、关键技术机制 1. 中继代理&#xff08;Relay Agent&#xff09; 2. Option 82&#xff08;中继信息选项&#xff09; 3. 租期管理 4. 冲突检测 四、DHCP 与网络架构交互 1. MLAG 环境 2.…

创建login.api.js步骤和方法

依次创建 login.api.js、home.api.js...... login.api.js、home.api.js 差不多 导入到 main.js main.js 项目中使用