目标检测20年(一)

news2025/3/20 7:28:02

今天看的文献是《Object Detection in 20 Years: A Survey》,非常经典的一篇目标检测文献,希望通过这篇文章学习到目标检测的基础方法并提供一些创新思想。

论文链接:1905.05055

一、摘要

1.1 原文

Object detection, as of one the most fundamental and challenging problems in computer vision, has received great attention in recent years. Over the past two decades, we have seen a rapid technological evolution of object detection and its profound impact on the entire computer vision field. If we consider today’s object detection technique as a revolution driven by deep learning, then back in the 1990s, we would see the ingenious thinking and long-term perspective design of early computer vision. This paper extensively reviews this fast-moving research field in the light of technical evolution, spanning over a quarter-century’s time (from the 1990s to 2022). A number of topics have been covered in this paper, including the milestone detectors in history, detection datasets, metrics, fundamental building blocks of the detection system, speed-up techniques, and the recent state-of-the-art detection methods.

1.2 翻译

目标检测作为计算机视觉中最基本、最具挑战性的问题之一,近年来受到了广泛的关注。在过去的二十年里,我们看到了物体检测技术的快速发展及其对整个计算机视觉领域的深远影响。如果我们认为今天的物体检测技术是一场由深度学习推动的革命,那么回到20世纪90年代,我们会看到早期计算机视觉的巧妙思维和长期视角设计。本文从技术发展的角度广泛回顾了这一快速发展的研究领域,跨越了四分之一个世纪的时间(从20世纪90年代到2022年)。本文涵盖了许多主题,包括历史上的里程碑检测器,检测数据集,度量,检测系统的基本构建块,加速技术以及最新的最先进的检测方法。

二、介绍

目标检测的目标是开发计算模型和技术,解决这样两个问题:目标是什么?目标在哪里?(其实就是分类和定位)

目标检测是实例分割、图像字幕、目标跟踪等视觉任务的基础。深度学习的发展也让目标检测取得了巨大的进步,现在目标检测已经广泛应用于许多现实场景如自动驾驶、机器人视觉和视频监控等。下图展示了过去二十年里与“目标检测”相关刊物的出版:

我们可以看到从1998年起刊物出版量逐步提升,2018年后增长幅度明显增加,且直到2021年都在持续增长。

不同检测任务的目标和条件不同导致任务难度有所不同,除了常见挑战如不同视角、光照和不同类物体变化之外,还有包括但不限于物体旋转、尺度变化、精确定位、密集和遮挡目标检测和检测速度的提升等。

本文的目的就是向读者展示相关技术的演变,令读者能够掌握基本概念并找到潜在未来方向,而忽略技术细节。

三、目标检测二十年发展

这个部分主要回顾目标检测历史发展,包括里程碑、数据集、指标和关键技术演变。

3.1 目标检测发展路线图

在前两个世纪,人们普遍认为目标检测经过了两个历史时期:传统目标检测时期(2014年以前)和基于深度学习的检测(2014年以后),如下图展示:

我们可以看到,2014年之前我们采用的是传统目标检测方法如VJ Det、HOG Det和DPM这些,在2014年出现了RCNN、YOLO、SSD这些以深度学习框架为主流的算法。并且深度学习的算法主要分为两类:单阶段检测和双阶段检测。

下面我们将以出现时间和性能为主要指引,重点突出背后的技术所在,如下图所示:

3.1.1 里程碑1

此时主要是传统的检测器。其实我们回顾早期20世纪90年代的检测技术,也是会觉得是视觉的巧妙设计和长期的视角。大多数早期检测算法都是基于手工特征的,由于缺乏有效图像表示,人们不得不设计复杂的特征表示和各种加速的方法。

3.1.1.1 Viola Jones Detectors

2001年,Viola和Jones首次实现不受任何限制的人脸实时检测。同等检测精度下,速度比其他算法快数十倍甚至数百倍。VJ检测器通过滑动窗口:即通过图像中可能的位置和比例,检测某窗口是否包含人脸。主要采用三种技术实现:“积分图像”、“特征选择”和“级联检测”。

3.1.1.2 HOG Detector

2005年,Dala和Triggs提出定向梯度直方图特征(Histogram of Oriented Gradients,HOG)描述符。这是一种对尺度不变特征变换和形状上下文的重要改进。HOG主要用来进行行人检测,通常是保持检测窗口大小不变的情况下,对输入图像进行多次缩放实现。其一直是许多计算机视觉应用的基础。

3.1.1.3 DPM

可变性零件模型(Deformable Part-based Model,DPM)是传统目标检测方法的缩影,最初由Felzenszwalb在2008年提出,属于HOG的一种延伸。其采用的是“分而治之”的思想,训练可以认为是一种合适的分解目标的方法,而推理则是对不同目标部分的检测合集。例如,检测汽车可以分解为检测车窗、车身和车轮。这又被成为“明星模型”,也是F等人提出的。之后,Girshick将该模型扩展到“混合模型”,以处理变化更大的物体。现在许多检测器都受到该模型的影响,如混合模型、硬负挖掘、边界框回归、上下文启动等。

3.1.2 里程碑2

基于卷积神经网络(CNN)的两阶段检测器。随着手工特征性能饱和,目标检测在2010年达到聘平缓期,直到2012年卷积神经网络的诞生。Girshick等人率先提出了带有CNN特征的区域(RCNN),那时之后目标检测发展迅速。基于深度学习的检测算法分为单阶段和双阶段,前者将框架为“一步完成”,后者将其作为“粗-精”的过程。

3.1.2.1 RCNN

RCNN(Region with CNN )首先通过选择性搜索提取一组对象建议(即候选框),然后将每个建议重新缩放成固定大小的图像,并输入在ImageNet上预训练的CNN模型加以提取特征。最后使用线性支持向量机(SVM)分类器预测区域内物体并识别类别。尽管RCNN取得了显著性能提升,但也有明显缺点:大量重叠区域上进行冗余特征计算导致速度较慢。SPPNet解决了该问题。

3.1.2.2 SPPNet

2014年He等人提出空间金字塔池化网络(Spatial Pyramid Pooling Network,SPPNet),引入了空间金字塔池化层,使CNN生成固定长度表示。输入图像只需要计算一次特征映射,然后生成任意区域的固定长度表示用于训练检测器,避免重复计算卷积特征。SPPNet比RCNN快20倍以上。但仍存在一定缺点:训练多阶段,只对全连接层进行微调,忽略之前的层。Fast RCNN解决了这些问题。

3.1.2.2 Fast RCNN

2015年Girshick提出Fast RCNN。该检测器能够在相同网络配置下同时训练检测器和边界框回归器。尽管其速度比RCNN快200倍以上,但仍存在缺陷:速度受到建议区域的限制。

3.1.2.3 Faster RCNN

2015年Ren等人提出了Faster RCNN。Faster RCNN引入了区域建议网络(Region Proposal Network,RPN),使得几乎没有成本的区域建议成为可能。从R-CNN到Faster RCNN,目标检测系统的大多数独立的模块都已经集成到一个统一的端到端学习框架中。尽管如此,后续检测阶段仍存计算冗余。

3.1.2.4 FPN

2017年,Lin等人提出FPN(Feature Pyramid Networks)。FPN开发出一种具有横向连接的自顶向下架构,用在所有尺度上构建高级语义。目前FPN已成为大多数最新检测器基本组成部分。

3.1.3 里程碑3

此部分主要是基于CNN的单阶段检测器。大多数两阶段检测器遵循从粗到精的处理范式,粗的使努力提高召回能力,精的是在粗的检测基础上细化定位,强调区分能力。工程中很少使用两阶段检测器,相反单阶段可以一步推理中检索所有对象,适用于移动设备,在密集和小物体方面性能收到影响。

3.1.3.1 YOLO

Joseph等人在2015年提出YOLO(You Only Look Once)yolo将单个神经网络应用与整个图像,将图像划分为多个区域,同时预测每个预取边界框和概率,检测速度大大提升,但精度有下降。YOLOv7引入动态标签分配和模型结构重新参数化等优化结构,速度和精度更优。

3.1.3.2 SSD

Liu等人于2015年提出SSD(Single Shot MultiBox Detector)。主要引入多参考点和多分辨率检测技术,显著提高对小目标的检测精度。SSD可以检测网络不同层的不同规模目标,其余检测器只能在顶层预测。

3.1.3.3 RetinaNet 

单阶段探测器检测精度一直落后于两阶段,2017年Lin等人提出了RetinaNet,密集检测训练过程中遇到的极端前景-背景类不平衡是主要问题。于是,他们引入新的损失函数:焦点损失(Focal Loss)重塑标准交叉熵损失,使检测器在训练过程中更多的关注难分类、错误分类的例子。

3.1.3.4 CornerNet

Law等人为解决锚框需要提供分类、回归参考等而建立大量参考框路径的问题抛弃了以前的范式,提出CornerNet,该算法将任务视为关键点的预测,获取关键点后,利用额外的嵌入信息对角落点进行解耦和重新分组,形成边界框。

3.1.3.5 CenterNet

Zhou等人于2019年提出CenterNet。它还是遵循基于关键点的检测范例,但消除了代价高昂的后处理,例如基于组的关键点分配和NMS,从而形成完全端到端的检测网络。

3.1.3.6 DETR

Transformers影响了整个深度学习领域,它抛弃了传统卷积算子,转而采用注意力单独计算,以客服CNN的局限性,获得全局尺度感受野,2020年Carion提出DETR,将目标检测视为一个集合预测的问题,并提出一个端到端的变压器检测网络。

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://www.coloradmin.cn/o/2318231.html

如若内容造成侵权/违法违规/事实不符,请联系多彩编程网进行投诉反馈,一经查实,立即删除!

相关文章

【MySQL数据库】存储过程与自定义函数(含: SQL变量、分支语句、循环语句 和 游标、异常处理 等内容)

存储过程:一组预编译的SQL语句和流程控制语句,被命名并存储在数据库中。存储过程可以用来封装复杂的数据库操作逻辑,并在需要时进行调用。 类似的操作还有:自定义函数、.sql文件导入。 我们先从熟悉的函数开始说起: …

WEB攻防-PHP反序列化-字符串逃逸

目录 前置知识 字符串逃逸-减少 字符串逃逸-增多 前置知识 1.PHP 在反序列化时,语法是以 ; 作为字段的分隔,以 } 作为结尾,在结束符}之后的任何内容不会影响反序列化的后的结果 class people{ public $namelili; public $age20; } var_du…

英伟达GTC 2025大会产品全景剖析与未来路线深度洞察分析

【完整版】3月19日,黄仁勋Nvidia GTC 2025 主题演讲|英伟达 英伟达GTC 2025大会产品全景剖析与未来路线深度洞察分析 一、引言 1.1 分析内容 本研究主要采用了文献研究法、数据分析以及专家观点引用相结合的方法。在文献研究方面,广泛收集了…

基于java的ssm+JSP+MYSQL的九宫格日志网站(含LW+PPT+源码+系统演示视频+安装说明)

系统功能 管理员功能模块: 个人中心 用户管理 日记信息管理 美食信息管理 景点信息管理 新闻推荐管理 日志展示管理 论坛管理 我的收藏管理 管理员管理 留言板管理 系统管理 用户功能模块: 个人中心 日记信息管理 美食信息管理 景点信息…

【Java】Mybatis学习笔记

目录 一.搭建Mybatis 二.Mybatis核心配置文件解析 1.environment标签 2.typeAliases 3.mappers 三.Mybatis获取参数值 四.Mybatis查询功能 五.特殊的SQL执行 1.模糊查询 2.批量删除 3.动态设置表名 4.添加功能获取自增的主键 六.自定义映射ResultMap 1.配置文件处…

遗传算法+四模型+双向网络!GA-CNN-BiLSTM-Attention系列四模型多变量时序预测

遗传算法四模型双向网络!GA-CNN-BiLSTM-Attention系列四模型多变量时序预测 目录 遗传算法四模型双向网络!GA-CNN-BiLSTM-Attention系列四模型多变量时序预测预测效果基本介绍程序设计参考资料 预测效果 基本介绍 基于GA-CNN-BiLSTM-Attention、CNN-BiL…

中兴B860AV3.2-T/B860AV3.1-T2_S905L3-B_2+8G_安卓9.0_先线刷+后卡刷固件-完美修复反复重启瑕疵

中兴电信B860AV3.2-T/B860AV3.1-T2_晶晨S905L3-B芯片_28G_安卓9.0_先线刷后卡刷-刷机固件包,完美修复刷机后盒子反复重启的瑕疵。 这两款盒子是可以通刷的,最早这个固件之前论坛本人以及其他水友都有分享交流过不少的固件,大概都…

《Python实战进阶》No27: 日志管理:Logging 模块的最佳实践(下)

No27: 日志管理:Logging 模块的最佳实践(下) 实战案例 :复杂场景下的 Logging 配置与使用 本实战案例在 Python 3.11.5环境下运行通过 在本案例中,我们将通过一个复杂的日志配置示例,全面展示 logging 模…

Web 小项目: 网页版图书管理系统

目录 最终效果展示 代码 Gitee 地址 1. 引言 2. 留言板 [热身小练习] 2.1 准备工作 - 配置相关 2.2 创建留言表 2.3 创建 Java 类 2.4 定义 Mapper 接口 2.5 controller 2.6 service 3. 图书管理系统 3.1 准备工作 - 配置相关 3.2 创建数据库表 3.2.1 创建用户表…

【Dive Into Stable Diffusion v3.5】1:开源项目正式发布——深入探索SDv3.5模型全参/LoRA/RLHF训练

目录 1 引言2 项目简介3 快速上手3.1 下载代码3.2 环境配置3.3 项目结构3.4 下载模型与数据集3.5 运行指令3.6 核心参数说明3.6.1 通用参数3.6.2 优化器/学习率3.6.3 数据相关 4 结语 1 引言 在人工智能和机器学习领域,生成模型的应用越来越广泛。Stable Diffusion…

《Waf 火绒终端防护绕过实战:系统程序副本+Certutil木马下载技术详解》

目录 绕过火绒终端安全软件的详细方法 方法一:利用系统程序副本绕过命令监控 方法二:结合certutil.exe副本下载并执行上线木马 注意事项 总结 实际案例解决方案 前提条件 详细操作步骤 1. 攻击主机(VPS)上的准备工作 2.…

上海高考解析几何

解析几何的核心思想。 1. 核心分析方法: 自由度引入 方程组中, n n n 个未知数需要 n n n 个等式来解出具体的值。 自由度 性质 一个未知数带来一个自由度,一个等式条件减少一个自由度(减少自由度的方式为消元)。…

【AVRCP】服务发现互操作性:CT 与 TG 的 SDP 协议契约解析

目录 一、服务发现的核心目标:能力画像对齐 二、控制器(CT)服务记录:控制能力的声明 2.1 必选字段:角色与协议的刚性契约 2.1.1 服务类标识(Service Class ID List) 2.1.2 协议描述列表&am…

MySQL:数据库基础

数据库基础 1.什么是数据库?2.为什么要学习数据库?3.主流的数据库(了解)4.服务器,数据库,表之间的关系5.数据的逻辑存储6.MYSQL架构7.存储引擎 1.什么是数据库? 数据库(Database,简称DB)&#x…

深入 Linux 声卡驱动开发:核心问题与实战解析

1. 字符设备驱动如何为声卡提供操作接口? 问题背景 在 Linux 系统中,声卡被抽象为字符设备。如何通过代码让应用程序能够访问声卡的录音和播放功能? 核心答案 1.1 字符设备驱动的核心结构 Linux 字符设备驱动通过 file_operations 结构体定…

OpenNJet动态API设置accessLog开关,颠覆传统运维工作模式

OpenNJet OpenNJet 应用引擎是高性能、轻量级的WEB应用与代理软件。作为云原生服务网格的数据平面,NJet具备动态配置加载、主动式健康检测、集群高可用、声明式API等多种强大功能。通过CoPliot副驾驶服务框架,在隔离控制面和数据面的情况下实现了高可扩…

案例5_4: 6位数码管轮播0-9【静态显示】

文章目录 文章介绍效果图提示代码&#xff08;不完整&#xff09; 文章介绍 5.1.2 数码管静态显示应用举例 要求&#xff1a; 1、仿真图同案例5_3 2、代码参考案例5_3和案例5_2 效果图 提示代码&#xff08;不完整&#xff09; #include<reg52.h> // 头文件#define uch…

navicat忘记已经连接过的数据库密码的操作步骤

第一步&#xff1a; 点击文件-》导出连接 第二步&#xff1a;选中具体的数据库&#xff0c;且勾选左下角的记住密码 第三步&#xff1a;打开刚刚导出的文件&#xff0c;找到对应加密后的密码 第四步&#xff1a;复制密码到工具点击查看密码 注&#xff1a;参考文章链接附…

Qt窗口坐标体系

坐标系&#xff1a;以左上角为原点&#xff08;0&#xff0c;0&#xff09;&#xff0c;X向右增加&#xff0c;Y向下增加 对于嵌套窗口&#xff0c;其坐标是相对于父窗口来说的 例如&#xff1a; 通过move方法实现

DeepSeek写打台球手机小游戏

DeepSeek写打台球手机小游戏 提问 根据提的要求&#xff0c;让DeepSeek整理的需求&#xff0c;进行提问&#xff0c;内容如下&#xff1a; 请生成一个包含以下功能的可运行移动端打台球小游戏H5文件&#xff1a; 要求 可以重新开始游戏 可以暂停游戏 有白球和其他颜色的球&am…