基于RGB-D数据的三维场景识别研究

来源 :华中科技大学 | 被引量 : 0次 | 上传用户:mater
下载到本地 , 更方便阅读
声明 : 本文档内容版权归属内容提供方 , 如果您对本文有版权争议 , 可与客服联系进行内容授权或下架
论文部分内容阅读
场景识别是计算机视觉领域的一个经典研究问题,其中室内场景的准确识别有助于室内机器人和增强现实等应用的发展。然而室内场景通常存在空间布局多样、光照复杂以及物体相互遮挡等问题,给室内场景识别带来挑战。提供场景空间信息的深度(Depth)数据结合可以提供颜色和纹理等信息的RGB数据,为室内场景识别带来新的研究契机。因此,近年来基于RGB-D的室内场景识别得到了广泛的关注。针对基于RGB-D的室内场景识别的研究而言,目前在挖掘两种数据之间的相关性、有效融合场景中的全局和局部特征以及提取辨别性的特征表示等三个方面仍存在问题。本文针对以上问题展开研究,主要的工作包括以下三个方面:(1)本文提出一种基于图神经网络的三维场景识别算法,旨在利用图模型来建模RGB和Depth两种数据的局部特征之间的关系,进而在局部特征基础上实现RGB和Depth的融合。其中,局部特征以及局部特征之间的关系分别用图模型中的节点和边来表示。同时,局部特征在特定关系下的信息交互通过图模型中节点信息的聚合和更新操作来实现。(2)本文提出一种基于多尺度的三维场景识别算法,旨在引入RGB和Depth两种数据的多尺度特征来探究不同尺度的局部特征对RGB-D场景识别的影响。利用不同尺度互补特征得到更具有辨别性的特征,并在此基础上选择两种数据的多尺度局部特征。同时,本算法提出一个相似性的损失函数来保证局部特征选择的有效性。(3)本文提出一种基于视觉Transformer的三维场景识别算法,旨在特征提取阶段利用自注意力机制来建模特征之间的长期依赖关系,进而提取更具有辨别性的全局和局部特征。传统的CNN模型提供受限的局部卷积特征,没有考虑局部特征与全局特征之间的关系。考虑到Transformer可以建模特征之间的长期依赖关系,本算法利用视觉Transformer模型来提取RGB和Depth数据辨别性的局部和全局特征。
其他文献
视频修复是计算机视觉领域中近几年来热门的研究课题,在视频直播、短视频制作、自动化视频剪辑等领域有众多落地应用场景。得益于深度学习技术在计算机视觉领域中的蓬勃发展,视频修复技术也取得了长足的进步。然而,当前的视频修复算法框架都默认用户已经有了前置的视频目标分割结果,造成了算法在面向用户的时候交互不够友好,也导致了落地应用的局限性。另一方面,前置视频目标分割算法的好坏也对视频修复任务的效果有着明显的影
学位
多模态医学图像分割在临床诊断中发挥着重要作用。多模态数据已被证明可以从不同层面提供有关解剖结构的互补信息。有效结合多模态数据可以提高医学图像分割性能。近年来,基于深度学习的多模态分割方法取得了显著的进展。然而,现有方法通常简单地结合不同模态的特征,难以充分建模复杂的模态间依赖关系,且忽略了噪声和模态间差异的影响,使得多模态互补信息没有得到很好的利用。本文在配对多模态图像和不成对多模态图像两种场景下
学位
弱监督图像分割是计算机视觉中的一个重要任务,它能够有效的减少分割任务中标注工作量和标注成本。机器学习中弱监督的定义可进一步细分为不确切监督、不完全监督及带有噪声的监督。图像分割任务中的弱监督通常只包含少许像素的监督信息,本文核心研究思路是将这些稀疏的监督信息传递给图像中其它像素以实现准确的弱监督图像分割,并完成了如下工作:(1)针对弱监督图像语义分割中初始语义图监督信息稀疏问题,本文提出了深度图割
学位
三维场景理解是自动驾驶、智能机器人等人工智能技术应用的核心需求。本文主要研究三维场景理解中的两个重要三维信息的估计方法,即表征三维场景结构的深度估计和表征三维场景动态信息的三维动态目标分割。由于三维信息在不同时刻下的观测具有时序一致性,如何利用时序上的运动信息(光流、场景流或者位姿)辅助三维信息的估计成为当前研究的热点方向。本文分别基于相机传感器和激光雷达传感器进行研究,设计三维信息与运动信息的联
学位
近年来,随着立体视频等应用的兴起,视频信号的数据量越来越大,给存储和传输带来了沉重负担。在存储或传输之前,视频信号通常会被压缩。主流的视频压缩算法,在变换与量化等模块中引入失真,压缩数据的同时也影响压缩后视频的质量。如何在尽可能降低数据量的同时保持尽可能好的视频质量是视频编码的永恒话题。为此,视频质量增强算法被研究者们引入到视频编码中,其中基于神经网络的方法近年来成为了智能编码优化的研究重点,目的
学位
自动驾驶系统是新一代工业革命的关键技术之一,道路分割在其中扮演了重要角色,它能保障智能汽车的安全行驶,具有极大的研究意义和应用价值。研究者们提出了大量的道路分割方法,这些方法取得了较好的分割准确性,但是存在计算量过大的问题,而智能汽车搭载的平台算力十分有限,无法做到实时运算,因此难以为下游的决策模块提供及时的反馈。本文深入探索了道路分割中的关键问题,设计了兼顾准确性和实时性的道路分割算法,主要工作
学位
屏幕视频主要由文本区域、计算机图形和其他计算机生成的内容组成。相比于相机拍摄的自然场景视频,具有独特的特征:在空域上,其具有更高的色彩纯度、更高的边缘强度;在时域上,场景切换更为频繁,且相邻帧之间的运动更加集中、剧烈。在屏幕视频的压缩与传输过程中,需要在尽可能不降低视频主观质量的前提下提升压缩率。针对这一需求,本文分析了屏幕视频的视觉感知特性,建立了屏幕视频的视觉感知模型。具体而言,这一模型包括空
学位
基于多视图的三维重建旨在从物体的多视角图片中恢复出物体的3D形状。随着深度学习的发展,基于深度学习的三维重建工作方兴未艾,但仍然存在以下两点挑战。首先,多视图之间存在一致性和互补性,如何建模多视图的一致性和互补性关系,是基于多视图三维重建工作的关键。其次,现有工作通常构建深层次的网络结构来提取更具辨识性的高阶特征,但是深层网络中几何信息逐渐丢失,导致物体的精细结构难以准确重建。针对上述挑战,本文基
学位
近年来行人轨迹预测的研究受到广泛关注,在诸如自动驾驶、智慧城市、智能监控等计算机视觉应用中起到了关键作用。在行人轨迹预测中,行人之间以及行人和场景之间的交互都会影响行人轨迹。交互的最优构建方式也会随着环境的变化而变化,从而造成预测轨迹的不确定性。因此,如何依据环境变化建模最优交互关系是行人轨迹预测的难点。针对这一难点,目前还面临以下三个问题:一是建模对象,即建模哪些交互;二是模型结构,即在确定建模
学位
经过数十年发展,冷冻电镜已成为研究蛋白质生化性质最有效的手段之一。通过冷冻电镜密度图构建蛋白质三维结构是该技术的最后一环。然而,该步骤目前大多由结构生物学家手动完成。为节省人力物力,本文以冷冻电镜密度图为研究对象,提出了一种基于深度学习的蛋白质三维结构预测算法。该算法主要包含三个子模块,分别是Cα原子目标检测、氨基酸目标检测和蛋白质骨架构建,具体内容如下:(1)设计了一个基于Retina Net的
学位