【摘 要】
:
面部表情是一个人表达情绪最直接的形式之一。由于人机交互的发展,许多领域开始关注人脸表情识别。近几年深度学习方法显著提升了人脸表情识别准确率,但在实际应用中仍存在一些问题:首先,深度学习需要大量训练数据,但现有人脸表情数据库不足以训练出在实际应用中能产生可靠结果的深度神经网络;此外,不同个体的差异,如表达情绪的方式和表情强度的差异,也会给人脸表情识别带来挑战。现有大多数表情识别方法一般将表情分为离散
论文部分内容阅读
面部表情是一个人表达情绪最直接的形式之一。由于人机交互的发展,许多领域开始关注人脸表情识别。近几年深度学习方法显著提升了人脸表情识别准确率,但在实际应用中仍存在一些问题:首先,深度学习需要大量训练数据,但现有人脸表情数据库不足以训练出在实际应用中能产生可靠结果的深度神经网络;此外,不同个体的差异,如表达情绪的方式和表情强度的差异,也会给人脸表情识别带来挑战。现有大多数表情识别方法一般将表情分为离散的若干类别,如:高兴、厌恶、惊讶、悲伤、愤怒和恐惧六种基本表情类型。然而,这样分类过于离散,忽略了情绪的连续性和复杂性。情绪也会有强弱之分,如高兴可以分为:微笑,开心,兴奋。现有表情识别往往忽略了这一点,同时也缺少表情强弱分布均衡的大规模数据库。针对上述问题,本文提出在Arousal-Valence情感空间中基于维度情感模型的表情图像生成方法,对不均衡训练数据进行数据增强,提高表情识别模型准确率。主要研究内容和研究成果包括:1)提出基于标记分布的人脸表情图像生成算法。现有人脸表情数据库的数据量往往有限,数据质量参差不齐,且大多数针对传统六种基本表情和中性表情。针对该问题,本文提出了基于生成对抗网络的使用标记分布思想处理表情标签的人脸表情图像生成方法。该方法基于Arousal-Valence维度情感模型划分表情空间,利用标记分布处理的A-V值表示表情类别以体现表情的复杂和连续性,从而使有限的训练数据提供更多的表情信息。为了生成高质量的人脸表情图像,方法还引入了身份控制和表情控制模块。在Oulu-CASIA数据库上的实验结果表明,本文方法能生成更高质量的人脸表情图像,并能通过生成人脸表情图像进行数据增强进而提升非均衡训练数据下的表情识别准确率。2)提出加强身份信息控制的人脸表情图像生成算法。为了更好地保持输入人脸表情图像的身份,本文又引入特征控制模块,对编码器输出特征进行控制,以求获得的特征更好地保留身份信息,并帮助生成器输入同一身份特征在不同表情域能生成相似的人脸图像。特征控制模块分为特征身份控制与特征表情控制,对通过编码器获得的特征进行约束,充分利用特征层面的信息。实验证明,引入特征控制的人脸表情生成算法能更好地保留输入人脸身份。3)提出改善细节表现的人脸表情图像生成算法。传统的生成对抗网络生成图像往往会出现模糊、重叠等现象。本文使用亚像素卷积与自适应实例归一化优化生成器,以解决模糊问题。并使用多尺度判别器在多个尺度上对生成器进行约束,引导生成器在不同感受野获得全局到精细的信息。结合以上策略,最终获得更高质量的人脸表情图像。
其他文献
精准农业以物联网为基础,通过部署传感器和研究人工智能技术来控制果实/农作物的生产过程,主要包括:农业产量估测、农作物智能化病害检测以及生长过程品质监控等,以更低的成本提升果实产量等级,经济效益更大化。当前,针对葡萄视觉产量预估的工作主要是从基于检测的葡萄串检测和基于回归的葡萄颗粒计数这两个方面进行开展的。然而,这两类方法相对独立,且覆盖场景有限,并伴随着较大的产量预估误差。对此,提出了串-粒融合的
近年来,随着监控摄像头的普及和城市安防的需要,行人重识别成为了计算机视觉领域越来越重要研究的课题。其潜在的应用领域也越来越宽广,在刑侦破案、智慧城市、无人超市等领域有着广泛的应用前景。早期的行人重识别技术是通过手工提取行人图像的特征,如今基于深度学习的方法在行人重识别技术上应用已成为研究的热点。针对行人重识别,相关研究者已经做了很多的工作,然而依然存在一些需要解决的问题。一方面行人重识别数据采集困
随着现代计算机视觉的不断进步和发展,三维重建技术引起了学术界和产业界的广泛关注,在模型缺陷检测、智能机器人视觉、3D打印等领域有着非常广泛的应用,尤其是对室内场景进行实时稠密的高质量的三维重建是机器人、增强现实等领域关注的重点。三维重建算法可大致分为双目立体视觉的三维重建和基于RGB-D传感器的实时三维重建。基于双目立体视觉的三维重建,一般是通过多个视角的观察数据帧和帧间的视差信息来计算出物体的深
随着测序技术的发展,生物大分子序列数据量也飞速增长。数据挖掘作为从庞大的数据中提取出未知、隐含及具备潜在价值的信息的技术,被广泛应用于生物信息领域,用于探索其生物意义。其中,三维基因组学是近些年来基因领域的研究热点,研究表明基因组的三维结构与基因的转录调控以及表观遗传存在相关性,然而物种间的基因组三维结构的比较分析尚未在植物中得到广泛研究。因此以杨树为例,使用数据挖掘技术对胡杨和新疆杨进行三维基因
染色体图像分类,是临床上进行染色体分析的关键步骤之一,在遗传疾病的诊断和肿瘤学研究中具有重要意义。得益于计算机技术的发展和进步,使用计算机进行自动化的染色体分类,成为了近年来的热门研究。染色体是非刚性物体,容易发生弯曲,弯曲的染色体会影响网络的精确率,需要对弯曲的染色体进行矫直。现有的染色体矫直方法主要分为切割矫直法和骨骼关联矫直法,这两种方法存在一些局限性:切割矫直法,通过切割图片矫直染色体,会
随着网络的普及以及大规模食物数据的涌现,为了有效获得所需的食物信息,食物计算领域的跨模态菜谱检索得到了广泛关注。跨模态菜谱检索是食物图像和菜谱之间的相互检索,跨模态菜谱检索的难点在于食物图像和菜谱之间的关系极为复杂:有较多的食物图像外观相似且部分图像存在着干扰信息;在烹饪过程中有的食物配料变得不可见或者配料外形会发生变化;烹饪指示中暗含着配料与食物成品图像的某种关系。现有研究方法存在的问题:1.由
三维探测技术具有广泛的应用价值,在地形获取、自主定位、实景模拟、工业生产等诸多领域具有重要的推广及理论研究意义。作为三维探测技术驱动核心的场景深度信息获取是计算机视觉领域的热门研究课题之一,近年来受到了研究人员的广泛关注。传统深度信息获取方法大多采用基于多视图的双目立体匹配或从运动恢复结构的方式,对输入图像及相机拍摄参数的限制要求较多,提高了深度信息获取的门槛。因此,采用更少场景图像输入、对相机硬
红外成像仿真技术能够有效克服时间、环境、地域的限制获取不同环境条件下的红外图像,传统基于场景建模的仿真方法存在建模复杂度高、建模时间长等缺点,随着增强现实技术的发展,在真实场景中加入虚拟仿真物体能够避免大范围的场景建模工作,方便快捷地生成红外仿真图像。为保证仿真图像的视觉效果更加逼真,需要重点解决虚实融合的辐射一致性问题,即虚拟景物和真实背景应具有一致的红外辐射。在真实环境中,探测器接收到的辐射值
互联网发展日新月异,在改变人们生活娱乐方式的同时,也拓宽了社交渠道。交流分享不再受到距离限制,但问题亦接踵而至,攻击性言论犹如附骨之疽充斥在网络世界中,破坏着绿色文明的网络交流环境。攻击性言论是针对特定个人、群体进行言语攻击或能引起观者不适的文字内容,常见于各种社交媒体平台。准确的自动化检测工具能有效遏制攻击性言论的泛滥,故研究聚焦于使用机器学习方法检测识别攻击性言论。攻击性言论相关子任务包括了检
随着知识图谱技术的发展与成熟,其作为一个结构化的知识库被应用到各个领域,尤其是在基于知识库的问答领域。知识库问答是其接受一个自然语言式的问句并经过语义理解后结合知识库返回答案,不同于传统基于关键字的检索式问答,知识库问答直接给出精准答案,不需要用户进行二次查找或推理,使答案获取方式更加简单高效。然而,目前知识库问答的整体准确率不高,其主要原因包括两点:实体名拼写不规范、问句上下文信息不足和知识库中