基于python实现resnet_使用dlib中的深度残差网络(ResNet)实现实时人脸识别-程序员宅基地

技术标签: 基于python实现resnet  

opencv中提供的基于haar特征级联进行人脸检测的方法效果非常不好,本文使用dlib中提供的人脸检测方法(使用HOG特征或卷积神经网方法),并使用提供的深度残差网络(ResNet)实现实时人脸识别,不过本文的目的不是构建深度残差网络,而是利用已经训练好的模型进行实时人脸识别,实时性要求一秒钟达到10帧以上的速率,并且保证不错的精度。opencv和dlib都是非常好用的计算机视觉库,特别是dlib,前面文章提到了其内部封装了一些比较新的深度学习方法,使用这些算法可以实现很多应用,比如人脸检测、车辆检测、目标追踪、语义分割等等。由于这两个库相应的都包含了C++和Python的版本,而Python的配置和相对使用起来更加简单,因此这篇文章主要通过Python来实现。

先上测试的识别效果,第一张识别吴恩达和Bengio,后者我没有打标签所以识别的是“other”;另外一张gif 是识别梁朝伟、刘德华和一个女主持的过程,本地库中没有存储女主持的图片。

因为博客园不方便上传本地视频,所以用的gif显示效果图,源视频要比gif清楚,640X480像素大小,总的来说效果识别的效果还不错。

一、准备

(1)需要安装opencv和dlib的Python库,之前的一篇文章提到了怎样安装:http://www.cnblogs.com/supersayajin/p/8446685.html;如果你有GPU并且开启了加速,那么实现的人脸识别程序速度非常快,可以满足实时性,以我运行的结果来看,检测+识别640X480像素的视频流一秒钟大约十几帧;如果你没有GPU那么速度就会很慢了,而且在检测阶段不能使用卷积神经网络的方法了,否则检测一帧数据可能需要几秒甚至几十秒:)

(2)需要一个和PC连接的摄像头;在本文中使用的是串口的摄像头,笔记本电脑集成的摄像头就是串口的,opencv中提供了直接获取串口摄像头的接口,非常方便使用;如果是网口的摄像头那么就要看摄像头提供方,比如大华、海康他们的摄像头可能会提供官方的SDK,如果有接口那是最好;或者,如果摄像头支持RTSP协议,opencv也可以通过RTSP协议获取摄像头的数据;否则可能就要写一套socket通信来实现数据传输,这个不在本文范围之内,默认使用的是串口的摄像头。

二、策略

人脸识别分为人脸检测和识别两个阶段,人脸检测会找到人脸区域的矩形窗口,识别则通过ResNet返回人脸特征向量,并进行匹配。

(1)人脸检测阶段。人脸检测算法需要用大小位置不同的窗口在图像中进行滑动,然后判断窗口中是否存在人脸。在深度学习之前的主流方法是特征提取+集成学习分类器,比如以前火热的haar特征+adaboost级联分类器,opencv中实现的人脸检测方法就采用了这种,不过实验结果来看,这种检测方法效果很不好,经常误检测人脸,或者检测不到真实的人脸;dlib中使用的是HOG(histogram of oriented gradient)+ 回归树的方法,使用dlib训练好的模型进行检测效果要好很多。dlib也使用了卷积神经网络来进行人脸检测,效果好于HOG的集成学习方法,不过需要使用GPU加速,不然程序会卡爆了,一张图片可能几秒甚至几十秒。

(2)识别阶段。识别也就是我们常说的“分类”,摄像头采集到这个人脸时,让机器判断是张三还是其他人。分类分为两个部分:

特征向量抽取。本文用到的是dlib中已经训练好的ResNet模型的接口,此接口会返回一个128维的人脸特征向量。

距离匹配。在获取特征向量之后可以使用欧式距离和本地的人脸特征向量进行匹配,使用最近邻分类器返回样本的标签。

根据以上,识别的大致过程如下:

图1 人脸识别分类过程

对于图1中的获取人脸特征向量,其过程如下:

图2 获取人脸特征向量过程

用简单的话总结,整个过程分为两个阶段,本地存储已标记人脸数据;识别阶段把从摄像头读取的人脸和本地进行匹配,得到分类结果。

三、程序实现

(1)构建本地人脸特征向量库,并且打标签。

首先加载需要的python库:

importdlibimportnumpy as npimportcv2importosimport json

然后加载模型参数:

detector = dlib.cnn_face_detection_model_v1('mmod_human_face_detector.dat')

sp= dlib.shape_predictor('shape_predictor_68_face_landmarks.dat')

facerec= dlib.face_recognition_model_v1('dlib_face_recognition_resnet_model_v1.dat')

上面代码中的模型参数可以到这里下载:http://dlib.net/files/。detector是使用卷积神经网络(CNN)进行人脸检测的检测算子,当然如果你使用CNN的话需要使用GPU加速,否则速度会超级慢。也可以使用另一种方法,即HOG特征级联分类的检测方法,效果略差于CNN。变量sp,使用预测算子获取得到的人脸区域中的五官的几何点区域,这里加载的是68特征点的landmark模型;然后facerec会得到ResNet模型,He Kaiming(2009年和2015的CVPR best paper作者)提出的方法的一个实现,这里训练模型已经给出,因此不需要自己手动去训练了。

最后,对某个目录中的所有图片进行处理,处理的方式是一张一张地读取某个目录中的图片,每读取一张就检测人脸,如果存在人脸就使用ResNet的接口获取人脸特性向量,保存到事先准备好的矩阵中,并且按照文件名存取标签,完了之后把所有的人脸特征向量和标签都存到本地的文本文件中。注意这里给图片打标签的方式,我把每张图片命名为标签名+下划线+序号+点号+后缀名的形式,标签名是手动命名的标记名称,序号用以区分同一类中的第几张。以下是demo中存放的部分图片:

也有很多其他的方法打标签,这里不多举例。

imagePath = 'LocalImage/' #图像的目录

data = np.zeros((1,128)) #定义一个128维的空向量data

label = [] #定义空的list存放人脸的标签

for file in os.listdir(imagePath): #开始一张一张索引目录中的图像

if '.jpg' in file or '.png' infile:

fileName=file

labelName= file.split('_')[0] #获取标签名

print('current image:', file)print('current label:', labelName)

img= cv2.imread(imagePath + file) #使用opencv读取图像数据

if img.shape[0]*img.shape[1] > 500000: #如果图太大的话需要压缩,这里像素的阈值可以自己设置

img = cv2.resize(img, (0,0), fx=0.5, fy=0.5)

dets= detector(img, 1) #使用检测算子检测人脸,返回的是所有的检测到的人脸区域

for k, d inenumerate(dets):

rec=dlib.rectangle(d.rect.left(),d.rect.top(),d.rect.right(),d.rect.bottom())

shape= sp(img, rec) #获取landmark

face_descriptor = facerec.compute_face_descriptor(img, shape) #使用resNet获取128维的人脸特征向量

faceArray = np.array(face_descriptor).reshape((1, 128)) #转换成numpy中的数据结构

data = np.concatenate((data, faceArray)) #拼接到事先准备好的data当中去

label.append(labelName) #保存标签

cv2.rectangle(img, (rec.left(), rec.top()), (rec.right(), rec.bottom()), (0, 255, 0), 2) #显示人脸区域

cv2.waitKey(2)

cv2.imshow('image', img)

data= data[1:, :] #因为data的第一行是空的128维向量,所以实际存储的时候从第二行开始

np.savetxt('faceData.txt', data, fmt='%f') #保存人脸特征向量合成的矩阵到本地

labelFile=open('label.txt','w')

json.dump(label, labelFile)#使用json保存list到本地

labelFile.close()

cv2.destroyAllWindows()#关闭所有的窗口

上面的代码中,会索引imagePath这个存放图像的目录;然后定义一个128维的空向量data,在后续获取每一张人脸特征向量的时候可以往这个向量后面追加,即data的每一行是一个样本的特征向量;然后定义一个list来存储标签。之后开始索引某个目录下所有的图片文件。注意我这里用的是opencv的接口读取图像,也可以使用其他的图像读取接口,比如dlib自带的或者PIL接口中的,都可以使用,不过重要的是接口一定要统一,因为每个接口读取图片转成矩阵的数值可能会有差异。然后使用前面定义的测算子开始检测人脸,返回的是dlib中的一个数据结构,这个数据结构存储了所有检测到的人脸区域信息,对每个检测到的人脸区域获取landmark,并且调用深度残差模型的接口获取128维的人脸特征向量,之后我们把这个人脸向量存储到data中去,这里使用numpy中提供的concatenate方法进行拼接,同时把标签添加到label列表中去。最后,因为data事先定义的是一个128维的空向量,之后利用concatenate方法进行拼接得到,我们需要抛弃第一行;最后把得到的人脸特征和标签存储到本地文件。

这里使用的是CNN进行人脸检测,如果你没有GPU,或者你有GPU但没有进行GPU的配置,那么速度巨慢,此时你可以使用传统的HOG特征+级联分类的方法,不过效果没有CNN的好。这时代码的第6行中模型需要替换成:

detector = dlib.get_frontal_face_detector()

其余的基本保持不变。

以上的代码可以直接运行,运行之后会检测所有的图像,类似于:

并且存取得到本地的人脸特征向量库和标签:

(2)实时读取摄像头进行人脸识别

在(1)中我们已经得到了本地的打过标签的人脸特征向量,这一部分是实现读取摄像头实时识别。首先加载需要的python库:

importdlibimportnumpy as npimportcv2import json

然后加载神经网络模型:

detector = dlib.cnn_face_detection_model_v1('mmod_human_face_detector.dat')

sp= dlib.shape_predictor('shape_predictor_68_face_landmarks.dat')

facerec= dlib.face_recognition_model_v1('dlib_face_recognition_resnet_model_v1.dat')

threshold= 0.54

其中threshold是人脸识别的阈值,当测试图片和本地图片欧式距离最近的值大于这个值的时候,我们认为不属于本都图片的任何一个类别。然后定义最近邻分类器:

deffindNearestClassForImage(face_descriptor, faceLabel):

temp= face_descriptor -data

e= np.linalg.norm(temp,axis=1,keepdims=True)

min_distance=e.min()print('distance:', min_distance)if min_distance >threshold:return 'other'index=np.argmin(e)return faceLabel[index]

当距离值大于threshold的时候我们返回标签“other”,否则返回本地的标签,你可以根据实际情况来设置这个阈值。题外话,安全阈值很依赖于具体的场合,比如安检、银行里进行人脸验证、iPhone解锁,这些对安全要求很高的场合需要比较小的threshold来保证安全,在嫌犯追踪的时候,需要比较大的threshold以保证由嫌疑的人不会漏过。

然后是读取图像进行识别的函数:

defrecognition(img):

dets= detector(img, 1)for k, d inenumerate(dets):print("Detection {}: Left: {} Top: {} Right: {} Bottom: {}".format(

k, d.rect.left(), d.rect.top(), d.rect.right(), d.rect.bottom()))

rec=dlib.rectangle(d.rect.left(),d.rect.top(),d.rect.right(),d.rect.bottom())print(rec.left(),rec.top(),rec.right(),rec.bottom())

shape=sp(img, rec)

face_descriptor=facerec.compute_face_descriptor(img, shape)

class_pre=findNearestClassForImage(face_descriptor, label)print(class_pre)

cv2.rectangle(img, (rec.left(), rec.top()+10), (rec.right(), rec.bottom()), (0, 255, 0), 2)

cv2.putText(img, class_pre , (rec.left(),rec.top()), cv2.FONT_HERSHEY_SIMPLEX,0.7, (0,255,0), 2, cv2.LINE_AA)

cv2.imshow('image', img)

最后是实时读取摄像头图像,并且进行识别的过程:

labelFile=open('label.txt','r')

label= json.load(labelFile) #载入本地人脸库的标签

labelFile.close()

data= np.loadtxt('faceData.txt',dtype=float) #载入本地人脸特征向量

cap=cv2.VideoCapture(0)

fps= 10size= (640,480)

fourcc= cv2.VideoWriter_fourcc(*'XVID')

videoWriter= cv2.VideoWriter('video.MP4', fourcc, fps, size)while(1):

ret, frame=cap.read()#frame = cv2.resize(frame, (0,0), fx=0.5, fy=0.5)

recognition(frame)

videoWriter.write(frame)if cv2.waitKey(1) & 0xFF == ord('q'):breakcap.release()

videoWriter.release()

cv2.destroyAllWindows()

在上面的代码中为了展示检测的效果,我用opencv的接口把图像保存到了视频当中。识别效果截图:

四、总结

利用已有的计算机视觉库可以实现很多好玩和有用的应用,本文只是粗略地展示了一个进行实时人脸识别的demo,还有很多可以改善的点来提高精度和效率,比如人脸受角度、表情影响很大,或者需要处理速度要求更高的场景;同时图像类别规模很大的情况下如何保证效果,如何优化这些都是难点。另外dlib中的提供的这些模型都是已经训练好的,我们可以到官方demo下载,demo给出了在一些benchmark中的效果,也可以自己训练得到这些模型,当然前提是你需要有GPU,并且要求很大量的数据以及丰富的调参经验,这些也都是深度学习中的点~

(完)

版权声明:本文为博主原创文章,遵循 CC 4.0 BY-SA 版权协议,转载请附上原文出处链接和本声明。
本文链接:https://blog.csdn.net/weixin_39876592/article/details/111495133

智能推荐

分布式光纤传感器的全球与中国市场2022-2028年:技术、参与者、趋势、市场规模及占有率研究报告_预计2026年中国分布式传感器市场规模有多大-程序员宅基地

文章浏览阅读3.2k次。本文研究全球与中国市场分布式光纤传感器的发展现状及未来发展趋势,分别从生产和消费的角度分析分布式光纤传感器的主要生产地区、主要消费地区以及主要的生产商。重点分析全球与中国市场的主要厂商产品特点、产品规格、不同规格产品的价格、产量、产值及全球和中国市场主要生产商的市场份额。主要生产商包括:FISO TechnologiesBrugg KabelSensor HighwayOmnisensAFL GlobalQinetiQ GroupLockheed MartinOSENSA Innovati_预计2026年中国分布式传感器市场规模有多大

07_08 常用组合逻辑电路结构——为IC设计的延时估计铺垫_基4布斯算法代码-程序员宅基地

文章浏览阅读1.1k次,点赞2次,收藏12次。常用组合逻辑电路结构——为IC设计的延时估计铺垫学习目的:估计模块间的delay,确保写的代码的timing 综合能给到多少HZ,以满足需求!_基4布斯算法代码

OpenAI Manager助手(基于SpringBoot和Vue)_chatgpt网页版-程序员宅基地

文章浏览阅读3.3k次,点赞3次,收藏5次。OpenAI Manager助手(基于SpringBoot和Vue)_chatgpt网页版

关于美国计算机奥赛USACO,你想知道的都在这_usaco可以多次提交吗-程序员宅基地

文章浏览阅读2.2k次。USACO自1992年举办,到目前为止已经举办了27届,目的是为了帮助美国信息学国家队选拔IOI的队员,目前逐渐发展为全球热门的线上赛事,成为美国大学申请条件下,含金量相当高的官方竞赛。USACO的比赛成绩可以助力计算机专业留学,越来越多的学生进入了康奈尔,麻省理工,普林斯顿,哈佛和耶鲁等大学,这些同学的共同点是他们都参加了美国计算机科学竞赛(USACO),并且取得过非常好的成绩。适合参赛人群USACO适合国内在读学生有意向申请美国大学的或者想锻炼自己编程能力的同学,高三学生也可以参加12月的第_usaco可以多次提交吗

MySQL存储过程和自定义函数_mysql自定义函数和存储过程-程序员宅基地

文章浏览阅读394次。1.1 存储程序1.2 创建存储过程1.3 创建自定义函数1.3.1 示例1.4 自定义函数和存储过程的区别1.5 变量的使用1.6 定义条件和处理程序1.6.1 定义条件1.6.1.1 示例1.6.2 定义处理程序1.6.2.1 示例1.7 光标的使用1.7.1 声明光标1.7.2 打开光标1.7.3 使用光标1.7.4 关闭光标1.8 流程控制的使用1.8.1 IF语句1.8.2 CASE语句1.8.3 LOOP语句1.8.4 LEAVE语句1.8.5 ITERATE语句1.8.6 REPEAT语句。_mysql自定义函数和存储过程

半导体基础知识与PN结_本征半导体电流为0-程序员宅基地

文章浏览阅读188次。半导体二极管——集成电路最小组成单元。_本征半导体电流为0

随便推点

【Unity3d Shader】水面和岩浆效果_unity 岩浆shader-程序员宅基地

文章浏览阅读2.8k次,点赞3次,收藏18次。游戏水面特效实现方式太多。咱们这边介绍的是一最简单的UV动画(无顶点位移),整个mesh由4个顶点构成。实现了水面效果(左图),不动代码稍微修改下参数和贴图可以实现岩浆效果(右图)。有要思路是1,uv按时间去做正弦波移动2,在1的基础上加个凹凸图混合uv3,在1、2的基础上加个水流方向4,加上对雾效的支持,如没必要请自行删除雾效代码(把包含fog的几行代码删除)S..._unity 岩浆shader

广义线性模型——Logistic回归模型(1)_广义线性回归模型-程序员宅基地

文章浏览阅读5k次。广义线性模型是线性模型的扩展,它通过连接函数建立响应变量的数学期望值与线性组合的预测变量之间的关系。广义线性模型拟合的形式为:其中g(μY)是条件均值的函数(称为连接函数)。另外,你可放松Y为正态分布的假设,改为Y 服从指数分布族中的一种分布即可。设定好连接函数和概率分布后,便可以通过最大似然估计的多次迭代推导出各参数值。在大部分情况下,线性模型就可以通过一系列连续型或类别型预测变量来预测正态分布的响应变量的工作。但是,有时候我们要进行非正态因变量的分析,例如:(1)类别型.._广义线性回归模型

HTML+CSS大作业 环境网页设计与实现(垃圾分类) web前端开发技术 web课程设计 网页规划与设计_垃圾分类网页设计目标怎么写-程序员宅基地

文章浏览阅读69次。环境保护、 保护地球、 校园环保、垃圾分类、绿色家园、等网站的设计与制作。 总结了一些学生网页制作的经验:一般的网页需要融入以下知识点:div+css布局、浮动、定位、高级css、表格、表单及验证、js轮播图、音频 视频 Flash的应用、ul li、下拉导航栏、鼠标划过效果等知识点,网页的风格主题也很全面:如爱好、风景、校园、美食、动漫、游戏、咖啡、音乐、家乡、电影、名人、商城以及个人主页等主题,学生、新手可参考下方页面的布局和设计和HTML源码(有用点赞△) 一套A+的网_垃圾分类网页设计目标怎么写

C# .Net 发布后,把dll全部放在一个文件夹中,让软件目录更整洁_.net dll 全局目录-程序员宅基地

文章浏览阅读614次,点赞7次,收藏11次。之前找到一个修改 exe 中 DLL地址 的方法, 不太好使,虽然能正确启动, 但无法改变 exe 的工作目录,这就影响了.Net 中很多获取 exe 执行目录来拼接的地址 ( 相对路径 ),比如 wwwroot 和 代码中相对目录还有一些复制到目录的普通文件 等等,它们的地址都会指向原来 exe 的目录, 而不是自定义的 “lib” 目录,根本原因就是没有修改 exe 的工作目录这次来搞一个启动程序,把 .net 的所有东西都放在一个文件夹,在文件夹同级的目录制作一个 exe._.net dll 全局目录

BRIEF特征点描述算法_breif description calculation 特征点-程序员宅基地

文章浏览阅读1.5k次。本文为转载,原博客地址:http://blog.csdn.net/hujingshuang/article/details/46910259简介 BRIEF是2010年的一篇名为《BRIEF:Binary Robust Independent Elementary Features》的文章中提出,BRIEF是对已检测到的特征点进行描述,它是一种二进制编码的描述子,摈弃了利用区域灰度..._breif description calculation 特征点

房屋租赁管理系统的设计和实现,SpringBoot计算机毕业设计论文_基于spring boot的房屋租赁系统论文-程序员宅基地

文章浏览阅读4.1k次,点赞21次,收藏79次。本文是《基于SpringBoot的房屋租赁管理系统》的配套原创说明文档,可以给应届毕业生提供格式撰写参考,也可以给开发类似系统的朋友们提供功能业务设计思路。_基于spring boot的房屋租赁系统论文