摘要目的 从普通摄像头录制的用户使用视屏显示终端(video display terminal,VDT)时的面部视频中自动检测眨眼,并进一步区分完全眨眼和不完全眨眼,帮助未来进一步探索眨眼情况与VDT视疲劳的联系.方法 从摄像头录制的受试者使用电脑时的面部视频中获取不眨眼、完全眨眼和不完全眨眼视频片段,建立用于眨眼识别的视频数据集,并对视频做预处理.将卷积神经网络(convolutional neural network,CNN)和长短期记忆(long short-term memory,LSTM)神经网络相结合,搭建出了 CNN-LSTM混合深度神经网络模型,以实现对不完全眨眼、完全眨眼和不眨眼过程的视频分类.将处理好的视频输入CNN,自动提取每帧眼睛图像的空间特征;然后将CNN的输出作为LSTM的输入,提取视频的时间特征;最后,利用全连接层和Softmax层对眨眼视频进行分类,分成不眨眼、完全眨眼和不完全眨眼三类.结果 该CNN-LSTM混合模型在测试集上分类的准确率、平均F1 得分和平均受试者操作特征曲线(receiver operating characteristic curve,ROC 曲线)的线下面积(area under curve,AUC)分别为 92%、0.92、0.9633,在来自不同受试者的其他数据集上分类的准确率、平均F1 得分和平均AUC分别为91%、0.91、0.9495,表明该模型对不眨眼、完全眨眼和不完全眨眼视频的分类效果很好,并在不同受试者的样本中表现出较强的泛化能力.结论 该CNN-LSTM模型能准确地自动检测眨眼并进一步识别不完全眨眼,为将来的研究中提取眨眼频率、不完全眨眼次数等视疲劳参数提供了客观有效的方法.
更多相关知识
- 浏览0
- 被引0
- 下载0

相似文献
- 中文期刊
- 外文期刊
- 学位论文
- 会议论文


换一批



