Exportar este item: EndNote BibTex

Use este identificador para citar ou linkar para este item: http://www.tede2.ufrpe.br:8080/tede2/handle/tede2/7857
Tipo do documento: Dissertação
Título: A convolutional neural network with feature fusion for real-time hand posture recognition
Autor: CHEVTCHENKO, Sérgio Fernandovitch 
Primeiro orientador: CORDEIRO, Filipe Rolim
Primeiro coorientador: MACÁRIO FILHO, Valmir
Resumo: O uso de gestos de mão é uma maneira intuitiva e versátil para humanos interagirem com computadores. Este trabalho tem como foco o reconhecimento de gestos estáticos, também conhecidos como posturas de mão. Um bom sistema de reconhecimento de gestos deve suportar variações na imagem, como de escala, iluminação e rotação, além de ser capaz de funcionar em tempo real. Considerando o sucesso recente de redes neurais convolutivas e robustez de técnicas tradicionais, esta dissertação apresenta uma nova arquitetura baseada em redes convolutivas para reconhecimento de gestos com acurácia e em tempo real. A arquitetura proposta combina redes convolutivas com descritores de características tradicionais. Os hiperparâmetros que descrevem esta nova rede são selecionados de forma automática usando um algoritmo de otimização. As características tradicionais são extraídas da imagem usando momentos de Zernike, momentos de Hu, filtros de Gabor e propriedades de contorno da mão. Estas características são usadas para complementar o conjunto de informações disponível para a camada de classificação da rede convolutiva. A arquitetura proposta é comparada com modelos de redes convolutivas propostos recentemente. Para isso são usadas três bases de dados de gestos estáticos de mão. Para verificar como a representação da imagem pode influenciar nos classificadores considerados nesse trabalho, as bases de dados são subdivididas em representações por profundidade, escala de cinza e binárias. Além disso, as arquiteturas são comparadas em termos de velocidade e acurácia de classificação, usando reescalonamento com e sem preservação de aspect ratio e dois métodos de validação comumente empregados no contexto de reconhecimento de gestos: holdout e leave-one-subject-out. É demonstrado experimentalmente que a arquitetura proposta supera o estado da arte com reconhecimento de gestos em tempo real, sendo robusta em diferentes representações e escalas da imagem. Foi registrada uma melhora de até 5.93% em comparação ao melhor modelo existente em uma base de dados RGBD com 81,000 imagens e 27 classes de gestos. Além disso, é disponibilizado um vídeo demostrando reconhecimento em tempo real de até 27 gestos estáticos de mão a 30 quadros por segundo, usando uma câmera 3D.
Abstract: Gesture based human-computer interaction is both intuitive and versatile, with diverse applications such as in smart houses, operating theaters and vehicle infotainment systems. This work focuses on recognition of static hand gestures, also known as hand postures. A good hand posture recognition system has to be both robust to image variations and capable of real-time performance. Considering the recent success of convolutional neural networks (CNNs) and robustness of more traditional methods, this dissertation presents a novel architecture, combining a CNN and several traditional feature extractors, capable of accurate and real-time hand posture recognition. Several hyperparameters present in the proposed architecture are automatically selected by a model optimization algorithm. The traditional features are extracted from Zernike moments, Hu moments, Gabor filters and properties of the hand contour. This features are used to complement the information available to the classification layer of a CNN. Besides the proposed architecture, recent convolutional neural networks are evaluated on three distinct benchmarking datasets. This datasets are further divided in depth, binary and grayscale subsets in order to investigate the influence of image representation on recognition accuracy. Furthermore, architectures are compared in terms of speed and accuracy using rescaling with and without preserving aspect ratio and two common validation techniques: holdout and leave-one-subject-out. The proposed architecture is shown to obtain state-of-the art recognition rate in realtime, while being robust to different image representations and scalings. A recognition improvement of 5.93% on current best model is achieved on an RGBD dataset containing 81,000 images of 27 hand postures. A demo video is provided as supplementary material, containing real-time recognition by the proposed network of up to 27 gestures at 30 fps from a 3D camera.
Palavras-chave: Posturas de mão
Rede convolutiva
Rede neural
Reconhecimento de gestos
Área(s) do CNPq: CIENCIAS EXATAS E DA TERRA::CIENCIA DA COMPUTACAO
Idioma: eng
País: Brasil
Instituição: Universidade Federal Rural de Pernambuco
Sigla da instituição: UFRPE
Departamento: Departamento de Estatística e Informática
Programa: Programa de Pós-Graduação em Informática Aplicada
Citação: CHEVTCHENKO, Sérgio Fernandovitch. A convolutional neural network with feature fusion for real-time hand posture recognition. 2018. 72 f. Dissertação (Programa de Pós-Graduação em Informática Aplicada) - Universidade Federal Rural de Pernambuco, Recife.
Tipo de acesso: Acesso Aberto
URI: http://www.tede2.ufrpe.br:8080/tede2/handle/tede2/7857
Data de defesa: 6-Jul-2018
Aparece nas coleções:Mestrado em Informática Aplicada

Arquivos associados a este item:
Arquivo Descrição TamanhoFormato 
Sergio Fernandovitch Chevtchenko.pdfDocumento principal6,44 MBAdobe PDFBaixar/Abrir Pré-Visualizar


Os itens no repositório estão protegidos por copyright, com todos os direitos reservados, salvo quando é indicado o contrário.