Downloads provided by UsageCounts
La interacción entre seres humanos y máquinas ya no es cosa de ciencia ficción, es un hecho cotidiano en la vida de millones de personas en todo el mundo. El objetivo de este trabajo es implementar un sistema de reconocimiento de emociones a partir de imagen y voz, con la motivación de hacer de esta interacción algo más humano y natural. Para ello, primeramente, se ha estudiado la naturaleza de las emociones, las diferentes teorías existentes para clasificarlas y su influencia en la expresión facial y en la voz de las personas. Más tarde, se han seleccionado diferentes técnicas de Aprendizaje Automático para conseguir que la máquina aprenda por sí misma a reconocer patrones a partir de ejemplos debidamente etiquetados. Además, se identificaron los diferentes tipos de bases de datos existentes relacionadas con las emociones, comparando sus ventajas e inconvenientes. El sistema resultante posee los bloques básicos de cualquier sistema de clasificación: base de datos, extracción de características y clasificador. La base de datos utilizada consta de 4 locutores, 7 emociones (6 básicas + neutra) y 15 enunciados por emoción (30 en el caso de la neutra). Esto hace un total de 120 enunciados por locutor grabados tanto en vídeo como en audio. Las características en imágenes consisten en la media y la desviación típica de las coordenadas de 60 marcas pintadas en la cara de los locutores durante el período de grabación. Las características de la voz consisten en los coeficientes mel-cepstrales y la frecuencia fundamental. Los clasificadores utilizados han sido el modelo de mezcla de gaussianas (Gaussian Mixture Model, GMM) y la máquina de vectores soporte (Support Vector Machines, SVM). En el proceso de implementación, se han generado 6 sistemas de reconocimiento de emociones diferentes, que se clasifican según la naturaleza de los datos empleados (imagen, voz, imagen y voz) y según la dependencia del locutor (dependientes del locutor e independientes del locutor) siendo el sistema definitivo un sistema de reconocimiento de emociones independiente del locutor a partir de imagen y voz. El resultado de los experimentos llevados a cabo muestra que: los sistemas dependientes del locutor ofrecen mejores prestaciones que los independientes, como era de esperar; los sistemas basados en imagen obtienen mejores resultados que los sistemas basados en voz; los sistemas que fusionan características de imagen y voz mejoran los resultados obtenidos por separado; y el clasificador SVM obtiene una tasa de acierto considerablemente mayor que el GMM.
Telecomunicaciones, Imagen y voz, Reconocimiento de emociones, Aprendizaje automático
Telecomunicaciones, Imagen y voz, Reconocimiento de emociones, Aprendizaje automático
| selected citations These citations are derived from selected sources. This is an alternative to the "Influence" indicator, which also reflects the overall/total impact of an article in the research community at large, based on the underlying citation network (diachronically). | 0 | |
| popularity This indicator reflects the "current" impact/attention (the "hype") of an article in the research community at large, based on the underlying citation network. | Average | |
| influence This indicator reflects the overall/total impact of an article in the research community at large, based on the underlying citation network (diachronically). | Average | |
| impulse This indicator reflects the initial momentum of an article directly after its publication, based on the underlying citation network. | Average |
| views | 31 | |
| downloads | 29 |

Views provided by UsageCounts
Downloads provided by UsageCounts