Please use this identifier to cite or link to this item:
https://rinacional.tecnm.mx/jspui/handle/TecNM/12752| Title: | MODELO DE APRENDIZAJE PROFUNDO PARA EL RECONOCIMIENTO DE EMOCIONES POR MEDIO DEL HABLA EN ESPAÑOL |
| Authors: | ANG FOSTER, RICARDO STEVE |
| metadata.dc.subject.other: | MODELO DE APRENDIZAJE PROFUNDO PARA EL RECONOCIMIENTO DE EMOCIONES POR MEDIO DEL HABLA EN ESPAÑOL |
| Issue Date: | 2026-04-22 |
| Publisher: | Tecnológico Nacional de México |
| metadata.dc.publisher.tecnm: | Instituto Tecnológico de Chihuahua |
| Description: | El reconocimiento de emociones a partir del habla es un área de investigación relevante dentro de la interacción humano–computadora, ya que la voz contiene información emocional implícita que puede ser aprovechada por sistemas inteligentes. En los últimos años, el aprendizaje profundo ha permitido mejorar significativamente el desempeño de los sistemas de reconocimiento de emociones. Sin embargo, la mayoría de los estudios se han enfocado en idiomas como el inglés o el alemán, existiendo una exploración aún limitada para el idioma español. Por lo tanto, en esta tesis se presenta el diseño y la evaluación de un modelo de aprendizaje profundo para el reconocimiento de emociones a partir del habla en español. Dicho modelo utiliza el espectrograma logarítmico de Mel para la extracción de características y el reconocimiento de emociones mediante una arquitectura híbrida que combina redes neuronales convolucionales profundas y modelos Transformer. La metodología para la obtención del modelo propuesto consistió en realizar una evaluación comparativa de diversos modelos populares de reconocimiento de emociones, incluyendo arquitecturas convolucionales, recurrentes y basadas en Transformers, utilizando los conjuntos de datos EmoMatchSpanishDB y Spanish MEACorpus 2023. A partir de los resultados experimentales, se identificó que las arquitecturas híbridas en configuración en serie, compuestas por una ResNet-50 y un bloque Transformer/Conformer, presentan un mejor desempeño frente a modelos del estado del arte, logrando resultados robustos en métricas como la exactitud balanceada y la medida-F1.Los resultados obtenidos confirman que es posible diseñar modelos de aprendizaje profundo eficaces para el reconocimiento de emociones en el habla en español, incluso cuando se dispone de conjuntos de datos de tamaño limitado y con clases desbalanceadas. |
| metadata.dc.type: | info:eu-repo/semantics/masterThesis |
| Appears in Collections: | Maestría en Ciencias en Ingeniería Electrónica |
Files in This Item:
| File | Description | Size | Format | |
|---|---|---|---|---|
| Tesis Ang Foster Ricardo Steve.pdf | 5.22 MB | Adobe PDF | View/Open | |
| Licencia ang foster.pdf | 452.27 kB | Adobe PDF | View/Open |
This item is protected by original copyright |
This item is licensed under a Creative Commons License