Veuillez utiliser cette adresse pour citer ce document :
https://rinacional.tecnm.mx/jspui/handle/TecNM/12238| Titre: | Modelo de diferenciación de voz humana y sintética |
| Auteur(s): | Rodriguez Garcia, Jibran Zaedt%1298260 |
| metadata.dc.subject.other: | Herramientas de clonación de voz, algoritmos de clonación, aplicaciones de clonación, inteligencia artificial, clonación de voz. |
| Date de publication: | 2026-02-06 |
| Editeur: | Tecnológico Nacional de México |
| metadata.dc.publisher.tecnm: | Centro Nacional de Investigación y Desarrollo Tecnológico |
| Description: | El presente trabajo se enfoca en el análisis y comparación de distintas técnicas para el reconocimiento de voces humanas y voces generadas sintéticamente mediante herramientas de clonación. Aunque el objetivo inicial fue desarrollar un sistema de reconocimiento, el proyecto derivó en una investigación experimental centrada en la caracterización de señales de voz, específicamente mediante la estimación de la frecuencia fundamental híbrida (hF0), como descriptor para diferenciar entre voces naturales y clonadas. Debido a la ausencia de un conjunto de datos confiable y equilibrado, se generó un dataset propio a partir de cuatro herramientas de clonación de voz ampliamente utilizadas: RVC, Voice.ia, ElevenLabs y Applio. Se recolectaron un total de 1,256 muestras de voz, equilibradas por idioma (español e inglés) y género (masculino y femenino). Los resultados experimentales muestran que la frecuencia fundamental constituye una característica relevante para la detección de voces clonadas, siendo su efectividad dependiente de la forma en que es representada y procesada. En particular, la representación de la hF0 mediante histogramas permitió obtener los mejores resultados de clasificación, alcanzando una precisión del 95%, mientras que otras variantes basadas en estadísticas simples o en salidas directas del modelo CREPE presentaron desempeños moderados. Estos hallazgos confirman el potencial del descriptor hF0 para la identificación de clonación de voz y resaltan la importancia de una adecuada extracción y representación de características acústicas. Asimismo, la construcción de un dataset diversificado con múltiples herramientas permitió reducir el sesgo asociado al uso de una sola técnica de clonación, proporcionando una base más robusta para futuros estudios en el área de la detección de deepfakes de voz. |
| metadata.dc.type: | info:eu-repo/semantics/masterThesis |
| Collection(s) : | Tesis de Maestría en Computación |
Fichier(s) constituant ce document :
| Fichier | Description | Taille | Format | |
|---|---|---|---|---|
| MC_Jibran_Zaedt_Rodriguez_Garcia_2026.pdf | Tesis | 3 MB | Adobe PDF | Voir/Ouvrir |
| MC_Jibran_Zaedt_Rodriguez_Garcia_2026_c.pdf Accès limité | Cesión de derechos | 442.5 kB | Adobe PDF | Voir/Ouvrir Demander une copie |
Ce document est protégé par copyright |
Ce document est autorisé sous une licence de type Licence Creative Commons