Veuillez utiliser cette adresse pour citer ce document : https://rinacional.tecnm.mx/jspui/handle/TecNM/12238
Titre: Modelo de diferenciación de voz humana y sintética
Auteur(s): Rodriguez Garcia, Jibran Zaedt%1298260
metadata.dc.subject.other: Herramientas de clonación de voz, algoritmos de clonación, aplicaciones de clonación, inteligencia artificial, clonación de voz.
Date de publication: 2026-02-06
Editeur: Tecnológico Nacional de México
metadata.dc.publisher.tecnm: Centro Nacional de Investigación y Desarrollo Tecnológico
Description: El presente trabajo se enfoca en el análisis y comparación de distintas técnicas para el reconocimiento de voces humanas y voces generadas sintéticamente mediante herramientas de clonación. Aunque el objetivo inicial fue desarrollar un sistema de reconocimiento, el proyecto derivó en una investigación experimental centrada en la caracterización de señales de voz, específicamente mediante la estimación de la frecuencia fundamental híbrida (hF0), como descriptor para diferenciar entre voces naturales y clonadas. Debido a la ausencia de un conjunto de datos confiable y equilibrado, se generó un dataset propio a partir de cuatro herramientas de clonación de voz ampliamente utilizadas: RVC, Voice.ia, ElevenLabs y Applio. Se recolectaron un total de 1,256 muestras de voz, equilibradas por idioma (español e inglés) y género (masculino y femenino). Los resultados experimentales muestran que la frecuencia fundamental constituye una característica relevante para la detección de voces clonadas, siendo su efectividad dependiente de la forma en que es representada y procesada. En particular, la representación de la hF0 mediante histogramas permitió obtener los mejores resultados de clasificación, alcanzando una precisión del 95%, mientras que otras variantes basadas en estadísticas simples o en salidas directas del modelo CREPE presentaron desempeños moderados. Estos hallazgos confirman el potencial del descriptor hF0 para la identificación de clonación de voz y resaltan la importancia de una adecuada extracción y representación de características acústicas. Asimismo, la construcción de un dataset diversificado con múltiples herramientas permitió reducir el sesgo asociado al uso de una sola técnica de clonación, proporcionando una base más robusta para futuros estudios en el área de la detección de deepfakes de voz.
metadata.dc.type: info:eu-repo/semantics/masterThesis
Collection(s) :Tesis de Maestría en Computación

Fichier(s) constituant ce document :
Fichier Description TailleFormat 
MC_Jibran_Zaedt_Rodriguez_Garcia_2026.pdfTesis3 MBAdobe PDFVoir/Ouvrir
MC_Jibran_Zaedt_Rodriguez_Garcia_2026_c.pdf
  Accès limité
Cesión de derechos442.5 kBAdobe PDFVoir/Ouvrir    Demander une copie


Ce document est protégé par copyright



Ce document est autorisé sous une licence de type Licence Creative Commons Creative Commons