Por favor, use este identificador para citar o enlazar este ítem: https://rinacional.tecnm.mx/jspui/handle/TecNM/12238
Título : Modelo de diferenciación de voz humana y sintética
Autor : Rodriguez Garcia, Jibran Zaedt%1298260
metadata.dc.subject.other: Herramientas de clonación de voz, algoritmos de clonación, aplicaciones de clonación, inteligencia artificial, clonación de voz.
Fecha de publicación : 2026-02-06
Editorial : Tecnológico Nacional de México
metadata.dc.publisher.tecnm: Centro Nacional de Investigación y Desarrollo Tecnológico
Descripción : El presente trabajo se enfoca en el análisis y comparación de distintas técnicas para el reconocimiento de voces humanas y voces generadas sintéticamente mediante herramientas de clonación. Aunque el objetivo inicial fue desarrollar un sistema de reconocimiento, el proyecto derivó en una investigación experimental centrada en la caracterización de señales de voz, específicamente mediante la estimación de la frecuencia fundamental híbrida (hF0), como descriptor para diferenciar entre voces naturales y clonadas. Debido a la ausencia de un conjunto de datos confiable y equilibrado, se generó un dataset propio a partir de cuatro herramientas de clonación de voz ampliamente utilizadas: RVC, Voice.ia, ElevenLabs y Applio. Se recolectaron un total de 1,256 muestras de voz, equilibradas por idioma (español e inglés) y género (masculino y femenino). Los resultados experimentales muestran que la frecuencia fundamental constituye una característica relevante para la detección de voces clonadas, siendo su efectividad dependiente de la forma en que es representada y procesada. En particular, la representación de la hF0 mediante histogramas permitió obtener los mejores resultados de clasificación, alcanzando una precisión del 95%, mientras que otras variantes basadas en estadísticas simples o en salidas directas del modelo CREPE presentaron desempeños moderados. Estos hallazgos confirman el potencial del descriptor hF0 para la identificación de clonación de voz y resaltan la importancia de una adecuada extracción y representación de características acústicas. Asimismo, la construcción de un dataset diversificado con múltiples herramientas permitió reducir el sesgo asociado al uso de una sola técnica de clonación, proporcionando una base más robusta para futuros estudios en el área de la detección de deepfakes de voz.
metadata.dc.type: info:eu-repo/semantics/masterThesis
Aparece en las colecciones: Tesis de Maestría en Computación

Ficheros en este ítem:
Fichero Descripción Tamaño Formato  
MC_Jibran_Zaedt_Rodriguez_Garcia_2026.pdfTesis3 MBAdobe PDFVisualizar/Abrir
MC_Jibran_Zaedt_Rodriguez_Garcia_2026_c.pdf
  Restricted Access
Cesión de derechos442.5 kBAdobe PDFVisualizar/Abrir  Request a copy


Este ítem está protegido por copyright original



Este ítem está sujeto a una licencia Creative Commons Licencia Creative Commons Creative Commons