Utilize este identificador para referenciar este registo: https://rinacional.tecnm.mx/jspui/handle/TecNM/13731
Título: Reentrenamiento de un modelo de lenguaje de gran tamaño como apoyo para la diagnosis del cáncer de tiroides
Autor: Alvarez Juarez, Alejandro%2042396
metadata.dc.subject.other: Procesamiento de lenguaje natural, cáncer de tiroides, modelos de lenguaje biomédicos, clasificación diagnóstica, español clínico.
Data: 2026-08-04
Editora: Tecnológico Nacional de México
metadata.dc.publisher.tecnm: Centro Nacional de Investigación y Desarrollo Tecnológico
Descrição: El análisis automático de texto clínico en español para el apoyo al diagnóstico oncológico es un área de creciente interés, condicionada por la escasez de recursos lingüísticos especializados en este idioma y por el predominio de herramientas diseñadas principalmente para el inglés. La presente investigación parte de que el conocimiento contenido en los registros clínicos puede aprovecharse mediante modelos de lenguaje biomédicos preentrenados en español, con el propósito de apoyar la clasificación de la posible presencia de cáncer de tiroides a partir de narrativas clínicas. Se adaptó el modelo de lenguaje biomédico BSC-BIO-EHR-ES mediante un proceso de reentrenamiento sobre un corpus construido a partir de información médica de fuentes abiertas. El desarrollo siguió un protocolo por fases que comprendió la preparación y depuración de los datos, su evaluación mediante algoritmos de clasificación tradicionales, la transformación de los registros estructurados en narrativas clínicas redactadas conforme a la normatividad mexicana aplicable, y el ajuste y la validación del modelo bajo un esquema de validación cruzada anidada. Los resultados muestran que la representación del conocimiento clínico en lenguaje natural, procesada por el modelo biomédico, aporta mayor valor diagnóstico que el tratamiento tabular con clasificadores clásicos, a los que supera de forma estadísticamente significativa y con un desempeño competitivo dentro de los umbrales establecidos. Se concluye que transformar datos estructurados en narrativas clínicas para activar el conocimiento biomédico preentrenado constituye una estrategia viable y reproducible para el diagnóstico asistido en escenarios de escasez de datos en español.
metadata.dc.type: info:eu-repo/semantics/masterThesis
Aparece nas colecções:Tesis de Maestría en Computación

Ficheiros deste registo:
Ficheiro Descrição TamanhoFormato 
MC_Alejandro_Alvarez_Juarez_2026.pdfTesis4.01 MBAdobe PDFVer/Abrir
MC_Alejandro_Alvarez_Juarez_2026_c.pdf
  Restricted Access
Cesión de derechos587.57 kBAdobe PDFVer/Abrir Request a copy


Este registo está protegido por copyright original.



Este registo está protegido por Licença Creative Commons Creative Commons