Please use this identifier to cite or link to this item: https://rinacional.tecnm.mx/jspui/handle/TecNM/13731
Title: Reentrenamiento de un modelo de lenguaje de gran tamaño como apoyo para la diagnosis del cáncer de tiroides
Authors: Alvarez Juarez, Alejandro%2042396
metadata.dc.subject.other: Procesamiento de lenguaje natural, cáncer de tiroides, modelos de lenguaje biomédicos, clasificación diagnóstica, español clínico.
Issue Date: 2026-08-04
Publisher: Tecnológico Nacional de México
metadata.dc.publisher.tecnm: Centro Nacional de Investigación y Desarrollo Tecnológico
Description: El análisis automático de texto clínico en español para el apoyo al diagnóstico oncológico es un área de creciente interés, condicionada por la escasez de recursos lingüísticos especializados en este idioma y por el predominio de herramientas diseñadas principalmente para el inglés. La presente investigación parte de que el conocimiento contenido en los registros clínicos puede aprovecharse mediante modelos de lenguaje biomédicos preentrenados en español, con el propósito de apoyar la clasificación de la posible presencia de cáncer de tiroides a partir de narrativas clínicas. Se adaptó el modelo de lenguaje biomédico BSC-BIO-EHR-ES mediante un proceso de reentrenamiento sobre un corpus construido a partir de información médica de fuentes abiertas. El desarrollo siguió un protocolo por fases que comprendió la preparación y depuración de los datos, su evaluación mediante algoritmos de clasificación tradicionales, la transformación de los registros estructurados en narrativas clínicas redactadas conforme a la normatividad mexicana aplicable, y el ajuste y la validación del modelo bajo un esquema de validación cruzada anidada. Los resultados muestran que la representación del conocimiento clínico en lenguaje natural, procesada por el modelo biomédico, aporta mayor valor diagnóstico que el tratamiento tabular con clasificadores clásicos, a los que supera de forma estadísticamente significativa y con un desempeño competitivo dentro de los umbrales establecidos. Se concluye que transformar datos estructurados en narrativas clínicas para activar el conocimiento biomédico preentrenado constituye una estrategia viable y reproducible para el diagnóstico asistido en escenarios de escasez de datos en español.
metadata.dc.type: info:eu-repo/semantics/masterThesis
Appears in Collections:Tesis de Maestría en Computación

Files in This Item:
File Description SizeFormat 
MC_Alejandro_Alvarez_Juarez_2026.pdfTesis4.01 MBAdobe PDFView/Open
MC_Alejandro_Alvarez_Juarez_2026_c.pdf
  Restricted Access
Cesión de derechos587.57 kBAdobe PDFView/Open Request a copy


This item is protected by original copyright



This item is licensed under a Creative Commons License Creative Commons