Please use this identifier to cite or link to this item:
https://rinacional.tecnm.mx/jspui/handle/TecNM/13731| Title: | Reentrenamiento de un modelo de lenguaje de gran tamaño como apoyo para la diagnosis del cáncer de tiroides |
| Authors: | Alvarez Juarez, Alejandro%2042396 |
| metadata.dc.subject.other: | Procesamiento de lenguaje natural, cáncer de tiroides, modelos de lenguaje biomédicos, clasificación diagnóstica, español clínico. |
| Issue Date: | 2026-08-04 |
| Publisher: | Tecnológico Nacional de México |
| metadata.dc.publisher.tecnm: | Centro Nacional de Investigación y Desarrollo Tecnológico |
| Description: | El análisis automático de texto clínico en español para el apoyo al diagnóstico oncológico es un área de creciente interés, condicionada por la escasez de recursos lingüísticos especializados en este idioma y por el predominio de herramientas diseñadas principalmente para el inglés. La presente investigación parte de que el conocimiento contenido en los registros clínicos puede aprovecharse mediante modelos de lenguaje biomédicos preentrenados en español, con el propósito de apoyar la clasificación de la posible presencia de cáncer de tiroides a partir de narrativas clínicas. Se adaptó el modelo de lenguaje biomédico BSC-BIO-EHR-ES mediante un proceso de reentrenamiento sobre un corpus construido a partir de información médica de fuentes abiertas. El desarrollo siguió un protocolo por fases que comprendió la preparación y depuración de los datos, su evaluación mediante algoritmos de clasificación tradicionales, la transformación de los registros estructurados en narrativas clínicas redactadas conforme a la normatividad mexicana aplicable, y el ajuste y la validación del modelo bajo un esquema de validación cruzada anidada. Los resultados muestran que la representación del conocimiento clínico en lenguaje natural, procesada por el modelo biomédico, aporta mayor valor diagnóstico que el tratamiento tabular con clasificadores clásicos, a los que supera de forma estadísticamente significativa y con un desempeño competitivo dentro de los umbrales establecidos. Se concluye que transformar datos estructurados en narrativas clínicas para activar el conocimiento biomédico preentrenado constituye una estrategia viable y reproducible para el diagnóstico asistido en escenarios de escasez de datos en español. |
| metadata.dc.type: | info:eu-repo/semantics/masterThesis |
| Appears in Collections: | Tesis de Maestría en Computación |
Files in This Item:
| File | Description | Size | Format | |
|---|---|---|---|---|
| MC_Alejandro_Alvarez_Juarez_2026.pdf | Tesis | 4.01 MB | Adobe PDF | View/Open |
| MC_Alejandro_Alvarez_Juarez_2026_c.pdf Restricted Access | Cesión de derechos | 587.57 kB | Adobe PDF | View/Open Request a copy |
This item is protected by original copyright |
This item is licensed under a Creative Commons License