Utilize este identificador para referenciar este registo:
https://rinacional.tecnm.mx/jspui/handle/TecNM/13731| Título: | Reentrenamiento de un modelo de lenguaje de gran tamaño como apoyo para la diagnosis del cáncer de tiroides |
| Autor: | Alvarez Juarez, Alejandro%2042396 |
| metadata.dc.subject.other: | Procesamiento de lenguaje natural, cáncer de tiroides, modelos de lenguaje biomédicos, clasificación diagnóstica, español clínico. |
| Data: | 2026-08-04 |
| Editora: | Tecnológico Nacional de México |
| metadata.dc.publisher.tecnm: | Centro Nacional de Investigación y Desarrollo Tecnológico |
| Descrição: | El análisis automático de texto clínico en español para el apoyo al diagnóstico oncológico es un área de creciente interés, condicionada por la escasez de recursos lingüísticos especializados en este idioma y por el predominio de herramientas diseñadas principalmente para el inglés. La presente investigación parte de que el conocimiento contenido en los registros clínicos puede aprovecharse mediante modelos de lenguaje biomédicos preentrenados en español, con el propósito de apoyar la clasificación de la posible presencia de cáncer de tiroides a partir de narrativas clínicas. Se adaptó el modelo de lenguaje biomédico BSC-BIO-EHR-ES mediante un proceso de reentrenamiento sobre un corpus construido a partir de información médica de fuentes abiertas. El desarrollo siguió un protocolo por fases que comprendió la preparación y depuración de los datos, su evaluación mediante algoritmos de clasificación tradicionales, la transformación de los registros estructurados en narrativas clínicas redactadas conforme a la normatividad mexicana aplicable, y el ajuste y la validación del modelo bajo un esquema de validación cruzada anidada. Los resultados muestran que la representación del conocimiento clínico en lenguaje natural, procesada por el modelo biomédico, aporta mayor valor diagnóstico que el tratamiento tabular con clasificadores clásicos, a los que supera de forma estadísticamente significativa y con un desempeño competitivo dentro de los umbrales establecidos. Se concluye que transformar datos estructurados en narrativas clínicas para activar el conocimiento biomédico preentrenado constituye una estrategia viable y reproducible para el diagnóstico asistido en escenarios de escasez de datos en español. |
| metadata.dc.type: | info:eu-repo/semantics/masterThesis |
| Aparece nas colecções: | Tesis de Maestría en Computación |
Ficheiros deste registo:
| Ficheiro | Descrição | Tamanho | Formato | |
|---|---|---|---|---|
| MC_Alejandro_Alvarez_Juarez_2026.pdf | Tesis | 4.01 MB | Adobe PDF | Ver/Abrir |
| MC_Alejandro_Alvarez_Juarez_2026_c.pdf Restricted Access | Cesión de derechos | 587.57 kB | Adobe PDF | Ver/Abrir Request a copy |
Este registo está protegido por copyright original. |
Este registo está protegido por Licença Creative Commons