Please use this identifier to cite or link to this item: https://rinacional.tecnm.mx/jspui/handle/TecNM/13985
Title: Desarrollo de un modelo basado en lenguaje natural para la recuperación de información histórica y cultural mediante técnicas de retrieval augmented generation
Authors: Franco Rogel, Johan Argenis%2042376
metadata.dc.subject.other: Retrieval-Augmented Generation (RAG), recuperación híbrida de información, modelos de lenguaje pequeños (SLM), procesamiento de lenguaje natural (PLN)
Issue Date: 2026-09-04
Publisher: Tecnológico Nacional de México
metadata.dc.publisher.tecnm: Centro Nacional de Investigación y Desarrollo Tecnológico
Description: Los modelos de lenguaje de gran tamaño han demostrado un desempeño sobresaliente en tareas de generación de texto; sin embargo, presentan limitaciones para responder consultas sobre dominios especializados debido a la posibilidad de generar información no respaldada por fuentes documentales. Una estrategia ampliamente utilizada para reducir este problema consiste en emplear arquitecturas de Generación Aumentada por Recuperación (RAG por sus siglas en inglés), las cuales incorporan información externa durante el proceso de generación. En esta investigación se desarrolló y evaluó un sistema RAG orientado al dominio museográfico, empleando un modelo de lenguaje pequeño (SLM por sus siglas en inglés) y una estrategia de recuperación híbrida basada en la combinación lineal de evidencia léxica y evidencia semántica. Como parte del trabajo se realizaron cinco experimentos: evaluación de la robustez del recuperador ante errores ortográficos; selección del modelo generativo mediante el banco de pruebas Multilingual Massive Multitask Language Understanding (MMMLU); comparación de estrategias de recuperación sobre el conjunto MessIRve; evaluación integral del sistema RAG mediante métricas de recuperación, generación y evaluadores automáticos; y evaluación con usuarios para analizar el desempeño y la interacción con el sistema. Los resultados muestran que la estrategia híbrida propuesta supera a los métodos de recuperación convencionales, obteniendo mejores valores en MRR y exhaustividad (Recall). Asimismo, la implementación desarrollada obtuvo un mejor desempeño que una implementación equivalente basada en LangChain tanto en recuperación como en generación de respuestas. Finalmente, la evaluación con usuarios evidenció que el sistema facilita la consulta de información histórica mediante lenguaje natural y favorece la exploración del contenido museográfico.
metadata.dc.type: info:eu-repo/semantics/masterThesis
Appears in Collections:Tesis de Maestría en Computación

Files in This Item:
File Description SizeFormat 
MC_Johan_Argenis_Franco_Rogel_2026.pdfTesis2.3 MBAdobe PDFView/Open
MC_Johan_Argenis_Franco_Rogel_2026_c.pdf
  Restricted Access
Cesión de derechos159.16 kBAdobe PDFView/Open Request a copy


This item is protected by original copyright



This item is licensed under a Creative Commons License Creative Commons