Please use this identifier to cite or link to this item:
https://rinacional.tecnm.mx/jspui/handle/TecNM/13985| Title: | Desarrollo de un modelo basado en lenguaje natural para la recuperación de información histórica y cultural mediante técnicas de retrieval augmented generation |
| Authors: | Franco Rogel, Johan Argenis%2042376 |
| metadata.dc.subject.other: | Retrieval-Augmented Generation (RAG), recuperación híbrida de información, modelos de lenguaje pequeños (SLM), procesamiento de lenguaje natural (PLN) |
| Issue Date: | 2026-09-04 |
| Publisher: | Tecnológico Nacional de México |
| metadata.dc.publisher.tecnm: | Centro Nacional de Investigación y Desarrollo Tecnológico |
| Description: | Los modelos de lenguaje de gran tamaño han demostrado un desempeño sobresaliente en tareas de generación de texto; sin embargo, presentan limitaciones para responder consultas sobre dominios especializados debido a la posibilidad de generar información no respaldada por fuentes documentales. Una estrategia ampliamente utilizada para reducir este problema consiste en emplear arquitecturas de Generación Aumentada por Recuperación (RAG por sus siglas en inglés), las cuales incorporan información externa durante el proceso de generación. En esta investigación se desarrolló y evaluó un sistema RAG orientado al dominio museográfico, empleando un modelo de lenguaje pequeño (SLM por sus siglas en inglés) y una estrategia de recuperación híbrida basada en la combinación lineal de evidencia léxica y evidencia semántica. Como parte del trabajo se realizaron cinco experimentos: evaluación de la robustez del recuperador ante errores ortográficos; selección del modelo generativo mediante el banco de pruebas Multilingual Massive Multitask Language Understanding (MMMLU); comparación de estrategias de recuperación sobre el conjunto MessIRve; evaluación integral del sistema RAG mediante métricas de recuperación, generación y evaluadores automáticos; y evaluación con usuarios para analizar el desempeño y la interacción con el sistema. Los resultados muestran que la estrategia híbrida propuesta supera a los métodos de recuperación convencionales, obteniendo mejores valores en MRR y exhaustividad (Recall). Asimismo, la implementación desarrollada obtuvo un mejor desempeño que una implementación equivalente basada en LangChain tanto en recuperación como en generación de respuestas. Finalmente, la evaluación con usuarios evidenció que el sistema facilita la consulta de información histórica mediante lenguaje natural y favorece la exploración del contenido museográfico. |
| metadata.dc.type: | info:eu-repo/semantics/masterThesis |
| Appears in Collections: | Tesis de Maestría en Computación |
Files in This Item:
| File | Description | Size | Format | |
|---|---|---|---|---|
| MC_Johan_Argenis_Franco_Rogel_2026.pdf | Tesis | 2.3 MB | Adobe PDF | View/Open |
| MC_Johan_Argenis_Franco_Rogel_2026_c.pdf Restricted Access | Cesión de derechos | 159.16 kB | Adobe PDF | View/Open Request a copy |
This item is protected by original copyright |
This item is licensed under a Creative Commons License