Veuillez utiliser cette adresse pour citer ce document :
https://rinacional.tecnm.mx/jspui/handle/TecNM/12237| Titre: | MODELO DE RED PROFUNDA PARA SEGMENTACIÓN SEMÁNTICA EN TIEMPO REAL CON PLATAFORMA GPU EMBEBIDA |
| Auteur(s): | JESÚS ALONSO, REYES PORRAS |
| metadata.dc.subject.other: | MODELO DE RED PROFUNDA PARA SEGMENTACIÓN SEMÁNTICA EN TIEMPO REAL CON PLATAFORMA GPU EMBEBIDA |
| Date de publication: | 2026-01-01 |
| Editeur: | Tecnológico Nacional de México |
| metadata.dc.publisher.tecnm: | Instituto Tecnológico de Chihuahua |
| Description: | El aprendizaje profundo es un área de la inteligencia artificial que ha crecido de manera significativa en los últimos años gracias al desarrollo de tecnologías embebidas que permiten ejecutar algoritmos de forma más eficiente y con menor tiempo de procesamiento. Esta área ha sido muy útil, ya que se pueden extraer características abstractas de manera automática, lo que causa que el aprendizaje profundo sea propicio para la segmentación semántica de objetos. Entre estos modelos y formas de aprendizaje, las redes totalmente convolucionales (FCN por sus siglas en inglés) son las que han tenido mayor éxito en segmentación semántica debido a la alta precisión que tienen. Sin embargo, para lograr estos resultados, estas redes suelen ser muy profundas, por lo que el costo computacional aumenta. De esta manera, han surgido recientemente diversos trabajos en la literatura para mejorar la eficiencia computacional de las FCN. Por lo tanto, contribuyendo con estos esfuerzos, en esta tesis se propone un modelo de FCN para segmentación semántica que corre en tiempo real en una plataforma de Unidad Grafica de Procesamiento embebida. Este modelo se denominó Red de tiempo real Consciente del Contexto para sistemas embebidos, CARTNet por sus siglas en inglés (Context Aware and Real Time Network for Embedded Systems) y se enfoca principalmente en la relación que existe entre el contexto global y local en un escenario. Esto lo logra mediante dos enfoques: uno es una red de dos ramas de resolución, en la que una rama se encarga de la alta resolución para obtener el contexto global viii y la otra rama con la baja resolución se encarga del contexto local y los detalles finos. El otro enfoque es mediante convoluciones multi-dilatadas, que combinan convoluciones de diferentes grados de dilatación para lograr tener diferentes campos receptivos para analizar diferentes niveles de contexto, similar a cuando una persona se aleja de un objetivo para poder ampliar su campo de visión. De acuerdo con los resultados, este modelo presenta una velocidad de 26.12 FPS en la tarjeta GPU embebida Nvidia Jetson TX2, una precisión de 52.12% en la base de datos de Cityscapes, 221,827 parámetros y 1.25 GFlops (GIGA operaciones de punto flotante) mientras que otras redes eficientes como ContextNet logra 22.03 FPS, 66.1% de precisión, 876,560 parámetros y 1.78 GFlops. |
| metadata.dc.type: | info:eu-repo/semantics/masterThesis |
| Collection(s) : | Maestría en Ciencias en Ingeniería Electrónica |
Fichier(s) constituant ce document :
| Fichier | Description | Taille | Format | |
|---|---|---|---|---|
| Tesis Reyes Porras Jesus Alonso.pdf | 2.86 MB | Adobe PDF | Voir/Ouvrir |
Ce document est protégé par copyright |
Ce document est autorisé sous une licence de type Licence Creative Commons