Please use this identifier to cite or link to this item: https://rinacional.tecnm.mx/jspui/handle/TecNM/12156
Title: ALGORITMOS DE SEGMENTACIÓN DE OBJETOS DINÁMICOS EN SECUENCIAS DE VIDEO MEDIANTE APRENDIZAJE PROFUNDO
Authors: Guzmán Pando, Abimael
metadata.dc.subject.other: ALGORITMOS DE SEGMENTACIÓN DE OBJETOS DINÁMICOS EN SECUENCIAS DE VIDEO MEDIANTE APRENDIZAJE PROFUNDO
Issue Date: 2026-01-01
Publisher: Tecnológico Nacional de México
metadata.dc.publisher.tecnm: Instituto Tecnológico de Chihuahua
Description: En este trabajo, se presentan dos propuestas de algoritmos enfocados a detección de objetos dinámicos en video mediante técnicas de aprendizaje profundo. La primera propuesta es llamada 2FraCNN (Two Frame Convolutional Neural Network) y consiste en una red convolucional que considera información temporal del video en una arquitectura tipo Encoder-Decoder. La arquitectura de 2FraCNN se basa en el algoritmo FlowNet, pionero en estimar flujo óptico mediante un esquema supervisado. La segunda propuesta plantea una idea novedosa y original inspirada en la visión biológica de las aves rapaces. El algoritmo es llamado DeepFoveaNet y su esquema modular emula la visión monocular de las aves rapaces mediante dos módulos de redes convolucionales Encoder-Decoder, de periferia y de enfoque. La red de periferia se encarga de detectar el movimiento general de la escena y la red de enfoque emula el efecto de magnificación producido en la fóvea profunda para captar características de los objetos con mayor detalle. La evaluación de 2FraCNN realizada en la base de datos Change Detection (CDnet14) demostró la robustez del algoritmo propuesto para manejar diferentes situaciones críticas de video con altos indicies de desempeño, tales como: fondos dinámicos, ruido en la escena debido al mal clima, sombras, objetos intermitentes, camuflaje, entre otras. 2FraCNN se ubicó dentro los primeros lugares del ranquin de evaluación de CDnet14, superó ampliamente a los algoritmos DeepBS, SuBSENSE y PAWCS, y obtuvo resultados competitivos respecto a los primeros cuatro métodos de la base de datos, que son FgSegNet_v2, FgSegNet_S, FgSegNet y CascadeCNN. Además, 2FraCNN se ubicó en el 12º lugar en el instrumento de evaluación Performance, Velocity, Autoadaptability, Documentation and Novelty (PVADN), demostrando ser un algoritmo competente respecto a una evaluación que considera aspectos tanto prácticos como teóricos. Por otro lado, los resultados cuantitativos y cualitativos de DeepFoveaNet mostraron que el uso de la red de fóvea profunda ayudó en la correcta detección de objetos dinámicos, incluso los más pequeños y evitó que estos se perdieran durante los cuadros del video. DeepFoveaNet logró situarse en la séptima posición en el ranking de desempeños sobre todas las categorías de video de la base de datos CDnet14. Los mejores resultados fueron en las categorías de video; sombras, básicos, cámaras térmicas y movimiento de cámaras, con valores de F-Measure mayores a 0.98. Además, demostró consistencia en sus resultados al ser evaluado mediante los videos de la base de datos LASIESTA, aun y cuando en la gran mayoría de videos solo se usaron 100 cuadros para su entrenamiento. A diferencia de algunos de los algoritmos del estado del arte que ocupan los primeros lugares de la base de datos Change Detection, DeepFoveaNet y 2FraCNN no dependen de modelos de red previamente entrenadas, algoritmos generadores de fondo y una extensa cantidad de imágenes para entrenamiento. Además, su arquitectura permite que la red aprenda información espaciotemporal del video e incluyen un esquema de balanceo de clases novedoso para proveer una correcta convergencia.
metadata.dc.type: info:eu-repo/semantics/doctoralThesis
Appears in Collections:Doctorado en Ciencias en Ingeniería Electrónica

Files in This Item:
File Description SizeFormat 
Tesis Guzman Pando Abimael.pdf19.84 MBAdobe PDFView/Open


This item is protected by original copyright



This item is licensed under a Creative Commons License Creative Commons