INSTITUTO TECNOLÓGICO SUPERIOR DE
GUASAVE
Materia:
Inteligencia Artificial
Profesor:
Bojórquez Delgado Gilberto
Trabajo:
Visión 2D
Alumna:
Buenrostro Lugo Danna Paola
Cuadras Camacho Carlos Ariel
Duran Leyva Naydelin Jatzyri
García Félix María Fernanda
Gutiérrez Peñuelas Luis Angel
Carrera:
Ingeniería en sistemas computacionales.
Grupo:
801
Fecha:
18/03/26.
Introducción
Los sistemas de seguridad electrónica tradicionales, como los que utilizan sensores
infrarrojos pasivos o detección de movimiento basada en cambios de píxeles, tienen una
limitación importante, no entienden realmente lo que está ocurriendo en el entorno. Estos
sistemas reaccionan ante cualquier cambio físico, como variaciones de temperatura, el
movimiento de una mascota o incluso objetos desplazados por el viento. Como resultado,
generan una gran cantidad de falsas alarmas, lo que termina provocando cansancio o
desconfianza en los usuarios.
Este proyecto busca solucionar ese problema mediante el desarrollo de un sistema de
videovigilancia inteligente en tiempo real, apoyado en Inteligencia Artificial. A través del uso
de redes neuronales convolucionales, el sistema puede analizar la escena de forma más
avanzada, filtrando el ruido visual y detectando específicamente la presencia de personas.
Además, el desarrollo no solo se enfoca en la detección, sino también en construir una
arquitectura de software sólida. Se prioriza una lógica eficiente que permita mantener el
sistema siempre disponible, guardar evidencia de manera confiable y manejar múltiples
procesos al mismo tiempo, todo esto sin sobrecargar los recursos del equipo, como el
procesador o la memoria.
1
Desarrollo
Para la detección de objetos se utilizó el modelo YOLOv8 en su versión Nano. A diferencia
de métodos más antiguos como Haar Cascades, que suelen fallar cuando hay cambios de
iluminación o cuando un objeto está parcialmente cubierto, YOLOv8 analiza la imagen
completa en una sola pasada.
Esto le permite identificar patrones más complejos y enfocarse únicamente en detectar
personas (clase "persona" del dataset COCO). Además, esta versión logra un buen balance
entre precisión y rendimiento, lo que la hace ideal para ejecutarse en equipos con recursos
limitados como una CPU estándar.
En lugar de desarrollar todo el sistema en un solo bloque de código, se optó por una estructura
modular basada en principios de programación orientada a objetos. Esto facilita el
mantenimiento, la escalabilidad y la claridad del sistema.
El sistema se divide en tres módulos principales:
• Módulo de Inferencia y UI:
Es el componente principal. Se encarga de capturar el video, procesarlo con el modelo
de inteligencia artificial y mostrar los resultados en pantalla, incluyendo recuadros
sobre las personas detectadas y datos como los FPS en tiempo real.
• Módulo de Persistencia de Datos:
Maneja todo lo relacionado con el almacenamiento. Guarda imágenes importantes
(evidencias) junto con la fecha y hora, además de generar un registro automático de
los eventos detectados.
• Módulo de Alertas Asíncronas:
Se encarga de las alertas sonoras. Utiliza funciones del sistema operativo para
reproducir sonidos sin interrumpir la ejecución principal del programa, permitiendo
que todo siga funcionando de forma fluida.
Para asegurar un buen desempeño incluso en hardware convencional, se
implementaron dos estrategias clave:
• Salto de fotogramas (Frame Skipping) y caché visual:
El sistema no procesa todos los frames del video, sino solo algunos (por ejemplo, 1
de cada N). Además, guarda la última posición detectada de la persona para mantener
la continuidad visual. Esto reduce significativamente la carga del procesador sin
afectar la experiencia del usuario.
• Sistema Antispam (Cooldown):
Para evitar guardar demasiadas imágenes innecesarias, se estableció un tiempo de
espera entre cada captura de evidencia. Por ejemplo, después de guardar una imagen,
2
el sistema espera unos segundos antes de permitir otra, incluso si la persona sigue en
pantalla.
3
Conclusión
Este proyecto demuestra que es posible desarrollar un sistema de videovigilancia inteligente
con características cercanas a soluciones profesionales, utilizando hardware accesible.
Se logró crear un sistema capaz de reducir los falsos positivos mediante la detección
específica de personas, manteniendo al mismo tiempo un rendimiento eficiente. Gracias a la
organización modular, el uso de procesamiento optimizado y la ejecución de tareas en
paralelo, el sistema puede operar en tiempo real sin sobrecargar el equipo.
Como siguiente paso, esta arquitectura permite escalar el sistema fácilmente, por ejemplo,
integrando bases de datos para almacenar la información o enviando alertas en tiempo real a
dispositivos móviles mediante servicios web.
4
Anexos
Para comprobar que el sistema funciona correctamente y que la arquitectura propuesta se
implementó de forma adecuada, se presentan los resultados obtenidos durante su ejecución
en un entorno real, así como el código fuente que hace posible su funcionamiento.
Código Fuente
El siguiente script en Python corresponde a la versión final del sistema de videovigilancia.
En él se integran todos los componentes principales, incluyendo la reproducción de audio de
forma asíncrona, la gestión eficiente de la interfaz gráfica y el almacenamiento automático
de evidencias.
5
6
7
8
Estructura de Archivos y Persistencia Local
El sistema genera automáticamente las carpetas necesarias para guardar la información. Esta
organización permite mantener separadas las evidencias (como imágenes y registros) de los
archivos del sistema, evitando conflictos y facilitando la gestión de los datos.
Registro Fotográfico de Intrusiones
Cuando el sistema detecta una persona con un nivel de confianza mayor al 50%, captura el
fotograma correspondiente, dibuja un recuadro alrededor del individuo e indica el porcentaje
de precisión de la detección.
La imagen se guarda en formato .jpg con un nombre único basado en la fecha y hora, lo que
evita que los archivos se sobrescriban y permite llevar un historial ordenado de eventos.
9
Bitácora de Seguridad Auditiva
Al mismo tiempo que se guarda la imagen y se activa la alerta sonora, el sistema registra cada
evento en un archivo de texto.
Este registro incluye información clave como la fecha, la hora exacta, el nivel de confianza
de la detección y el nombre del archivo de imagen asociado. De esta forma, se cumple con
un control básico de auditoría y se facilita la revisión posterior de los eventos detectados.
10