Proyecto de IA y Visión Artificial

Lenguaje de Señas con Visión

Sistema de visión por computadora que detecta y traduce gestos de lenguaje de señas en tiempo real. Usa MediaPipe para el seguimiento de manos, OpenCV para el procesamiento de video y una red neuronal entrenada para clasificar cada seña. Construido con Python, TensorFlow y Keras.

Reconocimiento de lenguaje de señas con visión artificial
🤟

IA en Tiempo Real

Computer Vision & Deep Learning

Características Principales

Funcionalidades clave del sistema de reconocimiento

Detección de Manos en Tiempo Real

MediaPipe rastrea hasta 21 puntos de referencia de cada mano en el video de la cámara, con alta precisión y rendimiento.

🧠

Clasificación con Red Neuronal

Modelo de deep learning entrenado con TensorFlow/Keras para reconocer patrones de gestos y clasificar cada seña.

📊

Dataset Propio

Recolección y etiquetado manual de muestras de cada letra o gesto para construir un dataset balanceado y representativo.

🔤

Traducción de Letras y Palabras

Reconoce el abecedario dactilológico (letras) y palabras comunes del lenguaje de señas, mostrando el texto traducido.

Procesamiento en Streaming

Procesamiento optimizado del flujo de video para obtener respuesta casi instantánea sin sacrificar precisión.

🖥️

Interfaz Visual

Ventana de visualización que dibuja el esqueleto de la mano, la letra detectada y el historial de señas en pantalla.

Stack Tecnológico

Herramientas de visión artificial y machine learning

🐍Python
MediaPipe Hands
🎥OpenCV
🔢NumPy
📹Camera Streaming

Desafíos y Soluciones

Problemas técnicos resueltos durante el desarrollo

1

Detección Robusta de Manos

Lograr el seguimiento de las manos en distintas condiciones de iluminación, fondos y tipos de piel sin perder estabilidad.

Solución: Uso de MediaPipe Hands, que provee un modelo de detección y landmarks de mano optimizado y robusto frente a variaciones del entorno.
2

Dataset y Clases Imbalanceadas

Recolectar suficientes muestras de cada letra y evitar que el modelo se sesgue hacia las clases con más ejemplos.

Solución: Recolección manual equilibrada y aumento de datos (rotaciones y desplazamientos) para balancear y enriquecer el dataset.
3

Latencia en Tiempo Real

Clasificar cada frame del video sin que la traducción se sienta lenta o entrecortada.

Solución: Optimización del pipeline, muestreo de frames y un modelo ligero que mantiene precisión con baja latencia de inferencia.
4

Generalización del Modelo

Que el modelo funcione bien con manos de distintos usuarios, tamaños y ángulos, no solo con los datos de entrenamiento.

Solución: Normalización de los landmarks relativos y entrenamiento con validación cruzada para mejorar la capacidad de generalización.

Código Fuente

Explora el código completo del proyecto en GitHub. Incluye el notebook de entrenamiento del modelo, los scripts de captura de datos, el dataset y el detector en tiempo real.

🧠Deep Learning
MediaPipe
🔓Open Source
Ver Repositorio en GitHub

¿Interesado en un proyecto de IA y visión artificial?

Puedo ayudarte a desarrollar tu solución con machine learning y computer vision con las mejores tecnologías