Un mismo pipeline de video, cuatro capacidades corriendo en tiempo real: rostro, manos, lenguaje de señas y objetos — todo sobre una cámara web estándar, sin GPU obligatoria.
Cada uno resuelve un problema distinto sobre la misma base técnica de landmarks y detección
| TECNOLOGÍA | USO EN EL PROYECTO |
|---|---|
| Python | Lenguaje base de todo el sistema |
| OpenCV | Captura de video, dibujo de anotaciones y preprocesamiento de frames |
| MediaPipe (Face Mesh / Hands) | Detección de landmarks faciales y de manos en tiempo real |
| TensorFlow / Keras | Entrenamiento del clasificador de letras en lenguaje de señas |
| YOLOv8 (Ultralytics) | Detección y clasificación de objetos en la escena |
| NumPy | Procesamiento vectorial de coordenadas y landmarks |
Del frame de la cámara a la anotación en pantalla, en seis pasos
OpenCV lee el frame de la cámara web en tiempo real.
Conversión de color (BGR a RGB) y redimensionado del frame.
Rostro, manos, señas y objetos se procesan de forma independiente sobre el mismo frame.
Normalización de coordenadas y suavizado temporal para evitar parpadeo en las detecciones.
Se dibujan landmarks, cajas delimitadoras y etiquetas con OpenCV.
El frame anotado se muestra en tiempo real o se transmite a otra aplicación.
Traducción de lenguaje de señas a texto para facilitar la comunicación.
Control de aplicaciones mediante gestos de mano.
Conteo y clasificación de objetos y personas en una escena.
Herramientas interactivas para aprender el alfabeto dactilológico.
Desde reconocimiento de gestos hasta detección de objetos en producción, construyo soluciones de visión por computadora en tiempo real adaptadas a tu caso de uso.