Descripció del projecte
Esta investigación propone un nuevo sistema de asistencia a la navegación para personas con baja visión, que integra modelos de lenguaje grande (LLMs) y técnicas avanzadas de localización para mejorar tanto la comprensión de la escena como la precisión espacial.
El primer componente se centra en el uso de LLM en conjunción con la visión por ordenador para detectar, describir y semantificar escenas visuales, proporcionando a los usuarios con interpretaciones contextualmente ricas y similares a las humanas de su entorno en tiempo real. Esto permite que el sistema se mueva más allá de la detección de objetos hacia la comprensión significativa de la escena, como identificar las posibilidades de navegación, obstáculos y puntos de interés.
El segundo componente mejora la precisión de la localización mediante la fusión de datos cartográficos, entradas de sensores e información multimodal (p. ej., GPS, inerciales y señales visuales) para ofrecer un posicionamiento preciso incluso en entornos urbanos o interiores complejos. Juntos estos dos avances pretenden crear un sistema de navegación inteligente y consciente del contexto que ofrezca un apoyo de movilidad más seguro, intuitivo y personalizado para personas con baja visión.