
handle: 10347/44806
Este trabajo se centra en la optimización de modelos de visión-lenguaje (VLMs) aplicados a tareas de pregunta/respuesta visual (VQA) sobre vídeos con objetos pequeños, un escenario que plantea importantes retos computacionales debido al elevado número de tokens visuales irrelevantes que se generan. Para abordar este problema, se propone un método basado en la integración de un detector que identifica regiones visuales relevantes en los fotogramas del vídeo, lo que permite filtrar los tokens visuales asociados al fondo generados por el módulo de visión (ViT) antes de ser procesados por el modelo de lenguaje (LLM). Los resultados experimentales muestran que este filtrado permite eliminar una gran proporción de tokens visuales, lo que conlleva una notable reducción de la complejidad computacional del modelo de lenguaje y, en consecuencia, una disminución en la complejidad total del sistema, sin comprometer el rendimiento. Asimismo, se observa una mejora en el tiempo de ejecución del LLM, lo que contribuye a una mayor eficiencia en el procesamiento textual. Sin embargo, el impacto sobre el tiempo total de inferencia está condicionado por el ViT, que sigue representando el principal cuello de botella debido al procesamiento de imágenes en alta resolución, así como por el coste computacional adicional del detector utilizado. Este trabajo valida el uso de técnicas de filtrado como una estrategia eficaz para mejorar la eficiencia de los VLMs y abre nuevas líneas de investigación dirigidas a optimizar también el procesamiento visual, así como a explorar detectores más ligeros.
Modelos visión-lenguaje (VLMs), Objetos pequeños, Pregunta/Respuesta Visual (VQA), 1203 Ciencia de los ordenadores
Modelos visión-lenguaje (VLMs), Objetos pequeños, Pregunta/Respuesta Visual (VQA), 1203 Ciencia de los ordenadores
| selected citations These citations are derived from selected sources. This is an alternative to the "Influence" indicator, which also reflects the overall/total impact of an article in the research community at large, based on the underlying citation network (diachronically). | 0 | |
| popularity This indicator reflects the "current" impact/attention (the "hype") of an article in the research community at large, based on the underlying citation network. | Average | |
| influence This indicator reflects the overall/total impact of an article in the research community at large, based on the underlying citation network (diachronically). | Average | |
| impulse This indicator reflects the initial momentum of an article directly after its publication, based on the underlying citation network. | Average |
