Powered by OpenAIRE graph
Found an issue? Give us feedback
image/svg+xml art designer at PLoS, modified by Wikipedia users Nina, Beao, JakobVoss, and AnonMoos Open Access logo, converted into svg, designed by PLoS. This version with transparent background. http://commons.wikimedia.org/wiki/File:Open_Access_logo_PLoS_white.svg art designer at PLoS, modified by Wikipedia users Nina, Beao, JakobVoss, and AnonMoos http://www.plos.org/ Minerva. Repositorio...arrow_drop_down
image/svg+xml art designer at PLoS, modified by Wikipedia users Nina, Beao, JakobVoss, and AnonMoos Open Access logo, converted into svg, designed by PLoS. This version with transparent background. http://commons.wikimedia.org/wiki/File:Open_Access_logo_PLoS_white.svg art designer at PLoS, modified by Wikipedia users Nina, Beao, JakobVoss, and AnonMoos http://www.plos.org/
addClaim

Modelos de visión-lenguaje robustos a objetos pequeños

Authors: Gómez Sánchez del Valle, Nuria;

Modelos de visión-lenguaje robustos a objetos pequeños

Abstract

Este trabajo se centra en la optimización de modelos de visión-lenguaje (VLMs) aplicados a tareas de pregunta/respuesta visual (VQA) sobre vídeos con objetos pequeños, un escenario que plantea importantes retos computacionales debido al elevado número de tokens visuales irrelevantes que se generan. Para abordar este problema, se propone un método basado en la integración de un detector que identifica regiones visuales relevantes en los fotogramas del vídeo, lo que permite filtrar los tokens visuales asociados al fondo generados por el módulo de visión (ViT) antes de ser procesados por el modelo de lenguaje (LLM). Los resultados experimentales muestran que este filtrado permite eliminar una gran proporción de tokens visuales, lo que conlleva una notable reducción de la complejidad computacional del modelo de lenguaje y, en consecuencia, una disminución en la complejidad total del sistema, sin comprometer el rendimiento. Asimismo, se observa una mejora en el tiempo de ejecución del LLM, lo que contribuye a una mayor eficiencia en el procesamiento textual. Sin embargo, el impacto sobre el tiempo total de inferencia está condicionado por el ViT, que sigue representando el principal cuello de botella debido al procesamiento de imágenes en alta resolución, así como por el coste computacional adicional del detector utilizado. Este trabajo valida el uso de técnicas de filtrado como una estrategia eficaz para mejorar la eficiencia de los VLMs y abre nuevas líneas de investigación dirigidas a optimizar también el procesamiento visual, así como a explorar detectores más ligeros.

Country
Spain
Related Organizations
Keywords

Modelos visión-lenguaje (VLMs), Objetos pequeños, Pregunta/Respuesta Visual (VQA), 1203 Ciencia de los ordenadores

  • BIP!
    Impact byBIP!
    selected citations
    These citations are derived from selected sources.
    This is an alternative to the "Influence" indicator, which also reflects the overall/total impact of an article in the research community at large, based on the underlying citation network (diachronically).
    0
    popularity
    This indicator reflects the "current" impact/attention (the "hype") of an article in the research community at large, based on the underlying citation network.
    Average
    influence
    This indicator reflects the overall/total impact of an article in the research community at large, based on the underlying citation network (diachronically).
    Average
    impulse
    This indicator reflects the initial momentum of an article directly after its publication, based on the underlying citation network.
    Average
Powered by OpenAIRE graph
Found an issue? Give us feedback
selected citations
These citations are derived from selected sources.
This is an alternative to the "Influence" indicator, which also reflects the overall/total impact of an article in the research community at large, based on the underlying citation network (diachronically).
BIP!Citations provided by BIP!
popularity
This indicator reflects the "current" impact/attention (the "hype") of an article in the research community at large, based on the underlying citation network.
BIP!Popularity provided by BIP!
influence
This indicator reflects the overall/total impact of an article in the research community at large, based on the underlying citation network (diachronically).
BIP!Influence provided by BIP!
impulse
This indicator reflects the initial momentum of an article directly after its publication, based on the underlying citation network.
BIP!Impulse provided by BIP!
0
Average
Average
Average
Green