🛰️ Daily AI Frontier
‹ back to 2026-09-20

Cross-Modal Attention Acts as a Frequency Filter: Why Verbose Prompts Improve Robustness in Vision-Language Models

Research Multimodal & Generative

Ranking

Overall 75
Content 90
Popularity 39

Observed public metrics from 1 member.

Merged summary

TL;DR - Cross-modal attention in vision-language models acts as a question-conditioned frequency filter over image patches, helping explain why verbose prompts improve robustness while fine-grained questions increase sensitivity to image corruption. Simple prompt padding also produces measurable accuracy gains under corruption.

  • Verbose rephrasings broaden the attention filter’s frequency support, reducing answer drift under corrupted images.
  • Fine-grained or semantically complex questions concentrate attention on fewer visual scales, making models more fragile when corruption overlaps those frequencies.
  • Across GQA and CLEVR, verbose paraphrasing reduced drift variance by 70–81% for 8B Qwen3-VL and LLaVA-OneVision models.
  • The findings suggest a practical robustness technique: pad prompts with instructions such as “Please look carefully and answer.”

Sources (1)

Cross-Modal Attention Acts as a Frequency Filter: Why Verbose Prompts Improve Robustness in Vision-Language Models

arXiv cs.CV Farooq Ahmad Wani, Maria Sofia Bucarelli, Mujtaba Hussain Mirza, Oleksandr Pryymak, Aryo Pradipta Gema, Iacopo Masi, Pasquale Minervini, Fabrizio Silvestri 2026-09-17 arXiv:2609.20139
Public signals Semantic Scholar citations 0 · Semantic Scholar influential citations 0
Providers: Hugging Face · N/A OpenAlex · N/A Publisher · N/A Semantic Scholar · Citations 0 · Influential citations 0 X · N/A Fetched 2026-09-25 14:17:35.078020 UTC

TL;DR - Cross-modal attention in vision-language models acts as a question-conditioned frequency filter over image patches, helping explain why verbose prompts improve robustness while fine-grained questions increase sensitivity to image corruption. Simple prompt padding also produces measurable accuracy gains under corruption.

  • Verbose rephrasings broaden the attention filter’s frequency support, reducing answer drift under corrupted images.
  • Fine-grained or semantically complex questions concentrate attention on fewer visual scales, making models more fragile when corruption overlaps those frequencies.
  • Across GQA and CLEVR, verbose paraphrasing reduced drift variance by 70–81% for 8B Qwen3-VL and LLaVA-OneVision models.
  • The findings suggest a practical robustness technique: pad prompts with instructions such as “Please look carefully and answer.”
item →