🛰️ Daily AI Frontier
‹ back to 2026-08-23

Just Noticeable Difference Modeling for Token Compression in Vision-Language-Action Models

arXiv cs.CV Efficiency & Systems Zhuoyuan Li, Rui Zhao, Jin Wang, Hanwei Zhu, Cong Zhang, Giuseppe Valenzise, Weisi Lin, Kin-Man Lam 2026-08-21

TL;DR - Action-JND estimates how much each visual token in a vision-language-action policy can change without exceeding a tolerated action deviation. This enables safer token pruning and stale-KV reuse for lower-latency robotic control, particularly at aggressive compression ratios.

  • Defines token “noticeability” using language-conditioned action responses rather than indirect similarity, attention, or saliency signals.
  • Uses a lightweight token-wise estimator in deep visual-feature space to predict maximum action-preserving perturbations.
  • Produces action-tolerance scores that plug into multiple compression methods and prioritize tolerant tokens for compression.
  • Experiments with OpenVLA and OpenVLA-OFT on LIBERO report consistently improved compression reliability.

view merged work →