🛰️ Daily AI Frontier
‹ back to 2026-08-23

Just Noticeable Difference Modeling for Token Compression in Vision-Language-Action Models

Research Efficiency & Systems

Ranking

Overall 79
Content 95
Popularity 41

Observed public metrics from 1 member.

Merged summary

TL;DR - Action-JND estimates how much each visual token in a vision-language-action policy can change without exceeding a tolerated action deviation. This enables safer token pruning and stale-KV reuse for lower-latency robotic control, particularly at aggressive compression ratios.

  • Defines token “noticeability” using language-conditioned action responses rather than indirect similarity, attention, or saliency signals.
  • Uses a lightweight token-wise estimator in deep visual-feature space to predict maximum action-preserving perturbations.
  • Produces action-tolerance scores that plug into multiple compression methods and prioritize tolerant tokens for compression.
  • Experiments with OpenVLA and OpenVLA-OFT on LIBERO report consistently improved compression reliability.

Sources (1)

Just Noticeable Difference Modeling for Token Compression in Vision-Language-Action Models

arXiv cs.CV Zhuoyuan Li, Rui Zhao, Jin Wang, Hanwei Zhu, Cong Zhang, Giuseppe Valenzise, Weisi Lin, Kin-Man Lam 2026-08-21 arXiv:2608.21247
Public signals Semantic Scholar citations 0 · Semantic Scholar influential citations 0
Providers: Hugging Face · N/A OpenAlex · N/A Publisher · N/A Semantic Scholar · Citations 0 · Influential citations 0 X · N/A Fetched 2026-09-14 14:18:33.328198 UTC

TL;DR - Action-JND estimates how much each visual token in a vision-language-action policy can change without exceeding a tolerated action deviation. This enables safer token pruning and stale-KV reuse for lower-latency robotic control, particularly at aggressive compression ratios.

  • Defines token “noticeability” using language-conditioned action responses rather than indirect similarity, attention, or saliency signals.
  • Uses a lightweight token-wise estimator in deep visual-feature space to predict maximum action-preserving perturbations.
  • Produces action-tolerance scores that plug into multiple compression methods and prioritize tolerant tokens for compression.
  • Experiments with OpenVLA and OpenVLA-OFT on LIBERO report consistently improved compression reliability.
item →