Just Noticeable Difference Modeling for Token Compression in Vision-Language-Action Models
TL;DR - Action-JND estimates how much each visual token in a vision-language-action policy can change without exceeding a tolerated action deviation. This enables safer token pruning and stale-KV reuse for lower-latency robotic control, particularly at aggressive compression ratios.
- Defines token “noticeability” using language-conditioned action responses rather than indirect similarity, attention, or saliency signals.
- Uses a lightweight token-wise estimator in deep visual-feature space to predict maximum action-preserving perturbations.
- Produces action-tolerance scores that plug into multiple compression methods and prioritize tolerant tokens for compression.
- Experiments with OpenVLA and OpenVLA-OFT on LIBERO report consistently improved compression reliability.