Sample-Efficient Learning from Agent Experience
TL;DR - Experience Distillation transfers agents’ in-context learning from interaction histories into model weights without additional environment interactions. It retains most in-context gains while using far fewer samples than reinforcement-learning baselines.
- Retains at least 64.8% of in-context learning gains across software-engineering tasks and text-adventure games.
- Direct supervised fine-tuning recovers only 3.8% of those gains.
- Evaluated on 749 curated software-engineering tasks and six text-adventure games.
- Matches classical reinforcement-learning baselines with at least 9.6× fewer environment samples.