🛰️ Daily AI Frontier
‹ back to 2026-07-28

The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation

arXiv cs.CL LLM Agents Tianyi Men, Zhuoran Jin, Kang Liu, Jun Zhao 2026-07-27

TL;DR - This paper studies how foundation-model agents acquire, refine, and combine long-horizon planning abilities in a controlled multi-turn environment. It identifies training-data and distillation strategies that improve generalization while exposing sources of error and capability interference.

  • Explicit chain-of-thought state-transition modeling improves long-horizon generalization; atomic skills alone do not enable composition, but limited long-horizon data can.
  • Suboptimal training trajectories substantially degrade performance as errors compound over longer horizons.
  • On-policy distillation (OPD) is effective across more low-quality and long-horizon settings than GRPO, owing to more consistent update directions.
  • Multi-teacher OPD can integrate compatible or partially shared planning patterns, while conflicting patterns cause severe interference.

view merged work →