Beyond Score Prediction: LLM-Based Essay Scoring and Feedback Generation via Reinforcement Learning with Rubric Rewards
TL;DR - RLAES uses reinforcement learning with rubric-based rewards to jointly improve automated essay scoring and feedback generation. It achieves leading LLM-based scoring results on ASAP while preserving feedback quality.
- RFE evaluates feedback using 166 fine-grained binary rubric items and an LLM judge.
- AGFO activates feedback rewards selectively, reducing evaluation overhead during RL.
- Adjacent Contrastive Reasoning improves calibration between neighboring score levels.
- RLAES-AGFO reaches 0.803 QWK on ASAP with feedback quality comparable to GPT-5.5.