🛰️ Daily AI Frontier
‹ back to 2026-09-24

PCQC: Privileged Counterfactual Question Credit for Multi-Turn Medical Dialogue

arXiv cs.LG Medical/Healthcare AI Chenxuan Li, Jiayi Wan, Xinrong Chen, Zhongyu Zhao, Xuecheng Shang, Peixing Wan 2026-09-23
Representative image for PCQC: Privileged Counterfactual Question Credit for Multi-Turn Medical Dialogue

TL;DR - PCQC is a training method that assigns question-level credit in medical dialogues by evaluating both asked and counterfactual questions using privileged patient information. It improves diagnostic accuracy while requiring fewer inquiry turns than competing reinforcement-learning methods.

  • Constructs answers to unasked alternative questions from privileged patient facts, avoiding full counterfactual dialogue rollouts.
  • Uses a frozen diagnostic scorer to compare how strongly each question-answer pair supports the correct diagnosis.
  • Combines relative question credit with outcome-based reinforcement learning to supervise executed and unexecuted questions.
  • Achieves 63.10% mean accuracy across four benchmarks—4.38 points above GRPO and 4.21 above ATPO—with 33.1% fewer inquiry turns than GRPO.

view merged work →