OmniPhys: Knowledge-Graph-Driven Benchmarking and Collective Optimization for Physical Commonsense in Text-to-Image Generation
TL;DR - OmniPhys is a 1,551-sample, knowledge-graph-grounded benchmark for diagnosing physical commonsense failures in text-to-image models. Its OmniPrompt framework improves physical consistency by aggregating feedback across stochastic generations and multiple queries.
- Builds scenarios from PhET simulations and standard curricula using a Physical Knowledge Graph.
- Uses dual-path verification to test specific physical principles rather than coarse descriptions.
- Evaluations across 12 text-to-image models reveal shared physical-reasoning bottlenecks.
- OmniPrompt filters generation noise through per-query feedback buffers and batch-level meta-policy updates.