🛰️ Daily AI Frontier
‹ back to 2026-07-29

OmniPhys: Knowledge-Graph-Driven Benchmarking and Collective Optimization for Physical Commonsense in Text-to-Image Generation

arXiv cs.CV Multimodal & Generative Yajing Xu, Yarong Lan, Jiaoyan Chen, Yichi Zhang, Jeff Z. Pan, Mingchen Tu, Zhizhen Liu, Wen Zhang, Huajun Chen 2026-07-28
Representative image for OmniPhys: Knowledge-Graph-Driven Benchmarking and Collective Optimization for Physical Commonsense in Text-to-Image Generation

TL;DR - OmniPhys is a 1,551-sample, knowledge-graph-grounded benchmark for diagnosing physical commonsense failures in text-to-image models. Its OmniPrompt framework improves physical consistency by aggregating feedback across stochastic generations and multiple queries.

  • Builds scenarios from PhET simulations and standard curricula using a Physical Knowledge Graph.
  • Uses dual-path verification to test specific physical principles rather than coarse descriptions.
  • Evaluations across 12 text-to-image models reveal shared physical-reasoning bottlenecks.
  • OmniPrompt filters generation noise through per-query feedback buffers and batch-level meta-policy updates.

view merged work →