🛰️ Daily AI Frontier
‹ back to 2026-07-29

OmniPhys: Knowledge-Graph-Driven Benchmarking and Collective Optimization for Physical Commonsense in Text-to-Image Generation

Research Multimodal & Generative

Ranking

Overall 77
Content 90
Popularity 45

Observed public metrics from 1 member.

Representative image for OmniPhys: Knowledge-Graph-Driven Benchmarking and Collective Optimization for Physical Commonsense in Text-to-Image Generation

Merged summary

TL;DR - OmniPhys is a 1,551-sample, knowledge-graph-grounded benchmark for diagnosing physical commonsense failures in text-to-image models. Its OmniPrompt framework improves physical consistency by aggregating feedback across stochastic generations and multiple queries.

  • Builds scenarios from PhET simulations and standard curricula using a Physical Knowledge Graph.
  • Uses dual-path verification to test specific physical principles rather than coarse descriptions.
  • Evaluations across 12 text-to-image models reveal shared physical-reasoning bottlenecks.
  • OmniPrompt filters generation noise through per-query feedback buffers and batch-level meta-policy updates.

Sources (1)

OmniPhys: Knowledge-Graph-Driven Benchmarking and Collective Optimization for Physical Commonsense in Text-to-Image Generation

arXiv cs.CV Yajing Xu, Yarong Lan, Jiaoyan Chen, Yichi Zhang, Jeff Z. Pan, Mingchen Tu, Zhizhen Liu, Wen Zhang, Huajun Chen 2026-07-28 arXiv:2607.25641
Public signals Semantic Scholar citations 0 · Semantic Scholar influential citations 0
Providers: Hugging Face · N/A OpenAlex · N/A Publisher · N/A Semantic Scholar · Citations 0 · Influential citations 0 X · N/A Fetched 2026-08-24 14:32:21.886491 UTC

TL;DR - OmniPhys is a 1,551-sample, knowledge-graph-grounded benchmark for diagnosing physical commonsense failures in text-to-image models. Its OmniPrompt framework improves physical consistency by aggregating feedback across stochastic generations and multiple queries.

  • Builds scenarios from PhET simulations and standard curricula using a Physical Knowledge Graph.
  • Uses dual-path verification to test specific physical principles rather than coarse descriptions.
  • Evaluations across 12 text-to-image models reveal shared physical-reasoning bottlenecks.
  • OmniPrompt filters generation noise through per-query feedback buffers and batch-level meta-policy updates.
item →