🛰️ Daily AI Frontier
‹ back to 2026-07-30

SciFigQual-Bench: A Benchmark for Scientific Figure Quality Assessment with Full-Manuscript Context

Research Multimodal & Generative

Ranking

Overall 63
Content 70
Popularity 46

Observed public metrics from 1 member.

Representative image for SciFigQual-Bench: A Benchmark for Scientific Figure Quality Assessment with Full-Manuscript Context

Merged summary

TL;DR - SciFigQual-Bench evaluates scientific figures using full-manuscript context rather than visual appearance alone. Its cross-modal SFQ-Agent framework improves scoring accuracy and consistency across five quality dimensions.

  • Contains 6,308 expert-annotated figures from top computer-science conferences spanning 2020–2025.
  • Scores clarity, layout, caption fit, contextual relevance, and misleading risk.
  • Links each figure to its caption, citing sentence, and manuscript context.
  • On eval1200, SFQ-Agent (F3) with GPT-5.6-Sol achieved 0.418 average absolute error and 93.4% consistency, outperforming direct and Sidecar-assisted evaluation.

Sources (1)

SciFigQual-Bench: A Benchmark for Scientific Figure Quality Assessment with Full-Manuscript Context

arXiv cs.CV Zihan Deng, Chuanzhi Xu, Huiqi Liang, Haoyang Li, Xiaozhen Zhong, Lequan Yu 2026-07-29 arXiv:2607.27084
Public signals Hugging Face upvotes 0
Providers: Hugging Face · Upvotes 0 OpenAlex · N/A Publisher · N/A Semantic Scholar · N/A X · N/A Fetched 2026-08-28 14:33:31.337953 UTC

TL;DR - SciFigQual-Bench evaluates scientific figures using full-manuscript context rather than visual appearance alone. Its cross-modal SFQ-Agent framework improves scoring accuracy and consistency across five quality dimensions.

  • Contains 6,308 expert-annotated figures from top computer-science conferences spanning 2020–2025.
  • Scores clarity, layout, caption fit, contextual relevance, and misleading risk.
  • Links each figure to its caption, citing sentence, and manuscript context.
  • On eval1200, SFQ-Agent (F3) with GPT-5.6-Sol achieved 0.418 average absolute error and 93.4% consistency, outperforming direct and Sidecar-assisted evaluation.
item →