SciFigQual-Bench: A Benchmark for Scientific Figure Quality Assessment with Full-Manuscript Context
TL;DR - SciFigQual-Bench evaluates scientific figures using full-manuscript context rather than visual appearance alone. Its cross-modal SFQ-Agent framework improves scoring accuracy and consistency across five quality dimensions.
- Contains 6,308 expert-annotated figures from top computer-science conferences spanning 2020–2025.
- Scores clarity, layout, caption fit, contextual relevance, and misleading risk.
- Links each figure to its caption, citing sentence, and manuscript context.
- On eval1200, SFQ-Agent (F3) with GPT-5.6-Sol achieved 0.418 average absolute error and 93.4% consistency, outperforming direct and Sidecar-assisted evaluation.