Benchmark Radar
AI BENCHMARK PROFILE

PhyEditBench

General AIMultimodal PerceptionPrevisior

PhyEditBench evaluates physics-aware image editing. It includes 238 real-world instances and 35 synthetic anti-physics instances across 12 physical subclasses, with VLM-based scoring on consistency, instruction following, physical plausibility, and image quality.

Released
2026-06-25
Readiness
Runnable
Primary field
General AI

Why it matters

Image editing benchmarks often overlook physics reasoning; PhyEditBench provides a reusable evaluation to measure physical coherence in edited outputs, important for real-world applications.

Motivation

While instruction-based image editing, enabled by multi-modal generative models, has advanced significantly, existing benchmarks lack a comprehensive evaluation of physics-based reasoning, a critical capability for handling real-world scenarios.

Primary resources

Benchmark Radar records only publicly supported details and links back to primary sources for verification.