AVE-Compass
AVE-Compass evaluates audio-visual editing models on 145 source videos and 196 instructions with 2,688 checklist items, scoring Instruction Following, Fidelity Preserving, Realism, and Editing Intent via MLLM judging and automated metrics.
- Released
- 2026-07-17
- Readiness
- Runnable
- Primary field
- General AI
Why it matters
This benchmark addresses the gap in evaluating coordinated audio-visual edits, providing a structured way to measure cross-modal consistency and non-target preservation, which is critical for advancing real-world video editing systems.
Motivation
While instruction-based video editing has advanced rapidly, real-world videos contain tightly coupled audio and visual signals, and editing one modality often requires coordinated changes in the other.
Primary resources
Benchmark Radar records only publicly supported details and links back to primary sources for verification.