MultiRef-Compass
MultiRef-Compass evaluates multi-reference-to-audio-video generation systems on 350 curated samples. It assesses Basic Quality, Reference Consistency, Audio-Visual Consistency, and Instruction Following using 14 sub-metrics, combining automatic metrics with an MLLM-as-a-Judge framework.
- Released
- 2026-07-15
- Readiness
- Runnable
- Primary field
- General AI
Why it matters
Existing benchmarks focus on text-driven or single-reference generation and often ignore joint audio-video alignment. MultiRef-Compass addresses the gap by providing a public protocol for multi-reference composition, enabling reproducible comparison across models in a rapidly evolving generation task.
Motivation
Multi-reference-to-audio-video (MR2AV) generation aims to generate coherent audio-video content conditioned on multiple references and textual instructions.
Primary resources
Benchmark Radar records only publicly supported details and links back to primary sources for verification.