Benchmark Radar
AI BENCHMARK PROFILE

MultiRef-Compass

General AIMultimodal PerceptionMultiRef-Compass Team

MultiRef-Compass evaluates multi-reference-to-audio-video generation systems on 350 curated samples. It assesses Basic Quality, Reference Consistency, Audio-Visual Consistency, and Instruction Following using 14 sub-metrics, combining automatic metrics with an MLLM-as-a-Judge framework.

Released
2026-07-15
Readiness
Runnable
Primary field
General AI

Why it matters

Existing benchmarks focus on text-driven or single-reference generation and often ignore joint audio-video alignment. MultiRef-Compass addresses the gap by providing a public protocol for multi-reference composition, enabling reproducible comparison across models in a rapidly evolving generation task.

Motivation

Multi-reference-to-audio-video (MR2AV) generation aims to generate coherent audio-video content conditioned on multiple references and textual instructions.

Primary resources

Benchmark Radar records only publicly supported details and links back to primary sources for verification.