LongAV-Compass
LongAV-Compass evaluates minute-scale audio-visual generation across text-to-audio-video, image-to-audio-video, and video-to-audio-video tasks. It includes 284 curated test cases and an evaluation framework combining multimodal metrics with MLLM-assisted assessment across 20+ dimensions covering segment quality, cross-segment consistency, narrative coherence, semantic alignment, and audiovisual synchronization.
- Released
- 2026-05-25
- Readiness
- Runnable
- Primary field
- General AI
Why it matters
Existing audio-visual evaluation is limited to short clips, leaving a gap for minute-scale generation. LongAV-Compass provides a standardized protocol for diagnosing degradation in identity consistency, narrative coherence, and alignment over long horizons, supporting comparison of long-form generation models.
Motivation
Audio-visual generation is rapidly advancing from short clips to minute-long content, while existing evaluation protocols remain largely confined to short-form settings.
Primary resources
Benchmark Radar records only publicly supported details and links back to primary sources for verification.