Benchmark Radar
AI BENCHMARK PROFILE

LongAV-Compass

General AIMultimodal PerceptionPKU CS LongAV Group

LongAV-Compass evaluates minute-scale audio-visual generation across text-to-audio-video, image-to-audio-video, and video-to-audio-video tasks. It includes 284 curated test cases and an evaluation framework combining multimodal metrics with MLLM-assisted assessment across 20+ dimensions covering segment quality, cross-segment consistency, narrative coherence, semantic alignment, and audiovisual synchronization.

Released
2026-05-25
Readiness
Runnable
Primary field
General AI

Why it matters

Existing audio-visual evaluation is limited to short clips, leaving a gap for minute-scale generation. LongAV-Compass provides a standardized protocol for diagnosing degradation in identity consistency, narrative coherence, and alignment over long horizons, supporting comparison of long-form generation models.

Motivation

Audio-visual generation is rapidly advancing from short clips to minute-long content, while existing evaluation protocols remain largely confined to short-form settings.

Primary resources

Benchmark Radar records only publicly supported details and links back to primary sources for verification.