Benchmark Radar
AI BENCHMARK PROFILE

MOV-Bench

General AIMultimodal Perception

MOV-Bench contains 519 questions requiring multi-hop reasoning over temporally dispersed audio-visual evidence, evaluating omni-modal LLMs on cross-modal reasoning tasks.

Released
2026-05-27
Readiness
Paper only
Primary field
General AI

Why it matters

Existing benchmarks offer limited investigation of multi-hop audio-visual reasoning; MOV-Bench provides a focused evaluation set for this capability.

Motivation

Multi-hop audio-visual reasoning remains challenging for Omni-LLMs, as relevant evidence is often sparse, temporally dispersed, and distributed across both audio and visual streams.

Primary resources

Benchmark Radar records only publicly supported details and links back to primary sources for verification.