AI BENCHMARK PROFILE
MOV-Bench
MOV-Bench contains 519 questions requiring multi-hop reasoning over temporally dispersed audio-visual evidence, evaluating omni-modal LLMs on cross-modal reasoning tasks.
- Released
- 2026-05-27
- Readiness
- Paper only
- Primary field
- General AI
Why it matters
Existing benchmarks offer limited investigation of multi-hop audio-visual reasoning; MOV-Bench provides a focused evaluation set for this capability.
Motivation
Multi-hop audio-visual reasoning remains challenging for Omni-LLMs, as relevant evidence is often sparse, temporally dispersed, and distributed across both audio and visual streams.
Primary resources
Benchmark Radar records only publicly supported details and links back to primary sources for verification.