AI BENCHMARK PROFILE
VistaHop
VistaHop is a benchmark for long-horizon Visual DeepSearch, evaluating repeated image inspection, visual-anchor grounding, and evidence traversal across 600 tasks.
- Released
- 2026-06-02
- Readiness
- Paper only
- Primary field
- General AI
Why it matters
Targets the gap in evaluating MLLMs' ability to iteratively revisit visual evidence and reason across multiple steps in complex visual queries.
Motivation
Visual DeepSearch tasks require multimodal large language models (MLLMs) to resolve complex visual queries by repeatedly inspecting image regions, grounding reasoning in visual evidence, and connecting fine-grained clues across multiple steps.
Primary resources
Benchmark Radar records only publicly supported details and links back to primary sources for verification.