Benchmark Radar
AI BENCHMARK PROFILE

VistaHop

General AIMultimodal Perception

VistaHop is a benchmark for long-horizon Visual DeepSearch, evaluating repeated image inspection, visual-anchor grounding, and evidence traversal across 600 tasks.

Released
2026-06-02
Readiness
Paper only
Primary field
General AI

Why it matters

Targets the gap in evaluating MLLMs' ability to iteratively revisit visual evidence and reason across multiple steps in complex visual queries.

Motivation

Visual DeepSearch tasks require multimodal large language models (MLLMs) to resolve complex visual queries by repeatedly inspecting image regions, grounding reasoning in visual evidence, and connecting fine-grained clues across multiple steps.

Primary resources

Benchmark Radar records only publicly supported details and links back to primary sources for verification.