Benchmark Radar
AI BENCHMARK PROFILE

VisEditBench

General AIMultimodal Perceptionvis-nlp

VisEditBench is a benchmark comprising 1,395 human-annotated visualization code-editing tasks across two settings: feedback-guided repair and reference-guided restyling. Models are evaluated on their ability to revise existing visualization code based on multimodal feedback such as buggy or marked charts with textual instructions, and target chart images. Scoring is based on pass rates of generated code executions.

Released
2026-08-11
Readiness
Runnable
Primary field
General AI

Why it matters

Existing benchmarks focus on generating visualizations from scratch, leaving the iterative editing process unexplored. VisEditBench provides a standardized evaluation for this practical task, enabling comparisons across VLMs and highlighting gaps in open-source models, particularly in visually grounded style adaptation.

Motivation

Vision-language models (VLMs) have shown strong capabilities in generating visualization code from textual or visual specifications.

Primary resources

Benchmark Radar records only publicly supported details and links back to primary sources for verification.