CogCanvas
CogCanvas is a benchmark for multi-subject reference-based image generation, with 1,952 curated reference images, 1,361 compositional prompts, and a unified six-axis evaluation protocol. It includes tasks for reference-based generation, text-to-image composition, and reference retrieval, with metrics BG-Sim and Attr-VQA.
- Released
- 2026-06-14
- Readiness
- Paper only
- Primary field
- General AI
Why it matters
CogCanvas addresses the gap in jointly evaluating multi-identity, object binding, background grounding, and spatial plausibility in image generation. It provides a comprehensive benchmark for assessing composition capabilities across group sizes.
Motivation
Multi-subject reference-based image generation requires jointly preserving multiple human identities, binding per-person objects and fashion items, and respecting a specified background scene, a regime where current diffusion models remain brittle.
Primary resources
Benchmark Radar records only publicly supported details and links back to primary sources for verification.