Benchmark Radar
AI BENCHMARK PROFILE

Colosseum V2

Robotics & Autonomous SystemsRobotics & Embodied IntelligenceColosseum V2 Team

Simulation benchmark for VLA generalization with 28 tasks across 13 categories and two robot morphologies, using ManiSkill.

Released
2026-05-26
Readiness
Paper only
Primary field
Robotics & Autonomous Systems

Why it matters

VLA models often fail under distribution shifts. Colosseum V2 provides standardized in/out-domain evaluation for reproducible comparison.

Motivation

Vision-Language-Action (VLA) models demonstrate promising generalization in robotic manipulation, driven by advances in large-scale vision and language pre-training.

Primary resources

Benchmark Radar records only publicly supported details and links back to primary sources for verification.