AI BENCHMARK PROFILE
Colosseum V2
Simulation benchmark for VLA generalization with 28 tasks across 13 categories and two robot morphologies, using ManiSkill.
- Released
- 2026-05-26
- Readiness
- Paper only
- Primary field
- Robotics & Autonomous Systems
Why it matters
VLA models often fail under distribution shifts. Colosseum V2 provides standardized in/out-domain evaluation for reproducible comparison.
Motivation
Vision-Language-Action (VLA) models demonstrate promising generalization in robotic manipulation, driven by advances in large-scale vision and language pre-training.
Primary resources
Benchmark Radar records only publicly supported details and links back to primary sources for verification.