Benchmark RadarRadarView on GitHub ↗

Model Evals

Blue = new in latest card

Newest dated model on the left; undated models follow. Blue marks a benchmark only when it appears in the latest model card and in none of the earlier collected cards from that company. Historical models remain neutral. Missing records do not establish adoption or abandonment. Capability groups are broad labels; benchmarks may measure several abilities.