Benchmark Radar
AI BENCHMARK PROFILE

T2D-Bench

Health & Life SciencesKnowledge & Reasoning

T2D-Bench evaluates LLM outputs for type 2 diabetes against evidence constraints using a multi-layer clinical-lifestyle knowledge graph, covering diagnosis, medication safety, and lifestyle conflicts across 100 structured vignettes.

Released
2026-06-23
Readiness
Paper only
Primary field
Health & Life Sciences

Why it matters

Addresses the gap in evaluating whether LLM recommendations satisfy explicit clinical guidelines and justify lifestyle-related glycemic claims, providing a mechanism to detect unsupported omissions and improve verifier-level compliance.

Motivation

Large language models (LLMs) can produce clinically fluent recommendations for type 2 diabetes while failing to satisfy guideline constraints or explicitly justify lifestyle-related glycemic claims.

Primary resources

Benchmark Radar records only publicly supported details and links back to primary sources for verification.