T2D-Bench
T2D-Bench evaluates LLM outputs for type 2 diabetes against evidence constraints using a multi-layer clinical-lifestyle knowledge graph, covering diagnosis, medication safety, and lifestyle conflicts across 100 structured vignettes.
- Released
- 2026-06-23
- Readiness
- Paper only
- Primary field
- Health & Life Sciences
Why it matters
Addresses the gap in evaluating whether LLM recommendations satisfy explicit clinical guidelines and justify lifestyle-related glycemic claims, providing a mechanism to detect unsupported omissions and improve verifier-level compliance.
Motivation
Large language models (LLMs) can produce clinically fluent recommendations for type 2 diabetes while failing to satisfy guideline constraints or explicitly justify lifestyle-related glycemic claims.
Primary resources
Benchmark Radar records only publicly supported details and links back to primary sources for verification.