Benchmark Radar
AI BENCHMARK PROFILE

HealMed

Health & Life SciencesKnowledge & ReasoningMedical Experts and Physicians Across Nine Countries

Evaluates multilingual medical LLMs on 1,000 examples per language across nine languages, covering MCQA, NLI, and open-ended QA tasks.

Released
2026-08-20
Readiness
Paper only
Primary field
Health & Life Sciences

Why it matters

Fills a gap in multilingual medical evaluation by measuring performance across language resource levels and assessing whether translation quality affects cross-language results.

Motivation

We present HealMed, an expert-reviewed benchmark for multilingual evaluation of large language models in medicine.

Primary resources

Benchmark Radar records only publicly supported details and links back to primary sources for verification.