AI BENCHMARK PROFILE
HealMed
Evaluates multilingual medical LLMs on 1,000 examples per language across nine languages, covering MCQA, NLI, and open-ended QA tasks.
- Released
- 2026-08-20
- Readiness
- Paper only
- Primary field
- Health & Life Sciences
Why it matters
Fills a gap in multilingual medical evaluation by measuring performance across language resource levels and assessing whether translation quality affects cross-language results.
Motivation
We present HealMed, an expert-reviewed benchmark for multilingual evaluation of large language models in medicine.
Primary resources
Benchmark Radar records only publicly supported details and links back to primary sources for verification.