AI BENCHMARK PROFILE
SciRisk-Bench
SciRisk-Bench evaluates AI4Science safety across 7 disciplines and 10 risk dimensions, assessing whether models recognize and avoid risks in scientific contexts.
- Released
- 2026-06-17
- Readiness
- Paper only
- Primary field
- General AI
Why it matters
Existing AI4Science safety benchmarks lack explicit risk dimensions; SciRisk-Bench provides fine-grained diagnosis of safety issues across disciplines.
Motivation
Large language models (LLMs) are increasingly embedded in AI for Science (AI4Science) workflows, from scientific question answering and literature analysis to laboratory planning and autonomous discovery.
Primary resources
Benchmark Radar records only publicly supported details and links back to primary sources for verification.