Benchmark Radar
AI BENCHMARK PROFILE

SciRisk-Bench

General AISafety & Trustworthiness

SciRisk-Bench evaluates AI4Science safety across 7 disciplines and 10 risk dimensions, assessing whether models recognize and avoid risks in scientific contexts.

Released
2026-06-17
Readiness
Paper only
Primary field
General AI

Why it matters

Existing AI4Science safety benchmarks lack explicit risk dimensions; SciRisk-Bench provides fine-grained diagnosis of safety issues across disciplines.

Motivation

Large language models (LLMs) are increasingly embedded in AI for Science (AI4Science) workflows, from scientific question answering and literature analysis to laboratory planning and autonomous discovery.

Primary resources

Benchmark Radar records only publicly supported details and links back to primary sources for verification.