Benchmark Radar
AI BENCHMARK PROFILE

FlameVQA

General AISafety & Trustworthiness

FlameVQA is a multiple-choice visual question answering benchmark for UAV-based wildfire monitoring, built on FLAME 3 with paired RGB and radiometric thermal images. It includes 34 questions per image across six capability groups, covering detection, localization, coverage estimation, cross-modal reasoning, and flight planning. Labels are generated via MLLM assistance, deterministic thermal rules, and human auditing. The dataset and code are open-source.

Released
2026-06-25
Readiness
Paper only
Primary field
General AI

Why it matters

FlameVQA addresses the lack of benchmarks for evaluating vision-language models in safety-critical wildfire scenarios where RGB-only interpretation is insufficient. It provides a standardized evaluation for capabilities like smoke detection and coverage estimation, which are critical for practical deployment of MLLMs in disaster monitoring.

Motivation

Wildfire monitoring from UAVs requires reliable reasoning over complex aerial scenes, where smoke, scale variation, and occlusions often limit RGB-only interpretation.

Primary resources

Benchmark Radar records only publicly supported details and links back to primary sources for verification.