MMArch
MMArch is a benchmark for multimodal reasoning in architecture and civil engineering, spanning ten subdomains and built from figures in peer-reviewed papers. It contains 1,212 short-answer items requiring perception, principle identification, and application.
- Released
- 2026-08-10
- Readiness
- Inspectable
- Primary field
- General AI
Why it matters
Existing benchmarks test drawing recognition or information extraction, but MMArch evaluates whether models can combine distributed visual evidence with engineering principles, filling a gap in multimodal reasoning evaluation.
Motivation
Multimodal large language models (MLLMs) perform strongly on engineering imagery, yet existing benchmarks mostly test drawing recognition, information extraction, or compliance checking, leaving open whether models can combine distributed visual evidence with engineering principles to reach a conclusion.
Primary resources
Benchmark Radar records only publicly supported details and links back to primary sources for verification.