Benchmark Radar
AI BENCHMARK PROFILE

WildTrace

General AIKnowledge & ReasoningLong Context & Memory

WildTrace evaluates long-context reasoning over naturally occurring long-form sources, focusing on integrating evidence dispersed across distant passages. It includes 481 tasks over 214 sources with seven source-internal evidence geometries, with multi-stage validation ensuring answer groundedness and clue necessity.

Released
2026-07-10
Readiness
Paper only
Primary field
General AI

Why it matters

Existing long-context benchmarks rely on synthetic evidence that may not reflect real source-internal integration. WildTrace provides a more naturalistic evaluation of analytical reading, addressing a gap in assessing true source reasoning.

Motivation

Answering complex questions over long documents frequently requires integrating evidence that the source itself disperses naturally across distant passages.

Primary resources

Benchmark Radar records only publicly supported details and links back to primary sources for verification.