WildTrace
WildTrace evaluates long-context reasoning over naturally occurring long-form sources, focusing on integrating evidence dispersed across distant passages. It includes 481 tasks over 214 sources with seven source-internal evidence geometries, with multi-stage validation ensuring answer groundedness and clue necessity.
- Released
- 2026-07-10
- Readiness
- Paper only
- Primary field
- General AI
Why it matters
Existing long-context benchmarks rely on synthetic evidence that may not reflect real source-internal integration. WildTrace provides a more naturalistic evaluation of analytical reading, addressing a gap in assessing true source reasoning.
Motivation
Answering complex questions over long documents frequently requires integrating evidence that the source itself disperses naturally across distant passages.
Primary resources
Benchmark Radar records only publicly supported details and links back to primary sources for verification.