Benchmark Radar
AI BENCHMARK PROFILE

FinEvolveBench

Finance & EconomicsKnowledge & Reasoning

FinEvolveBench evaluates self-evolving agents on low-repetition financial prediction tasks with implicit rewards, measuring utility updates over delayed returns.

Released
2026-06-05
Readiness
Paper only
Primary field
Finance & Economics

Why it matters

Addresses evaluation of experience-based self-evolution under noisy feedback, relevant for agent adaptation, but lacks public comparison path.

Motivation

Experience-based self-evolution enables language-model agents to improve their behavior by accumulating and updating experience at test time, yet existing evaluations often assume recurring task patterns and explicit success signals.

Primary resources

Benchmark Radar records only publicly supported details and links back to primary sources for verification.