AI BENCHMARK PROFILE
FinEvolveBench
FinEvolveBench evaluates self-evolving agents on low-repetition financial prediction tasks with implicit rewards, measuring utility updates over delayed returns.
- Released
- 2026-06-05
- Readiness
- Paper only
- Primary field
- Finance & Economics
Why it matters
Addresses evaluation of experience-based self-evolution under noisy feedback, relevant for agent adaptation, but lacks public comparison path.
Motivation
Experience-based self-evolution enables language-model agents to improve their behavior by accumulating and updating experience at test time, yet existing evaluations often assume recurring task patterns and explicit success signals.
Primary resources
Benchmark Radar records only publicly supported details and links back to primary sources for verification.