Benchmark Radar
AI BENCHMARK PROFILE

TSM-Bench

General AIKnowledge & Reasoning

TSM-Bench is a multilingual, multi-generator, multi-task benchmark for evaluating machine-generated text detectors on real-world Wikipedia editing tasks.

Released
2026-05-29
Readiness
Paper only
Primary field
General AI

Why it matters

Reveals performance drops in detectors on task-specific MGT, providing a foundation for developing robust detectors for UGC platforms.

Motivation

Automatically detecting machine-generated text (MGT) is critical to maintaining the knowledge integrity of user-generated content (UGC) platforms such as Wikipedia.

Primary resources

Benchmark Radar records only publicly supported details and links back to primary sources for verification.