AI BENCHMARK PROFILE
WritingBench
A comprehensive benchmark for evaluating large language models' generative writing capabilities across 6 core writing domains (Academic & Engineering, Finance & Business, Politics & Law, Literature & Art, Education, Advertising & Marketing) and 100 subdomains. Contains 1,239 queries with a query-dependent evaluation framework that dynamically generates 5 instance-specific assessment criteria for each writing task, using a fine-tuned critic model to score responses on style, format, and length dimensions.
- Released
- Unknown
- Readiness
- Paper only
- Primary field
- Finance & Economics
Primary resources
Benchmark Radar records only publicly supported details and links back to primary sources for verification.