PatronusAI/speedrunbench
Viewer • Updated • 63 • 1
LLM Evaluation
Masked Diffusion Language Models are Strong and Steerable Text-Based World Models for Agentic RL
Benchmarking Reward Hack Detection in Code Environments via Contrastive Analysis