Evaluation topic
AI R&D
Research engineering, model development and capabilities that may accelerate AI progress.
10 records are tagged here. Inclusion does not establish construct equivalence, completeness, or comparability.
- Frontier Cs ResearchQiuyang Mang, Wenhao Chai, Zhifei Li et al.
- FrontierMathEpoch AI
- METR Time HorizonsMETR
- Mle BenchOpenAI
- Mle Bench FullOpenAI
- Mle Bench LiteOpenAI
- MLRC-Bench: Can Language Agents Solve Machine Learning Research Challenges?Yunxiang Zhang, Muhammad Khalifa, Shitanshu Bhushan et al.
- PaperBench: Evaluating AI's Ability to Replicate AI Research (Work In Progress)OpenAI
- RE-BenchMETR
- Sabotage EvaluationsAnthropic