Model Leaderboard
Compare AI models by capability and cost-effectiveness
Popular Comparisons
Logical Reasoning
71/251 modelsHLE: Complex reasoning and problem-solving
Use Cases: Complex decision-making, multi-step analysis, logical reasoning
Knowledge Q&A
62/251 modelsMMLU Pro: Broad knowledge assessment
Use Cases: Expert Q&A, fact-checking, educational tutoring
Scientific Research
74/251 modelsGPQA: Graduate-level science questions
Use Cases: Academic research, scientific writing, experiment design
AI Agent
41/251 modelsTau2: Autonomous task completion
Use Cases: Automated workflows, multi-tool invocation, complex task decomposition
SciCode
55/251 modelsSciCode: Scientific coding challenges
Use Cases: Scientific computing, research code, data analysis scripts
Terminal
66/251 modelsTerminal-Bench 2.1: agentic coding & terminal operations
Use Cases: Agentic coding, shell scripting, DevOps automation
Instruction
53/251 modelsIFEval: Instruction following accuracy
Use Cases: Precise task execution, format compliance, constraint adherence