Model Leaderboard
Compare AI models by capability and cost-effectiveness
Popular Comparisons
Logical Reasoning
71/254 modelsHLE: Complex reasoning and problem-solving
Use Cases: Complex decision-making, multi-step analysis, logical reasoning
Knowledge Q&A
62/254 modelsAA-Omniscience: Knowledge Reliability & Hallucination
Use Cases: Expert Q&A, fact-checking, educational tutoring
Scientific Research
74/254 modelsGPQA: Graduate-level science questions
Use Cases: Academic research, scientific writing, experiment design
AI Agent
41/254 modelsτ³-Banking: Knowledge Retrieval & Multi-step Tool Use
Use Cases: Automated workflows, multi-tool invocation, complex task decomposition
SciCode
55/254 modelsSciCode: Scientific coding challenges
Use Cases: Scientific computing, research code, data analysis scripts
Programming & Development
66/254 modelsTerminal-Bench 2.1: Agent Coding & Terminal Operations
Use Cases: Agentic Coding, Shell Scripting, DevOps Automation
Instruction
53/254 modelsIFEval: Instruction following accuracy
Use Cases: Precise task execution, format compliance, constraint adherence