Model Ratings.
The tracked cohort, scored and tiered.
42 models ranked against the coding muscle recipe · every axis sourced.
Scores are relative to the tracked cohort — swap the recipe or the field and the ranks move. The weights are an editorial call; the axis values underneath are sourced, cell by cell.
Snapshot · verified 1w ago · 2026-08-17
Recipe
Ship-real-PRs ability — agentic + competitive coding weighted hardest.
The board · ranked · Coding muscle
Each cell brightens toward the cohort leader and is ringed when it holds it; dimmed rows are sparse (low coverage) — read their composite with care.
- 1Claude Opus 5Anthropic75% · highS99
- SWE-bench96%
- LiveCode—
- AA Index63
- GPQA93.7%
Strongest: swebench · Weakest: gpqa
- 2Claude Fable 5Anthropic50% · mediumS96
- SWE-bench95%
- LiveCode—
- AA Index62
- GPQA—
Strongest: swebench · Weakest: swebench
- 3Grok 4.6xAI50% · mediumS96
- SWE-bench—
- LiveCode—
- AA Index61
- GPQA94.9%
Strongest: aa_index · Weakest: aa_index
- 4GPT-5.6 SolOpenAI50% · mediumS95
- SWE-bench—
- LiveCode—
- AA Index61
- GPQA94.1%
Strongest: aa_index · Weakest: aa_index
- 5Kimi K3Moonshot AI50% · mediumS92
- SWE-bench—
- LiveCode—
- AA Index60
- GPQA93.5%
Strongest: aa_index · Weakest: aa_index
- 6Qwen3.8 MaxAlibaba (Qwen)50% · mediumS87
- SWE-bench—
- LiveCode—
- AA Index58
- GPQA92.6%
Strongest: aa_index · Weakest: aa_index
- 7Gemini 3.7 FlashGoogle DeepMind50% · mediumA85
- SWE-bench—
- LiveCode—
- AA Index56
- GPQA94.5%
Strongest: gpqa · Weakest: aa_index
- 8Claude Opus 4.8Anthropic75% · highA77
- SWE-bench88.6%
- LiveCode—
- AA Index57
- GPQA93.6%
Strongest: swebench · Weakest: swebench
- 9GPT-5.6 TerraOpenAI25% · lowA77
- SWE-bench—
- LiveCode—
- AA Index57
- GPQA—
Strongest: aa_index · Weakest: aa_index
- 10GPT-5.5OpenAI75% · highA76
- SWE-bench88.7%
- LiveCode—
- AA Index56
- GPQA93.5%
Strongest: swebench · Weakest: swebench
- 11Qwen3.8-27BAlibaba (Qwen)75% · highA75
- SWE-bench—
- LiveCode90.3%
- AA Index52
- GPQA89.2%
Strongest: livecodebench · Weakest: aa_index
- 12Claude Opus 4.7Anthropic75% · highA73
- SWE-bench87.6%
- LiveCode—
- AA Index55
- GPQA94.2%
Strongest: swebench · Weakest: swebench
- 13DeepSeek V4 Flash 0731DeepSeek50% · mediumA73
- SWE-bench—
- LiveCode—
- AA Index52
- GPQA91%
Strongest: gpqa · Weakest: aa_index
- 14Grok 4.5xAI25% · lowA73
- SWE-bench—
- LiveCode—
- AA Index56
- GPQA—
Strongest: aa_index · Weakest: aa_index
- 15gpt-oss-120bOpenAI25% · lowA72
- SWE-bench—
- LiveCode—
- AA Index—
- GPQA80.1%
Strongest: gpqa · Weakest: gpqa
- 16DeepSeek V4 ProDeepSeek100% · highB62
Strongest: livecodebench · Weakest: aa_index
- 17DeepSeek V4 Pro 0813DeepSeek25% · lowB62
- SWE-bench—
- LiveCode—
- AA Index53
- GPQA—
Strongest: aa_index · Weakest: aa_index
- 18GLM-5.2Z.AI (Zhipu)25% · lowB62
- SWE-bench—
- LiveCode—
- AA Index53
- GPQA—
Strongest: aa_index · Weakest: aa_index
- 19MiniMax-M3MiniMax50% · mediumB60
- SWE-bench—
- LiveCode—
- AA Index45
- GPQA92.9%
Strongest: gpqa · Weakest: aa_index
- 20Gemini 3.5 FlashGoogle DeepMind25% · lowB58
- SWE-bench—
- LiveCode—
- AA Index52
- GPQA—
Strongest: aa_index · Weakest: aa_index
- 21Gemini 3.6 FlashGoogle DeepMind25% · lowB58
- SWE-bench—
- LiveCode—
- AA Index52
- GPQA—
Strongest: aa_index · Weakest: aa_index
- 22GPT-5.6 LunaOpenAI25% · lowB58
- SWE-bench—
- LiveCode—
- AA Index52
- GPQA—
Strongest: aa_index · Weakest: aa_index
- 23gpt-oss-20bOpenAI25% · lowB56
- SWE-bench—
- LiveCode—
- AA Index—
- GPQA71.5%
Strongest: gpqa · Weakest: gpqa
- 24Kimi K2.6Moonshot AI100% · highC54
Strongest: livecodebench · Weakest: aa_index
- 25DeepSeek V4 Flash (Preview)DeepSeek100% · highC52
Strongest: livecodebench · Weakest: aa_index
- 26Gemini 3.1 ProGoogle DeepMind75% · highC51
- SWE-bench80.6%
- LiveCode—
- AA Index48
- GPQA94.1%
Strongest: gpqa · Weakest: swebench
- 27GLM-5.1Z.AI (Zhipu)50% · mediumC46
- SWE-bench—
- LiveCode—
- AA Index41
- GPQA86.2%
Strongest: gpqa · Weakest: aa_index
- 28Claude Sonnet 4.6Anthropic50% · mediumD36
- SWE-bench80.2%
- LiveCode—
- AA Index48
- GPQA—
Strongest: swebench · Weakest: swebench
- 29Qwen3.7 MaxAlibaba (Qwen)75% · highD35
- SWE-bench—
- LiveCode78.2%
- AA Index47
- GPQA92.4%
Strongest: gpqa · Weakest: livecodebench
- 30GPT-5.3 CodexOpenAI25% · lowD35
- SWE-bench—
- LiveCode—
- AA Index46
- GPQA—
Strongest: aa_index · Weakest: aa_index
- 31Phi-4Microsoft25% · lowD27
- SWE-bench—
- LiveCode—
- AA Index—
- GPQA56.1%
Strongest: gpqa · Weakest: gpqa
- 32Muse SparkMeta25% · lowD27
- SWE-bench—
- LiveCode—
- AA Index44
- GPQA—
Strongest: aa_index · Weakest: aa_index
- 33Claude Sonnet 5Anthropic50% · mediumD26
- SWE-bench72.7%
- LiveCode—
- AA Index55
- GPQA—
Strongest: aa_index · Weakest: swebench
- 34Kimi K2.7 CodeMoonshot AI25% · lowD23
- SWE-bench—
- LiveCode—
- AA Index43
- GPQA—
Strongest: aa_index · Weakest: aa_index
- 35MiMo-V2.5-ProXiaomi25% · lowD23
- SWE-bench—
- LiveCode—
- AA Index43
- GPQA—
Strongest: aa_index · Weakest: aa_index
- 36GPT-5.4 miniOpenAI25% · lowD15
- SWE-bench—
- LiveCode—
- AA Index41
- GPQA—
Strongest: aa_index · Weakest: aa_index
- 37Mistral Small 3.2 24BMistral AI25% · lowD9
- SWE-bench—
- LiveCode—
- AA Index—
- GPQA46.1%
Strongest: gpqa · Weakest: gpqa
- 38Qwen3.7 PlusAlibaba (Qwen)25% · lowD8
- SWE-bench—
- LiveCode—
- AA Index39
- GPQA—
Strongest: aa_index · Weakest: aa_index
- 39Grok 4.3xAI25% · lowD4
- SWE-bench—
- LiveCode—
- AA Index38
- GPQA—
Strongest: aa_index · Weakest: aa_index
- 40Gemini 3.5 Flash-LiteGoogle DeepMind25% · lowD0
- SWE-bench—
- LiveCode—
- AA Index37
- GPQA—
Strongest: aa_index · Weakest: aa_index
- 41Gemma 3 27BGoogle25% · lowD0
- SWE-bench—
- LiveCode—
- AA Index—
- GPQA41.4%
Strongest: gpqa · Weakest: gpqa
- 42Qwen3-32BAlibaba (Qwen)0% · lowD0
- SWE-bench—
- LiveCode—
- AA Index—
- GPQA—
Strongest: — · Weakest: —