AI benchmark results and model performance
Individual benchmark scores plotted by date.
| Organisation | Model | Reported | Top Score | Info | Self Reported | Source |
|---|---|---|---|---|---|---|
| Qwen 2.5 Coder 3B | - | 29.60% | inferred family alias from qwen2.5-omni-7b (score=0.3000; benches=45) | Yes | Source | |
| Qwen 2.5 Coder 7B | - | 29.60% | inferred high-confidence family alias from qwen2.5-omni-7b (score=0.4700; benches=45) | Yes | Source | |
| Qwen 2.5 Math 7B | - | 29.60% | inferred high-confidence family alias from qwen2.5-omni-7b (score=0.4767; benches=45) | Yes | Source | |
| Qwen 2.5 Math 7B PRM800K | - | 29.60% | inferred family alias from qwen2.5-omni-7b (score=0.3696; benches=45) | Yes | Source | |
| Qwen 2.5 Math PRM 7B | - | 29.60% | inferred family alias from qwen2.5-omni-7b (score=0.4092; benches=45) | Yes | Source | |
| Qwen 2.5 Omni 3B | - | 29.60% | inferred high-confidence family alias from qwen2.5-omni-7b (score=0.4933; benches=45) | Yes | Source | |
| Qwen 2.5 Omni 7B | - | 29.60% | - | Yes | Source | |
| Qwen 7B | - | 35.90% | inferred family alias from qwen-2.5-7b-instruct (score=0.3083; benches=14) | Yes | Source | |
| Claude 3.5 Haiku | 04 Nov 2024 | 39.51% | - | No | Source | |
| GPT 4.1 Nano | 14 Apr 2025 | 40.40% | - | No | Source | |
| Phi 1 | - | 47.60% | inferred family alias from phi-4 (score=0.3100; benches=13) | Yes | Source | |
| Phi 2 | - | 47.60% | inferred family alias from phi-4 (score=0.3100; benches=13) | Yes | Source | |
| Phi 4 | 12 Dec 2024 | 47.60% | - | Yes | Source | |
| GPT 4.1 Mini | 14 Apr 2025 | 51.57% | - | No | Source | |
| Claude 3.5 Sonnet (2024-10-22) | 22 Oct 2024 | 51.80% | - | No | Source | |
| o1 preview | 12 Sept 2024 | 52.30% | - | Yes | Source | |
| Qwen 72B | - | 52.30% | inferred family alias from qwen-2.5-72b-instruct (score=0.3060; benches=14) | Yes | Source | |
| GPT 4.1 | 14 Apr 2025 | 55.90% | - | No | Source | |
| GPT 4.5 Preview | 27 Feb 2025 | 58.65% | - | No | Source | |
| Grok 3 Beta | 19 Feb 2025 | 62.36% | High Reasoning Effort | No | Source | |
| DeepSeek R1 (2025-01-20) | 20 Jan 2025 | 65.15% | - | No | Source | |
| Qwen 3.6 27B | 22 Apr 2026 | 65.56% | 2026-01-08 release | No | Source | |
| Grok 4.3 | 30 Apr 2026 | 66.74% | 2026-01-08 release | No | Source | |
| DeepSeek V4 Flash | 24 Apr 2026 | 67.25% | 2026-01-08 release | No | Source | |
| Claude 3.7 Sonnet | 24 Feb 2025 | 67.43% | 64k Thinking | No | Source |