| Grok 4 Heavy | Claude Opus 4.7 | |
|---|---|---|
| arenaElo | 1391 | 1420 |
| humanEval | 88.4 | 93.1 |
| sweBench | 55 | 64.3 |
| mmlu | 89.3 | 92.3 |
| gpqa | 74.5 | 65.2 |
| aime | 92 | 88 |
| Price in/out ($/M) | $15 / $60 | $15 / $75 |
Grok 4 Heavy beats Opus 4.7 on GPQA (74.5 vs 65.2) thanks to multi-agent debate; Opus 4.7 wins on context, coding and agent reliability. Pick Grok Heavy for hard one-shot reasoning; Opus 4.7 for everything else.