| GPT-4o | Claude Sonnet 4.6 | |
|---|---|---|
| arenaElo | 1345 | 1358 |
| humanEval | 90.2 | 89 |
| sweBench | 33 | 60 |
| mmlu | 88.7 | 88.7 |
| gpqa | 53.6 | 59.4 |
| aime | 42 | 80 |
| Price in/out ($/M) | $2.5 / $10 | $3 / $15 |
Claude Sonnet 4.6 beats GPT-4o on every benchmark and costs less per token. GPT-4o still wins when you need native audio I/O. Default to Sonnet 4.6 for new builds; keep GPT-4o if you already depend on its Realtime API.