| Grok 4 Heavy | Claude Opus 4.7 | |
|---|---|---|
| arenaElo | 1391 | 1420 |
| humanEval | 88.4 | 93.1 |
| sweBench | 55 | 64.3 |
| mmlu | 89.3 | 92.3 |
| gpqa | 74.5 | 65.2 |
| aime | 92 | 88 |
| Precio in/out ($/M) | $15 / $60 | $15 / $75 |
Grok 4 Heavy supera a Opus 4.7 en GPQA (74.5 vs 65.2) gracias al debate multi-agente; Opus 4.7 gana en contexto, coding y fiabilidad de agente. Grok Heavy para razonamiento difícil puntual; Opus 4.7 para el resto.
Grok 4 Heavy · Claude Opus 4.7 · Todas las comparativas de IA