| Gemini 3 Deep Think | Claude Opus 4.7 | |
|---|---|---|
| arenaElo | 1429 | 1420 |
| humanEval | 92.4 | 93.1 |
| sweBench | 64 | 64.3 |
| mmlu | 92.1 | 92.3 |
| gpqa | 84.3 | 65.2 |
| aime | 95 | 88 |
| Precio in/out ($/M) | $14 / $56 | $15 / $75 |
Deep Think supera a Opus 4.7 en GPQA (84 vs 65) e iguala su contexto de 1M. Opus 4.7 sigue ganando en coding, tool-calling y fiabilidad de agente en la práctica. Elige Deep Think para razonamiento científico sobre fuentes largas, Opus para todo lo agéntico.
Gemini 3 Deep Think · Claude Opus 4.7 · Todas las comparativas de IA