Clasificados por GPQA Diamond, preguntas de física, química y biología de nivel doctorado que exigen razonamiento en varios pasos. Es el benchmark clave cuando tu producto depende de ser correcto.
Datos actualizados: 11 de agosto de 2026
| # | Modelo | Proveedor | Arena Elo | SWE-bench | Precio in/out ($/M) | Contexto |
|---|---|---|---|---|---|---|
| 1 | Claude Mythos | Anthropic | 1478 | 93.9% | $25 / $125 | 1M |
| 2 | Claude Fable 5 | Anthropic | 1492 | 77% | $10 / $50 | 1M |
| 3 | Claude Mythos 5 | Anthropic | 1493 | 78% | $10 / $50 | 1M |
| 4 | Kimi K3 | Moonshot AI | 1478 | 75.5% | $3 / $15 | 1M |
| 5 | OpenAI o4 | OpenAI | 1438 | 72% | $12 / $48 | 256K |
| 6 | Gemini 3 Deep Think | Google DeepMind | 1429 | 64% | $14 / $56 | 1M |
| 7 | OpenAI o3 | OpenAI | 1418 | 69.1% | $2 / $8 | 200K |
| 8 | OpenAI o1 | OpenAI | 1380 | 48.9% | $15 / $60 | 200K |
| 9 | Grok 4 Heavy | xAI | 1391 | 55% | $15 / $60 | 256K |
| 10 | OpenAI o4-mini | OpenAI | 1362 | 60% | $1.1 / $4.4 | 200K |
| 11 | DeepSeek V4 | DeepSeek | 1395 | 62% | $1.74 / $3.48 | 1M |
| 12 | Gemini 3 Ultra | Google DeepMind | 1441 | 66% | $18 / $72 | 3M |
| 13 | DeepSeek R1 | DeepSeek | 1389 | 49.2% | $0.7 / $2.5 | 128K |
| 14 | GPT-5.5 | OpenAI | 1432 | 66% | $5 / $30 | 600K |
| 15 | Claude Opus 4.8 | Anthropic | 1435 | 67% | $5 / $25 | 1M |
Comparativa completa de modelos de IA
GPQA Diamond es un conjunto de preguntas de ciencia de nivel doctorado escritas para que incluso expertos con acceso a internet las encuentren difíciles. Es la señal más limpia que tenemos de razonamiento profundo y no de memorización.
Para problemas de varios pasos donde un paso intermedio mal hecho arruina la respuesta, matemáticas, análisis complejos, revisión legal o científica, planificación de agentes. Para resúmenes, borradores y chat suele bastar un modelo general más barato.