Clasificados por HumanEval. El benchmark canónico para generación de código. Mide cuántas veces el modelo escribe una función Python que pasa tests unitarios ocultos al primer intento.
Datos actualizados: 11 de agosto de 2026
| # | Modelo | Proveedor | Arena Elo | SWE-bench | Precio in/out ($/M) | Contexto |
|---|---|---|---|---|---|---|
| 1 | Claude Mythos | Anthropic | 1478 | 93.9% | $25 / $125 | 1M |
| 2 | Claude Fable 5 | Anthropic | 1492 | 77% | $10 / $50 | 1M |
| 3 | Claude Mythos 5 | Anthropic | 1493 | 78% | $10 / $50 | 1M |
| 4 | Kimi K3 | Moonshot AI | 1478 | 75.5% | $3 / $15 | 1M |
| 5 | GPT-5.4 Codex | OpenAI | 1408 | 70% | $9 / $36 | 500K |
| 6 | Codex CLI | OpenAI | 1408 | 70% | $9 / $36 | 500K |
| 7 | GPT-5 Codex | OpenAI | 1395 | 68% | $8 / $32 | 400K |
| 8 | Claude Opus 4.8 | Anthropic | 1435 | 67% | $5 / $25 | 1M |
| 9 | GPT-5.5 | OpenAI | 1432 | 66% | $5 / $30 | 600K |
| 10 | OpenAI o4 | OpenAI | 1438 | 72% | $12 / $48 | 256K |
| 11 | Claude Opus 4.7 | Anthropic | 1420 | 64.3% | $5 / $25 | 1M |
| 12 | Claude Code | Anthropic | 1420 | 64.3% | $15 / $75 | 1M |
| 13 | Gemini 3 Deep Think | Google DeepMind | 1429 | 64% | $14 / $56 | 1M |
| 14 | OpenAI o3 | OpenAI | 1418 | 69.1% | $2 / $8 | 200K |
| 15 | GPT-5 | OpenAI | 1412 | 65% | $1.25 / $10 | 400K |
Comparativa completa de modelos de IA
El ranking de arriba ordena todos los modelos por HumanEval. Lideran los modelos frontera de Claude y GPT, y los benchmarks agénticos como SWE-bench separan a los modelos que arreglan bugs reales en repositorios reales de los que solo autocompletan. Para el día a día, elige el mejor modelo que te permita tu presupuesto y enruta las tareas fáciles a su hermano pequeño.
Los modelos open-weight como DeepSeek y Llama pueden autoalojarse por el coste del hardware, y casi todos los proveedores tienen un plan gratis en sus chats. Para programar en serio las APIs de pago suelen compensar. Una hora de trabajo de un ingeniero cuesta lo mismo que millones de tokens.
Los dos, para cosas distintas. HumanEval mide escribir una función correcta desde cero; SWE-bench Verified mide resolver un issue real de GitHub en una base de código grande. Si buscas un copiloto, mira HumanEval; si buscas un agente autónomo, SWE-bench es el número que importa.