Rankings y comparaciones cara a cara de los principales modelos de IA (LLMs), actualizados cada semana. Elaborado por ingenieros que despliegan agentes de IA en producción.
Datos actualizados: 11 de agosto de 2026
| # | Modelo | Proveedor | Arena Elo | SWE-bench | Precio in/out ($/M) | Contexto |
|---|---|---|---|---|---|---|
| 1 | Claude Mythos 5 | Anthropic | 1493 | 78% | $10 / $50 | 1M |
| 2 | Claude Fable 5 | Anthropic | 1492 | 77% | $10 / $50 | 1M |
| 3 | Claude Mythos | Anthropic | 1478 | 93.9% | $25 / $125 | 1M |
| 4 | Kimi K3 | Moonshot AI | 1478 | 75.5% | $3 / $15 | 1M |
| 5 | Gemini 3 Ultra | Google DeepMind | 1441 | 66% | $18 / $72 | 3M |
| 6 | OpenAI o4 | OpenAI | 1438 | 72% | $12 / $48 | 256K |
| 7 | Claude Opus 4.8 | Anthropic | 1435 | 67% | $5 / $25 | 1M |
| 8 | GPT-5.5 | OpenAI | 1432 | 66% | $5 / $30 | 600K |
| 9 | Gemini 3 Deep Think | Google DeepMind | 1429 | 64% | $14 / $56 | 1M |
| 10 | Claude Opus 4.7 | Anthropic | 1420 | 64.3% | $5 / $25 | 1M |
| 11 | Claude Code | Anthropic | 1420 | 64.3% | $15 / $75 | 1M |
| 12 | OpenAI o3 | OpenAI | 1418 | 69.1% | $2 / $8 | 200K |
| 13 | GPT-5 | OpenAI | 1412 | 65% | $1.25 / $10 | 400K |
| 14 | GPT-5.4 Codex | OpenAI | 1408 | 70% | $9 / $36 | 500K |
| 15 | Codex CLI | OpenAI | 1408 | 70% | $9 / $36 | 500K |
Estima tu factura mensual de API con la calculadora de costes LLM
Los benchmarks públicos se miden casi siempre en inglés, y eso esconde diferencias reales. Los modelos frontera (Claude, GPT, Gemini) mantienen en español una calidad casi idéntica a la del inglés, mientras que los modelos pequeños y los open-weight suelen perder más precisión en matices, jerga regional y redacción formal.
En Alher Tech evaluamos los modelos con tareas reales en español (atención al cliente, documentos legales, contenido de marketing) antes de recomendarlos a un cliente. Si tu producto habla español, prueba siempre con tus propios prompts en español. El ranking en inglés no siempre se mantiene.
No hay un ganador único, depende de la carga de trabajo. Por Arena Elo de Chatbot Arena la parte alta la lideran modelos frontera como Claude Fable 5, GPT-5.5 y Gemini 3 Ultra, pero para programar, razonar o ahorrar costes el ranking cambia. Nuestros leaderboards ordenan cada modelo por la métrica que importa en cada caso de uso.
Para generar código ordenamos los modelos por HumanEval y SWE-bench Verified, los benchmarks que miden arreglos reales de bugs en repositorios de producción. Consulta el leaderboard "Mejor IA para programación" para ver el top actual. Los modelos frontera de Claude y GPT suelen liderar, con DeepSeek como la mejor opción open-weight.
Cada modelo se puntúa con los mismos benchmarks públicos (Arena Elo de Chatbot Arena, MMLU, GPQA Diamond, HumanEval, SWE-bench, AIME) más su precio oficial de lista y su ventana de contexto. Los datos salen de los publicadores de cada benchmark y de la documentación de cada proveedor, y cada ficha muestra su propia fecha de actualización.
El leaderboard "LLMs más baratos" ordena los modelos por precio combinado por millón de tokens. Los modelos pequeños como Claude Haiku, GPT-5 mini o Gemini Flash cuestan una fracción de los buques insignia y suelen bastar para clasificación, extracción y chatbots de soporte.
Los datos de benchmarks y precios se refrescan en cada despliegue desde fuentes públicas, y cada ficha de modelo lleva su propia fecha de actualización para que veas exactamente cómo de recientes son sus números.