| DeepSeek V4 | Llama 4 Maverick | |
|---|---|---|
| arenaElo | 1395 | 1322 |
| humanEval | 91 | 82 |
| sweBench | 62 | 45 |
| mmlu | 91.5 | 85.1 |
| gpqa | 73 | 54.3 |
| aime | 90 | 60 |
| Precio in/out ($/M) | $1.74 / $3.48 | $0.2 / $0.8 |
Los dos pesos pesados open-weights de 2026. DeepSeek V4 lidera en razonamiento y benchmarks STEM; Llama 4 Maverick tiene un ecosistema más permisivo (fine-tunes en Hugging Face, tooling vLLM) y mejor visión sobre imágenes naturales. Para razonamiento de investigación, gana V4; para apps multimodales plug-and-play con tooling Llama establecido, Maverick es la opción segura.
DeepSeek V4 · Llama 4 Maverick · Todas las comparativas de IA