| Claude Mythos | Gemini 3 Ultra | |
|---|---|---|
| arenaElo | 1478 | 1441 |
| humanEval | 98.7 | 91 |
| sweBench | 93.9 | 66 |
| mmlu | 94.2 | 93.4 |
| gpqa | 94.6 | 72.6 |
| aime | 97.6 | 93 |
| Precio in/out ($/M) | $25 / $125 | $18 / $72 |
Gemini 3 Ultra tiene un contexto 3× mayor (3M vs 1M) y vídeo nativo, algo que Mythos no iguala. Mythos devuelve el golpe en capacidad bruta: ~23 puntos por delante en GPQA y ~8 en HumanEval, además de benchmarks de ciberseguridad saturados. Para análisis de películas enteras o cargas de 2.000 páginas en Vertex AI, Ultra es la elección. Para razonamiento y código frontera donde los datos quepan en 1M de tokens, Mythos, si consigues acceso.
Claude Mythos · Gemini 3 Ultra · Todas las comparativas de IA