Optimización de Coste de IA. Cómo Recortar 40-70% Tu Factura de LLM sin Perder Calidad
Las facturas de IA se disparan rápido en producción. Un equipo que arrancó con 300 $/mes puede acabar en 30K $/mes nueve meses después, sin que nadie autorice explícitamente el crecimiento. Los siete patrones de optimización en esta guía recortan el coste LLM 40-70% consistentemente sin pérdida medible de calidad. Los usamos en cada engagement de Alher Tech.
Los Siete Patrones
- 1. Prompt caching: Cachea las partes estáticas de tu system prompt. Las llamadas siguientes pegan en caché a 10-25x descuento en tokens de entrada. Disponible en Anthropic, OpenAI, Gemini en 2026. La mayor palanca de coste.
- 2. Model routing: Modelo barato (Haiku, GPT-5 Mini, Gemini Flash) para tareas simples. Modelo caro (Opus, GPT-5, Gemini Pro) para razonamiento complejo. Lógica de routing en código, no en complejidad cara al usuario.
- 3. Response caching: Si el mismo prompt + mismo contexto produce la misma respuesta, cachéala. Especialmente en agentes de alto volumen respondiendo preguntas recurrentes.
- 4. Outputs estructurados: JSON schemas, function calling, restricciones regex. Elimina retries de output mal formado. Reduce desperdicio de tokens en explicaciones verbosas.
- 5. Compresión de prompt: Resume contextos largos antes de mandar. RAG recupera 50 chunks pero el modelo solo ve los top 5. Usa modelo pequeño para comprimir antes de que razone el grande.
- 6. Batching: Anthropic y OpenAI ofrecen APIs batch a 50% descuento con SLA 24h. Para flujos no-real-time (analítica, reportes diarios, clasificación), 50% gratis.
- 7. Umbral de autohospedaje: Pasando 30-50K $/mes en API, Llama 4 o Qwen 3 autohospedados empiezan a ganar. Por debajo, el coste de ops no compensa.
Palancas Que No Funcionan
- Cambiar de provider más barato por cambiar. El coste de migración suele exceder el ahorro.
- Reducir max_tokens agresivamente. Recorta coste pero causa respuestas truncadas que frustran.
- Quitar contexto. Peores respuestas, más retries del usuario, coste neto sube.
- Pedir al modelo que 'sea breve'. Ahorra una fracción pequeña; pierde info relevante.
- Cambiar streaming a no-streaming. No cambia el coste, solo la UX.
Profundizando en Prompt Caching
El prompt caching es la optimización con mayor ROI en 2026. El patrón que gana:
- Identifica tu prefijo estático, system prompt, ejemplos few-shot, contexto RAG que no cambia por request
- Márcalo como cacheable en la llamada (cache_control, ephemeral en Anthropic, prompt caching en OpenAI)
- La primera llamada cuesta precio completo + recargo pequeño; las siguientes dentro del TTL pagan 10-25% del precio normal de entrada
- TTL típico: 5 minutos (ephemeral Anthropic) o 1 hora (1h cache Anthropic); empareja con tu tráfico
- El orden importa. Pon el contenido verdaderamente estático primero, dinámico al final
- Ahorro real. Agentes de soporte que hemos entregado ven 40-65% reducción de coste de entrada solo con caching
Si no usas prompt caching en 2026 y tu system prompt pasa de 500 tokens, estás pagando de más. Punto.
Estrategia de Model Routing
- Tier 1, barato (Haiku, GPT-5 Mini, Gemini Flash): Clasificación, intent, FAQ simple desde RAG, extracción estructurada. ~5% del coste frontier. Úsalo como default; escala cuando haga falta.
- Tier 2, medio (Sonnet 4.6, GPT-5, Gemini Pro): Razonamiento de agente en producción, planificación multi-paso, tool use. El caballo de batalla. ~30% del coste frontier.
- Tier 3, frontier (Opus 4.7, GPT-5.5): Razonamiento más duro, generación de código, síntesis multi-documento. Selectivo. Los agentes en producción solo lo necesitan en 5-15% de requests.
- Reglas de routing: Conteo de tokens, score de complejidad de un clasificador pequeño, retry on low confidence. Empareja modelo con request, no al revés.
Ejemplos de Ahorro Real
| Workload | Antes | Después de optimizar | Ahorro |
|---|
| Agente soporte (50K tickets/mes) | 22K $/mes | 8K $/mes | 63% |
| Búsqueda RAG (1M queries/mes) | 45K $/mes | 18K $/mes | 60% |
| Pipeline de extracción de docs | 15K $/mes | 4K $/mes | 73% |
| Agente cualificación ventas | 8K $/mes | 3K $/mes | 62% |
| Agente revisión código (interno) | 12K $/mes | 5K $/mes | 58% |
Números reales de engagements de Alher Tech 2024-2026. Cada uno usó combinación de patrones; ninguno solo gana la batalla.
Cuándo Autohospedear
- Gasto API pasando 30-50K $/mes, donde la factura GPU empieza a competir
- Workloads predecibles de alto volumen (tráfico estable encaja con GPUs dedicadas)
- Compliance o residencia de datos que descarta APIs de vendor
- Rendimiento open-source aceptable para tu listón de accuracy (Llama 4, Qwen 3 compiten en muchas tareas en 2026)
- Tienes o puedes contratar MLOps (vLLM, SGLang y TGI necesitan alguien cuidándolos)
- Puedes amortizar gasto GPU entre varios workloads (no dediques 4 H100s a una app diminuta)
Por debajo de 30K $/mes, autohospedar no ahorra una vez contado el tiempo de ops, coste de GPU idle y la complejidad. Quédate en APIs gestionadas.
Optimiza Como Ingeniería de Producción
La optimización de coste IA es ingeniería, no procurement, caching, routing, batching, schemas. Son los mismos patrones que funcionan en cualquier API de alto volumen. Trata tu factura IA como tu factura de BD, instrumenta, optimiza, monitoriza.
Los equipos que no, acaban pagando 3-5x lo que deberían. Los que sí, liberan presupuesto para entregar más features.
Preguntas frecuentes
¿Cuánto puedo ahorrar realísticamente?
30-50% solo con prompt caching. 40-70% con el stack completo de patrones. Más allá, el autohospedaje es la siguiente palanca, pero solo a escala.
¿Las optimizaciones bajan calidad?
No si se hacen bien. Caching, batching y outputs estructurados no cambian calidad. Model routing mantiene calidad si el clasificador acierta. Los patrones que usamos son neutros o positivos en calidad.
¿Y Claude Code o coding agents?
Mismos patrones. Workloads de código se benefician especialmente de prompt caching (el system prompt es enorme) y routing (Haiku para edits simples, Sonnet/Opus para diseño).
¿Cambio de OpenAI a Anthropic por coste?
No cambies solo por coste; son comparables en 2026. Cambia por fit de calidad, alineación de ecosistema o features específicas. Optimizar dentro de tu provider rinde más que cambiar.
¿Vale el prompt caching en apps de bajo volumen?
Por debajo de 1.000 llamadas/día, el esfuerzo de ingeniería no compensa. Encima de 10K/día, paga en días. En medio, depende de longitud media de prompt y tasa de hit del TTL.
Guías relacionadas