Optimización de Coste de IA: Cómo Recortar 40-70% Tu Factura de LLM sin Perder Calidad
Las facturas de IA se disparan rápido en producción. Un equipo que arrancó con 300 $/mes puede acabar en 30K $/mes nueve meses después, sin que nadie autorice explícitamente el crecimiento. Los siete patrones de optimización en esta guía recortan el coste LLM 40-70% consistentemente sin pérdida medible de calidad. Los usamos en cada engagement de Alher Tech.
Los Siete Patrones
- 1. Prompt caching: Cachea las partes estáticas de tu system prompt. Las llamadas siguientes pegan en caché a 10-25x descuento en tokens de entrada. Disponible en Anthropic, OpenAI, Gemini en 2026. La mayor palanca de coste.
- 2. Model routing: Modelo barato (Haiku, GPT-5 Mini, Gemini Flash) para tareas simples. Modelo caro (Opus, GPT-5, Gemini Pro) para razonamiento complejo. Lógica de routing en código, no en complejidad cara al usuario.
- 3. Response caching: Si el mismo prompt + mismo contexto produce la misma respuesta, cachéala. Especialmente en agentes de alto volumen respondiendo preguntas recurrentes.
- 4. Outputs estructurados: JSON schemas, function calling, restricciones regex. Elimina retries de output mal formado. Reduce desperdicio de tokens en explicaciones verbosas.
- 5. Compresión de prompt: Resume contextos largos antes de mandar. RAG recupera 50 chunks pero el modelo solo ve los top 5. Usa modelo pequeño para comprimir antes de que razone el grande.
- 6. Batching: Anthropic y OpenAI ofrecen APIs batch a 50% descuento con SLA 24h. Para flujos no-real-time (analítica, reportes diarios, clasificación), 50% gratis.
- 7. Umbral de autohospedaje: Pasando 30-50K $/mes en API, Llama 4 o Qwen 3 autohospedados empiezan a ganar. Por debajo, el coste de ops no compensa.
Palancas Que No Funcionan
- Cambiar de provider más barato por cambiar. El coste de migración suele exceder el ahorro.
- Reducir max_tokens agresivamente. Recorta coste pero causa respuestas truncadas que frustran.
- Quitar contexto. Peores respuestas, más retries del usuario, coste neto sube.
- Pedir al modelo que 'sea breve'. Ahorra una fracción pequeña; pierde info relevante.
- Cambiar streaming a no-streaming. No cambia el coste, solo la UX.
Profundizando en Prompt Caching
El prompt caching es la optimización con mayor ROI en 2026. El patrón que gana:
- Identifica tu prefijo estático: system prompt, ejemplos few-shot, contexto RAG que no cambia por request
- Márcalo como cacheable en la llamada (cache_control: ephemeral en Anthropic, prompt caching en OpenAI)
- La primera llamada cuesta precio completo + recargo pequeño; las siguientes dentro del TTL pagan 10-25% del precio normal de entrada
- TTL típico: 5 minutos (ephemeral Anthropic) o 1 hora (1h cache Anthropic); empareja con tu tráfico
- El orden importa: pon el contenido verdaderamente estático primero, dinámico al final
- Ahorro real: agentes de soporte que hemos entregado ven 40-65% reducción de coste de entrada solo con caching
Si no usas prompt caching en 2026 y tu system prompt pasa de 500 tokens, estás pagando de más. Punto.
Estrategia de Model Routing
- Tier 1: Barato (Haiku, GPT-5 Mini, Gemini Flash): Clasificación, intent, FAQ simple desde RAG, extracción estructurada. ~5% del coste frontier. Úsalo como default; escala cuando haga falta.
- Tier 2: Medio (Sonnet 4.6, GPT-5, Gemini Pro): Razonamiento de agente en producción, planificación multi-paso, tool use. El caballo de batalla. ~30% del coste frontier.
- Tier 3: Frontier (Opus 4.7, GPT-5.5): Razonamiento más duro, generación de código, síntesis multi-documento. Selectivo. Los agentes en producción solo lo necesitan en 5-15% de requests.
- Reglas de routing: Conteo de tokens, score de complejidad de un clasificador pequeño, retry on low confidence. Empareja modelo con request, no al revés.
Ejemplos de Ahorro Real
| Workload | Antes | Después de optimizar | Ahorro |
|---|
| Agente soporte (50K tickets/mes) | 22K $/mes | 8K $/mes | 63% |
| Búsqueda RAG (1M queries/mes) | 45K $/mes | 18K $/mes | 60% |
| Pipeline de extracción de docs | 15K $/mes | 4K $/mes | 73% |
| Agente cualificación ventas | 8K $/mes | 3K $/mes | 62% |
| Agente revisión código (interno) | 12K $/mes | 5K $/mes | 58% |
Números reales de engagements de Alher Tech 2024-2026. Cada uno usó combinación de patrones; ninguno solo gana la batalla.
Cuándo Autohospedear
- Gasto API pasando 30-50K $/mes, donde la factura GPU empieza a competir
- Workloads predecibles de alto volumen (tráfico estable encaja con GPUs dedicadas)
- Compliance o residencia de datos que descarta APIs de vendor
- Rendimiento open-source aceptable para tu listón de accuracy (Llama 4, Qwen 3 compiten en muchas tareas en 2026)
- Tienes o puedes contratar MLOps (vLLM, SGLang y TGI necesitan alguien cuidándolos)
- Puedes amortizar gasto GPU entre varios workloads (no dediques 4 H100s a una app diminuta)
Por debajo de 30K $/mes, autohospedar no ahorra una vez contado el tiempo de ops, coste de GPU idle y la complejidad. Quédate en APIs gestionadas.
Optimiza Como Ingeniería de Producción
La optimización de coste IA es ingeniería, no procurement. Caching, routing, batching, schemas: son los mismos patrones que funcionan en cualquier API de alto volumen. Trata tu factura IA como tu factura de BD: instrumenta, optimiza, monitoriza.
Los equipos que no, acaban pagando 3-5x lo que deberían. Los que sí, liberan presupuesto para entregar más features.
Preguntas frecuentes
¿Cuánto puedo ahorrar realísticamente?
30-50% solo con prompt caching. 40-70% con el stack completo de patrones. Más allá, el autohospedaje es la siguiente palanca, pero solo a escala.
¿Las optimizaciones bajan calidad?
No si se hacen bien. Caching, batching y outputs estructurados no cambian calidad. Model routing mantiene calidad si el clasificador acierta. Los patrones que usamos son neutros o positivos en calidad.
¿Y Claude Code o coding agents?
Mismos patrones. Workloads de código se benefician especialmente de prompt caching (el system prompt es enorme) y routing (Haiku para edits simples, Sonnet/Opus para diseño).
¿Cambio de OpenAI a Anthropic por coste?
No cambies solo por coste; son comparables en 2026. Cambia por fit de calidad, alineación de ecosistema o features específicas. Optimizar dentro de tu provider rinde más que cambiar.
¿Vale el prompt caching en apps de bajo volumen?
Por debajo de 1.000 llamadas/día, el esfuerzo de ingeniería no compensa. Encima de 10K/día, paga en días. En medio, depende de longitud media de prompt y tasa de hit del TTL.
Guías relacionadas