Sistemas RAG Empresariales: Arquitectura, Trampas y Qué Funciona de Verdad en 2026

Las demos de RAG (Retrieval-Augmented Generation) son fáciles. Los sistemas RAG que aguantan contra millones de documentos, cientos de usuarios y preguntas adversariales son muy difíciles. La mayoría de pilotos RAG empresariales en 2024-2025 lanzaron, lucieron en la sala de juntas y murieron silenciosamente en el mes cuatro. Esta es la arquitectura y proceso que usamos en Alher Tech para construir RAG que sobrevive a producción, cubriendo chunking, retrieval, evaluación y los patrones híbridos que funcionan de verdad.

Por Qué Falla la Mayoría de RAG Empresarial

El patrón es consistente: el piloto va bien con un set curado de 100 documentos. La producción tiene 100.000+ documentos con formato sucio, versiones en conflicto y PII. La misma arquitectura que deslumbró en la demo degrada silenciosamente al 60% de accuracy. Tres meses después el proyecto se aparca.

La Arquitectura de Referencia Que Funciona

El RAG de producción en 2026 es un pipeline multi-etapa, no un vector search único. Las piezas:

Eligiendo la Vector DB Correcta

Default a pgvector para proyectos nuevos por debajo de 10M chunks. La simplicidad operativa supera la ganancia marginal de velocidad de las vector DBs dedicadas a esta escala.

Chunking: La Palanca Subestimada

El chunking malo destruye RAG antes de que el retrieval corra. Los patrones que funcionan:

Evaluación: Sin Ella, Estás Adivinando

RAG sin evals es inmantenible en producción. Componentes de una suite real:

Realidad de Costes

ComponenteCoste setupCoste mensual
Pipeline ingesta + chunking15K – 80K $300 – 3K $
Vector DB (pgvector / Pinecone)5K – 30K $200 – 5K $
Generación de embeddings (OpenAI / Voyage / Cohere)2K – 20K $ inicial200 – 2K $
Re-ranking (Cohere Rerank, BGE)1K – 5K $200 – 2K $
Generación con LLM (Claude / GPT-5)N/A1K – 20K $ según volumen
Harness de evaluación20K – 80K $500 – 3K $
Frontend / chat UI / orquestación30K – 150K $500 – 5K $

Presupuesto total inicial: 80K – 400K $ según escala y complejidad. Anual recurrente: 30K – 300K $ según uso.

RAG Es una Disciplina de Ingeniería

Las empresas que ganan con RAG en 2026 lo tratan como cualquier otro sistema de producción, con medición, observabilidad, evaluación y mejora continua. Las que pierden construyeron un prompt, lo desplegaron y rezaron.

Si arrancas un proyecto RAG empresarial, el playbook de arriba no es opcional. Saltarte cualquier parte es cómo el proyecto termina aparcado.

Preguntas frecuentes

¿Fine-tuneo el modelo o uso RAG?

RAG para hechos que cambian. Fine-tuning para tono, formato y conocimiento de dominio estable. Casi todas las necesidades empresariales son RAG. Fine-tuning rara vez es la primera jugada correcta.

¿Qué modelo de embeddings uso?

OpenAI text-embedding-3-large para inglés general. Voyage-3 para más accuracy a más coste. Cohere embed-multilingual para no-inglés. Open-source (BGE, E5) cuando autohostear importa.

¿Cuánto tarda construir un sistema RAG?

Piloto con 1K-10K docs: 4-6 semanas. Producción con 100K+ docs y eval seria: 12-20 semanas. Suma 4-8 semanas para integración con agente.

¿Qué tamaño de chunk uso?

Empieza con 400-800 tokens para retrieval, con overlap del 10-20%. Ajusta según dominio: código y legal necesitan más pequeños; narrativo se beneficia de más grandes. Valida siempre con tu eval set.

¿Cómo manejo PII y control de acceso?

Filtra en retrieval con metadatos user-aware. Cada chunk tiene un ACL; el retrieval solo devuelve chunks que el usuario puede ver. No confíes en el LLM para redactar. Redacta en ingesta o filtra en retrieval.

Guías relacionadas