Sistemas RAG Empresariales, arquitectura, Trampas y Qué Funciona de Verdad en 2026

Las demos de RAG (Retrieval-Augmented Generation) son fáciles. Los sistemas RAG que aguantan contra millones de documentos, cientos de usuarios y preguntas adversariales son muy difíciles. La mayoría de pilotos RAG empresariales en 2024-2025 lanzaron, lucieron en la sala de juntas y murieron silenciosamente en el mes cuatro. Esta es la arquitectura y proceso que usamos en Alher Tech para construir RAG que sobrevive a producción, cubriendo chunking, retrieval, evaluación y los patrones híbridos que funcionan de verdad.

Por Qué Falla la Mayoría de RAG Empresarial

El patrón es consistente. El piloto va bien con un set curado de 100 documentos. La producción tiene 100.000+ documentos con formato sucio, versiones en conflicto y PII. La misma arquitectura que deslumbró en la demo degrada silenciosamente al 60% de accuracy. Tres meses después el proyecto se aparca.

La Arquitectura de Referencia Que Funciona

El RAG de producción en 2026 es un pipeline multi-etapa, no un vector search único. Las piezas:

Eligiendo la Vector DB Correcta

Default a pgvector para proyectos nuevos por debajo de 10M chunks. La simplicidad operativa supera la ganancia marginal de velocidad de las vector DBs dedicadas a esta escala.

Chunking, la Palanca Subestimada

El chunking malo destruye RAG antes de que el retrieval corra. Los patrones que funcionan:

Evaluación, sin Ella, Estás Adivinando

RAG sin evals es inmantenible en producción. Componentes de una suite real:

Realidad de Costes

ComponenteCoste setupCoste mensual
Pipeline ingesta + chunking15K – 80K $300 – 3K $
Vector DB (pgvector / Pinecone)5K – 30K $200 – 5K $
Generación de embeddings (OpenAI / Voyage / Cohere)2K – 20K $ inicial200 – 2K $
Re-ranking (Cohere Rerank, BGE)1K – 5K $200 – 2K $
Generación con LLM (Claude / GPT-5)N/A1K – 20K $ según volumen
Harness de evaluación20K – 80K $500 – 3K $
Frontend / chat UI / orquestación30K – 150K $500 – 5K $

Presupuesto total inicial: 80K – 400K $ según escala y complejidad. Anual recurrente: 30K – 300K $ según uso.

RAG Es una Disciplina de Ingeniería

Las empresas que ganan con RAG en 2026 lo tratan como cualquier otro sistema de producción, con medición, observabilidad, evaluación y mejora continua. Las que pierden construyeron un prompt, lo desplegaron y rezaron.

Si arrancas un proyecto RAG empresarial, el playbook de arriba no es opcional. Saltarte cualquier parte es cómo el proyecto termina aparcado.

Preguntas frecuentes

¿Fine-tuneo el modelo o uso RAG?

RAG para hechos que cambian. Fine-tuning para tono, formato y conocimiento de dominio estable. Casi todas las necesidades empresariales son RAG. Fine-tuning rara vez es la primera jugada correcta.

¿Qué modelo de embeddings uso?

OpenAI text-embedding-3-large para inglés general. Voyage-3 para más accuracy a más coste. Cohere embed-multilingual para no-inglés. Open-source (BGE, E5) cuando autohostear importa.

¿Cuánto tarda construir un sistema RAG?

Piloto con 1K-10K docs: 4-6 semanas. Producción con 100K+ docs y eval seria: 12-20 semanas. Suma 4-8 semanas para integración con agente.

¿Qué tamaño de chunk uso?

Empieza con 400-800 tokens para retrieval, con overlap del 10-20%. Ajusta según dominio. Código y legal necesitan más pequeños; narrativo se beneficia de más grandes. Valida siempre con tu eval set.

¿Cómo manejo PII y control de acceso?

Filtra en retrieval con metadatos user-aware. Cada chunk tiene un ACL; el retrieval solo devuelve chunks que el usuario puede ver. No confíes en el LLM para redactar. Redacta en ingesta o filtra en retrieval.

Guías relacionadas