Módulo 3: Features Esenciales para RAG
Módulo 3: Features Esenciales para RAG
Descripción del módulo
Ya sabes POR QUÉ necesitas vector databases (Módulo 1) y CÓMO funcionan internamente (Módulo 2). Ahora viene la pregunta: ¿QUÉ features necesitas para RAG en producción?
La respuesta corta: No es solo "buscar vectores similares". Un RAG system production-ready requiere:
- Metadata filtering (buscar solo en documentos relevantes)
- Hybrid search (combinar keyword + semantic)
- Multi-tenancy (aislar datos por usuario/empresa)
- Batch operations (ingerir 1M documentos eficientemente)
- Monitoring (detectar degradación de accuracy)
Este módulo te explica QUÉ features son críticas y POR QUÉ, con tu conocimiento de arquitectura interna (Módulo 2) para entender el impacto en performance.
Al finalizar este módulo, serás capaz de:
- Identificar features esenciales vs nice-to-have
- Evaluar vector databases según features (ChromaDB vs Pinecone vs Weaviate)
- Diseñar arquitectura RAG con features correctas
- Evitar anti-patterns comunes (e.g., buscar en todo sin filtros)
Este módulo es 100% conceptual. Implementación viene en Módulo 4 (ChromaDB Hands-On).
🎯 Objetivo del módulo
Objetivo profesional:
Identificar y justificar features esenciales de vector databases para RAG systems en producción, evaluando impacto en accuracy, performance, y costos.
¿Por qué es importante?
Elegir vector database SIN evaluar features = riesgo de:
- Re-arquitectura costosa: "ChromaDB no soporta multi-tenancy nativo. Migrando a Pinecone."
- Performance degradado: "Búsqueda sin metadata filter = 500ms. Con filter = 50ms."
- Accuracy bajo: "Pure semantic search = 75% accuracy. Hybrid search = 92%."
Analogía: Comprar auto solo por motor (HNSW) sin revisar features (AC, airbags, GPS). Funciona, pero no es production-ready.
📚 Contenido del módulo
Cápsula 01: Introducción al módulo (estás aquí)
- Objetivo y filosofía del módulo
- Por qué features importan tanto como algoritmos
- Progresión del módulo
Cápsula 02: Metadata Filtering (Where Clauses)
- Qué es metadata filtering (buscar en subset de documentos)
- Por qué es crítico para RAG (relevancia, latency, costos)
- Pre-filtering vs Post-filtering (trade-offs)
- Operadores: Equality, Range, Membership, Logical
- Impact en performance (10x speedup típico)
Cápsula 03: Hybrid Search (Keyword + Semantic)
- Qué es hybrid search (combinar BM25 + vector search)
- Por qué pure semantic search falla en queries específicos
- Ranking strategies (RRF, weighted fusion)
- Cuándo usar hybrid vs pure semantic
- Impact en accuracy (75% → 92% típico)
Cápsula 04: Multi-tenancy (Aislamiento de datos)
- Qué es multi-tenancy (múltiples usuarios/empresas en misma DB)
- Estrategias: Collection per tenant, Metadata filtering, Namespace
- Security considerations (data leakage prevention)
- Performance trade-offs (scale horizontal vs vertical)
- Cuándo es crítico (SaaS, enterprise RAG)
Cápsula 05: Batch Operations (Ingestion eficiente)
- Por qué single insert es ineficiente (1M inserts × 10ms = 2.7 horas)
- Batch insert strategies (optimal batch size)
- Bulk updates y deletes
- Rebuild index strategies (incremental vs full)
- Trade-offs: Throughput vs Latency
Cápsula 06: Distance Metrics (Más allá de cosine)
- Cosine similarity (default para text embeddings)
- Euclidean distance (L2)
- Dot product
- Cuándo usar cada uno (embeddings normalizados vs no)
- Impact en accuracy (2-5% típicamente)
Cápsula 07: Observability y Monitoring
- Qué monitorear en production RAG
- Metrics clave: Latency (p50, p95, p99), Throughput, Accuracy
- Detectar degradación de accuracy (embeddings drift)
- Debugging queries lentos
- Alerting strategies
Cápsula 08: Features Nice-to-Have vs Críticas
- Checklist de features por escenario RAG
- Comparación: ChromaDB vs Pinecone vs Weaviate vs Qdrant
- Decision matrix (features × requisitos)
- Anti-patterns comunes y cómo evitarlos
- Resumen y transición a Módulo 4
🔗 Conexión con otros módulos
Prerequisitos:
- Módulo 1: Por qué Vector DBs (necesidad justificada)
- Módulo 2: Cómo funcionan (arquitectura interna)
Este módulo prepara para:
- Módulo 4: ChromaDB Setup (implementarás features aquí aprendidas)
- Módulo 5: ChromaDB + RAG completo (usarás metadata filtering, hybrid search)
- Módulo 6-8: Production (evaluarás databases según features)
Flujo recomendado:
Módulo 1: Por qué Vector DBs
↓
Módulo 2: Cómo funcionan (HNSW, IVF, PQ)
↓
Módulo 3: QUÉ features necesitas ← Estás aquí
↓
Módulo 4-5: Implementa con ChromaDB
↓
Módulo 6-8: Production considerations
⏱️ Tiempo estimado
Lectura y comprensión: 60-75 minutos
Desglose por cápsula:
- Cápsula 01: 5 min (introducción)
- Cápsula 02: 10-12 min (metadata filtering profundo)
- Cápsula 03: 10-12 min (hybrid search)
- Cápsula 04: 8-10 min (multi-tenancy)
- Cápsula 05: 8-10 min (batch operations)
- Cápsula 06: 6-8 min (distance metrics)
- Cápsula 07: 8-10 min (monitoring)
- Cápsula 08: 8-10 min (comparación y resumen)
Total: 63-82 minutos
Nota: Este módulo es 100% conceptual (sin código). Implementación en Módulo 4.
🎓 ¿Qué aprenderás en este módulo?
Al finalizar este módulo, serás capaz de:
1. Identificar features críticas para RAG
- ✅ Metadata filtering (reducir search space 10x)
- ✅ Hybrid search (accuracy 75% → 92%)
- ✅ Multi-tenancy (SaaS/enterprise)
- ✅ Batch operations (ingestion eficiente)
- ✅ Monitoring (detectar degradación)
2. Evaluar vector databases según features
- ✅ ChromaDB: Metadata filtering ✅, Hybrid search ❌, Multi-tenancy ⚠️
- ✅ Pinecone: Todo ✅, pero managed (costo)
- ✅ Weaviate: Hybrid search nativo ✅, self-hosted
- ✅ Qdrant: Features avanzadas ✅, self-hosted
3. Diseñar arquitectura RAG correctamente
- ✅ Usar metadata filtering para relevancia
- ✅ Implementar hybrid search cuando necesario
- ✅ Configurar multi-tenancy según escala
- ✅ Optimizar batch ingestion
4. Evitar anti-patterns
- ❌ Buscar en todo sin metadata filtering
- ❌ Pure semantic search en queries específicos
- ❌ Single inserts para 1M documentos
- ❌ No monitorear accuracy degradation
💡 Filosofía del módulo
Por qué features > algoritmos en producción
Podrías preguntarte: "Ya sé que HNSW es mejor que IVF. ¿Por qué necesito saber features?"
Respuesta: Algoritmo correcto + features incorrectas = sistema ineficiente.
Ejemplo real:
Escenario: RAG chatbot con 500K documentos
Algoritmo: HNSW (98% accuracy)
Sin metadata filtering:
- Query: "Password reset instructions"
- Busca en: 500K documentos (todos)
- Latency: 200ms
- Accuracy: 85% (ruido de docs irrelevantes)
Con metadata filtering:
- Query: "Password reset instructions"
- Busca en: 10K documentos (category='support')
- Latency: 20ms (10x faster)
- Accuracy: 95% (solo docs relevantes)
Trade-off: Algoritmo perfecto (HNSW) + feature crítica (filtering) = 10x mejor sistema.
Diferenciador clave vs competencia
90% de tutoriales:
- Muestran solo "buscar vectores similares"
- No cubren metadata filtering, hybrid search, multi-tenancy
- Resultado: MVP funciona, pero no production-ready
Este módulo:
- Cubre features esenciales para producción
- Explica POR QUÉ cada feature importa (con benchmarks)
- Decision framework: Cuándo usar cada feature
🚫 Qué NO cubre este módulo
Este módulo NO cubre:
❌ Implementación de features (eso es Módulo 4)
- No verás código de metadata filtering
- No implementarás hybrid search
- Solo conceptos y decisiones
❌ Features avanzadas edge-case (eso es Módulo 7-8)
- No cubre distributed sharding
- No cubre custom distance metrics
- Solo features esenciales 80/20
❌ Comparación exhaustiva de DBs (eso es Módulo 6)
- Solo overview de features principales
- Comparación profunda viene después
Scope claro: Este módulo es sobre QUÉ features necesitas y POR QUÉ, no CÓMO implementarlas.
✅ Criterios de éxito
Completaste exitosamente este módulo cuando:
Puedes responder estas preguntas:
-
✅ ¿Qué es metadata filtering y por qué es crítico para RAG?
- Respuesta: Buscar en subset de documentos usando where clauses. Reduce latency 10x y mejora relevancia filtrando docs irrelevantes.
-
✅ ¿Cuándo usar hybrid search vs pure semantic search?
- Respuesta: Hybrid cuando query es específico (nombres propios, IDs, fechas exactas). Pure semantic cuando query es conceptual/ambiguo.
-
✅ ¿Qué estrategia de multi-tenancy para SaaS con 1000 clientes?
- Respuesta: Metadata filtering (tenant_id field) para <10K clientes. Collection per tenant para >10K o strict isolation.
-
✅ ¿Por qué batch insert es crítico para 1M documentos?
- Respuesta: Single insert = 2.7 horas (1M × 10ms). Batch insert (1000 batch size) = 16 minutos (10x faster).
-
✅ ¿Qué monitorear en RAG production?
- Respuesta: Latency (p95 <500ms), Accuracy (>90%), Throughput (queries/sec), Index health (rebuild frequency).
Si respondiste 4-5/5 correctamente → ✅ Listo para Módulo 4 (ChromaDB Hands-On)
🎯 Habilidades que desarrollarás
Este módulo desarrolla habilidades de arquitectura de sistemas RAG, no programación.
Habilidades de evaluación:
- Feature assessment - Identificar features críticas vs nice-to-have
- Database comparison - Evaluar ChromaDB vs Pinecone vs Weaviate según features
- Trade-off analysis - Managed vs self-hosted, features vs cost
Habilidades de diseño:
- Arquitectura RAG - Diseñar con metadata filtering, hybrid search, multi-tenancy
- Performance optimization - Reducir latency con filtering, batch operations
- Scalability planning - Multi-tenancy strategy, batch ingestion
Habilidades de prevención:
- Anti-pattern detection - Identificar diseños ineficientes
- Risk assessment - Evaluar impacto de features faltantes
- Migration planning - Cuándo migrar de DB según features
📖 Cómo usar este módulo
Estrategia recomendada:
-
Lee secuencialmente (Cápsulas 01 → 02 → ... → 08)
- Metadata filtering primero (feature más crítica)
- Luego hybrid search y multi-tenancy
- Finalmente comparación y decisiones
-
Conecta con tu caso de uso
- "¿Mi RAG necesita multi-tenancy?"
- "¿Hybrid search mejoraría mi accuracy?"
- "¿Cómo optimizar ingestion de 500K docs?"
-
Usa checklists de decisión (Cápsula 08)
- Evalúa features críticas para tu escenario
- Compara databases según checklist
- Toma decisión informada
Tiempo sugerido:
Opción A: Una sesión (60-75 min)
- Lee todo de corrido
- Ventaja: Contexto completo, comparaciones claras
Opción B: Dos sesiones
- Sesión 1: Cápsulas 01-04 (features core: filtering, hybrid, multi-tenancy)
- Sesión 2: Cápsulas 05-08 (operations: batch, monitoring, comparación)
Recomendación: Opción A (contenido es complementario, mejor en una sesión).
🔗 Recursos para este módulo
Documentación oficial:
- ChromaDB Features - Metadata filtering, collections
- Pinecone Features - Namespaces, hybrid search
- Weaviate Hybrid Search - BM25 + vector
Artículos técnicos:
- "Metadata Filtering in Vector Databases" - Pinecone blog
- "Hybrid Search Explained" - Weaviate blog
- "Multi-tenancy Strategies" - Qdrant blog
Benchmarks:
- Vector Database Benchmarks - Performance comparisons
- Hybrid Search Accuracy - RRF vs weighted
Nota: Estos recursos son para profundizar DESPUÉS del módulo. Las cápsulas son autocontenidas.
🚀 ¿Listo para empezar?
Próximo paso:
Ve a Cápsula 02: Metadata Filtering (Where Clauses)
Ahí aprenderás:
- Qué es metadata filtering (buscar en subset)
- Pre-filtering vs Post-filtering (trade-offs)
- Operadores (equality, range, membership, logical)
- Impact en performance (10x speedup real)
Esta es la feature más crítica para RAG en producción. Literalmente 10x diferencia en latency y accuracy.
Tiempo de lectura: 5 minutos
Siguiente: 02-metadata-filtering.md