Módulo 3: Features Esenciales para RAG

Módulo 3: Features Esenciales para RAG

Descripción del módulo

Ya sabes POR QUÉ necesitas vector databases (Módulo 1) y CÓMO funcionan internamente (Módulo 2). Ahora viene la pregunta: ¿QUÉ features necesitas para RAG en producción?

La respuesta corta: No es solo "buscar vectores similares". Un RAG system production-ready requiere:

  • Metadata filtering (buscar solo en documentos relevantes)
  • Hybrid search (combinar keyword + semantic)
  • Multi-tenancy (aislar datos por usuario/empresa)
  • Batch operations (ingerir 1M documentos eficientemente)
  • Monitoring (detectar degradación de accuracy)

Este módulo te explica QUÉ features son críticas y POR QUÉ, con tu conocimiento de arquitectura interna (Módulo 2) para entender el impacto en performance.

Al finalizar este módulo, serás capaz de:

  • Identificar features esenciales vs nice-to-have
  • Evaluar vector databases según features (ChromaDB vs Pinecone vs Weaviate)
  • Diseñar arquitectura RAG con features correctas
  • Evitar anti-patterns comunes (e.g., buscar en todo sin filtros)

Este módulo es 100% conceptual. Implementación viene en Módulo 4 (ChromaDB Hands-On).


🎯 Objetivo del módulo

Objetivo profesional:

Identificar y justificar features esenciales de vector databases para RAG systems en producción, evaluando impacto en accuracy, performance, y costos.

¿Por qué es importante?

Elegir vector database SIN evaluar features = riesgo de:

  • Re-arquitectura costosa: "ChromaDB no soporta multi-tenancy nativo. Migrando a Pinecone."
  • Performance degradado: "Búsqueda sin metadata filter = 500ms. Con filter = 50ms."
  • Accuracy bajo: "Pure semantic search = 75% accuracy. Hybrid search = 92%."

Analogía: Comprar auto solo por motor (HNSW) sin revisar features (AC, airbags, GPS). Funciona, pero no es production-ready.


📚 Contenido del módulo

Cápsula 01: Introducción al módulo (estás aquí)

  • Objetivo y filosofía del módulo
  • Por qué features importan tanto como algoritmos
  • Progresión del módulo

Cápsula 02: Metadata Filtering (Where Clauses)

  • Qué es metadata filtering (buscar en subset de documentos)
  • Por qué es crítico para RAG (relevancia, latency, costos)
  • Pre-filtering vs Post-filtering (trade-offs)
  • Operadores: Equality, Range, Membership, Logical
  • Impact en performance (10x speedup típico)

Cápsula 03: Hybrid Search (Keyword + Semantic)

  • Qué es hybrid search (combinar BM25 + vector search)
  • Por qué pure semantic search falla en queries específicos
  • Ranking strategies (RRF, weighted fusion)
  • Cuándo usar hybrid vs pure semantic
  • Impact en accuracy (75% → 92% típico)

Cápsula 04: Multi-tenancy (Aislamiento de datos)

  • Qué es multi-tenancy (múltiples usuarios/empresas en misma DB)
  • Estrategias: Collection per tenant, Metadata filtering, Namespace
  • Security considerations (data leakage prevention)
  • Performance trade-offs (scale horizontal vs vertical)
  • Cuándo es crítico (SaaS, enterprise RAG)

Cápsula 05: Batch Operations (Ingestion eficiente)

  • Por qué single insert es ineficiente (1M inserts × 10ms = 2.7 horas)
  • Batch insert strategies (optimal batch size)
  • Bulk updates y deletes
  • Rebuild index strategies (incremental vs full)
  • Trade-offs: Throughput vs Latency

Cápsula 06: Distance Metrics (Más allá de cosine)

  • Cosine similarity (default para text embeddings)
  • Euclidean distance (L2)
  • Dot product
  • Cuándo usar cada uno (embeddings normalizados vs no)
  • Impact en accuracy (2-5% típicamente)

Cápsula 07: Observability y Monitoring

  • Qué monitorear en production RAG
  • Metrics clave: Latency (p50, p95, p99), Throughput, Accuracy
  • Detectar degradación de accuracy (embeddings drift)
  • Debugging queries lentos
  • Alerting strategies

Cápsula 08: Features Nice-to-Have vs Críticas

  • Checklist de features por escenario RAG
  • Comparación: ChromaDB vs Pinecone vs Weaviate vs Qdrant
  • Decision matrix (features × requisitos)
  • Anti-patterns comunes y cómo evitarlos
  • Resumen y transición a Módulo 4

🔗 Conexión con otros módulos

Prerequisitos:

  • Módulo 1: Por qué Vector DBs (necesidad justificada)
  • Módulo 2: Cómo funcionan (arquitectura interna)

Este módulo prepara para:

  • Módulo 4: ChromaDB Setup (implementarás features aquí aprendidas)
  • Módulo 5: ChromaDB + RAG completo (usarás metadata filtering, hybrid search)
  • Módulo 6-8: Production (evaluarás databases según features)

Flujo recomendado:

Módulo 1: Por qué Vector DBs
  ↓
Módulo 2: Cómo funcionan (HNSW, IVF, PQ)
  ↓
Módulo 3: QUÉ features necesitas ← Estás aquí
  ↓
Módulo 4-5: Implementa con ChromaDB
  ↓
Módulo 6-8: Production considerations

⏱️ Tiempo estimado

Lectura y comprensión: 60-75 minutos

Desglose por cápsula:

  • Cápsula 01: 5 min (introducción)
  • Cápsula 02: 10-12 min (metadata filtering profundo)
  • Cápsula 03: 10-12 min (hybrid search)
  • Cápsula 04: 8-10 min (multi-tenancy)
  • Cápsula 05: 8-10 min (batch operations)
  • Cápsula 06: 6-8 min (distance metrics)
  • Cápsula 07: 8-10 min (monitoring)
  • Cápsula 08: 8-10 min (comparación y resumen)

Total: 63-82 minutos

Nota: Este módulo es 100% conceptual (sin código). Implementación en Módulo 4.


🎓 ¿Qué aprenderás en este módulo?

Al finalizar este módulo, serás capaz de:

1. Identificar features críticas para RAG

  • ✅ Metadata filtering (reducir search space 10x)
  • ✅ Hybrid search (accuracy 75% → 92%)
  • ✅ Multi-tenancy (SaaS/enterprise)
  • ✅ Batch operations (ingestion eficiente)
  • ✅ Monitoring (detectar degradación)

2. Evaluar vector databases según features

  • ✅ ChromaDB: Metadata filtering ✅, Hybrid search ❌, Multi-tenancy ⚠️
  • ✅ Pinecone: Todo ✅, pero managed (costo)
  • ✅ Weaviate: Hybrid search nativo ✅, self-hosted
  • ✅ Qdrant: Features avanzadas ✅, self-hosted

3. Diseñar arquitectura RAG correctamente

  • ✅ Usar metadata filtering para relevancia
  • ✅ Implementar hybrid search cuando necesario
  • ✅ Configurar multi-tenancy según escala
  • ✅ Optimizar batch ingestion

4. Evitar anti-patterns

  • ❌ Buscar en todo sin metadata filtering
  • ❌ Pure semantic search en queries específicos
  • ❌ Single inserts para 1M documentos
  • ❌ No monitorear accuracy degradation

💡 Filosofía del módulo

Por qué features > algoritmos en producción

Podrías preguntarte: "Ya sé que HNSW es mejor que IVF. ¿Por qué necesito saber features?"

Respuesta: Algoritmo correcto + features incorrectas = sistema ineficiente.

Ejemplo real:

Escenario: RAG chatbot con 500K documentos
Algoritmo: HNSW (98% accuracy)

Sin metadata filtering:
- Query: "Password reset instructions"
- Busca en: 500K documentos (todos)
- Latency: 200ms
- Accuracy: 85% (ruido de docs irrelevantes)

Con metadata filtering:
- Query: "Password reset instructions"
- Busca en: 10K documentos (category='support')
- Latency: 20ms (10x faster)
- Accuracy: 95% (solo docs relevantes)

Trade-off: Algoritmo perfecto (HNSW) + feature crítica (filtering) = 10x mejor sistema.


Diferenciador clave vs competencia

90% de tutoriales:

  • Muestran solo "buscar vectores similares"
  • No cubren metadata filtering, hybrid search, multi-tenancy
  • Resultado: MVP funciona, pero no production-ready

Este módulo:

  • Cubre features esenciales para producción
  • Explica POR QUÉ cada feature importa (con benchmarks)
  • Decision framework: Cuándo usar cada feature

🚫 Qué NO cubre este módulo

Este módulo NO cubre:

Implementación de features (eso es Módulo 4)

  • No verás código de metadata filtering
  • No implementarás hybrid search
  • Solo conceptos y decisiones

Features avanzadas edge-case (eso es Módulo 7-8)

  • No cubre distributed sharding
  • No cubre custom distance metrics
  • Solo features esenciales 80/20

Comparación exhaustiva de DBs (eso es Módulo 6)

  • Solo overview de features principales
  • Comparación profunda viene después

Scope claro: Este módulo es sobre QUÉ features necesitas y POR QUÉ, no CÓMO implementarlas.


✅ Criterios de éxito

Completaste exitosamente este módulo cuando:

Puedes responder estas preguntas:

  1. ¿Qué es metadata filtering y por qué es crítico para RAG?

    • Respuesta: Buscar en subset de documentos usando where clauses. Reduce latency 10x y mejora relevancia filtrando docs irrelevantes.
  2. ¿Cuándo usar hybrid search vs pure semantic search?

    • Respuesta: Hybrid cuando query es específico (nombres propios, IDs, fechas exactas). Pure semantic cuando query es conceptual/ambiguo.
  3. ¿Qué estrategia de multi-tenancy para SaaS con 1000 clientes?

    • Respuesta: Metadata filtering (tenant_id field) para <10K clientes. Collection per tenant para >10K o strict isolation.
  4. ¿Por qué batch insert es crítico para 1M documentos?

    • Respuesta: Single insert = 2.7 horas (1M × 10ms). Batch insert (1000 batch size) = 16 minutos (10x faster).
  5. ¿Qué monitorear en RAG production?

    • Respuesta: Latency (p95 <500ms), Accuracy (>90%), Throughput (queries/sec), Index health (rebuild frequency).

Si respondiste 4-5/5 correctamente → ✅ Listo para Módulo 4 (ChromaDB Hands-On)


🎯 Habilidades que desarrollarás

Este módulo desarrolla habilidades de arquitectura de sistemas RAG, no programación.

Habilidades de evaluación:

  1. Feature assessment - Identificar features críticas vs nice-to-have
  2. Database comparison - Evaluar ChromaDB vs Pinecone vs Weaviate según features
  3. Trade-off analysis - Managed vs self-hosted, features vs cost

Habilidades de diseño:

  1. Arquitectura RAG - Diseñar con metadata filtering, hybrid search, multi-tenancy
  2. Performance optimization - Reducir latency con filtering, batch operations
  3. Scalability planning - Multi-tenancy strategy, batch ingestion

Habilidades de prevención:

  1. Anti-pattern detection - Identificar diseños ineficientes
  2. Risk assessment - Evaluar impacto de features faltantes
  3. Migration planning - Cuándo migrar de DB según features

📖 Cómo usar este módulo

Estrategia recomendada:

  1. Lee secuencialmente (Cápsulas 01 → 02 → ... → 08)

    • Metadata filtering primero (feature más crítica)
    • Luego hybrid search y multi-tenancy
    • Finalmente comparación y decisiones
  2. Conecta con tu caso de uso

    • "¿Mi RAG necesita multi-tenancy?"
    • "¿Hybrid search mejoraría mi accuracy?"
    • "¿Cómo optimizar ingestion de 500K docs?"
  3. Usa checklists de decisión (Cápsula 08)

    • Evalúa features críticas para tu escenario
    • Compara databases según checklist
    • Toma decisión informada

Tiempo sugerido:

Opción A: Una sesión (60-75 min)

  • Lee todo de corrido
  • Ventaja: Contexto completo, comparaciones claras

Opción B: Dos sesiones

  • Sesión 1: Cápsulas 01-04 (features core: filtering, hybrid, multi-tenancy)
  • Sesión 2: Cápsulas 05-08 (operations: batch, monitoring, comparación)

Recomendación: Opción A (contenido es complementario, mejor en una sesión).


🔗 Recursos para este módulo

Documentación oficial:

  1. ChromaDB Features - Metadata filtering, collections
  2. Pinecone Features - Namespaces, hybrid search
  3. Weaviate Hybrid Search - BM25 + vector

Artículos técnicos:

  1. "Metadata Filtering in Vector Databases" - Pinecone blog
  2. "Hybrid Search Explained" - Weaviate blog
  3. "Multi-tenancy Strategies" - Qdrant blog

Benchmarks:

  1. Vector Database Benchmarks - Performance comparisons
  2. Hybrid Search Accuracy - RRF vs weighted

Nota: Estos recursos son para profundizar DESPUÉS del módulo. Las cápsulas son autocontenidas.


🚀 ¿Listo para empezar?

Próximo paso:

Ve a Cápsula 02: Metadata Filtering (Where Clauses)

Ahí aprenderás:

  1. Qué es metadata filtering (buscar en subset)
  2. Pre-filtering vs Post-filtering (trade-offs)
  3. Operadores (equality, range, membership, logical)
  4. Impact en performance (10x speedup real)

Esta es la feature más crítica para RAG en producción. Literalmente 10x diferencia en latency y accuracy.


Tiempo de lectura: 5 minutos
Siguiente: 02-metadata-filtering.md