GuíaBásico

Guía de Fundamentos de Bases de Datos Vectoriales

Aprende cómo funcionan las vector databases por dentro, por qué las necesitas para sistemas RAG y cómo elegir la correcta para tu proyecto. Esta guía te lleva desde los fundamentos (arquitectura, algoritmos de indexing, features esenciales) hasta implementación hands-on con ChromaDB y un proyecto integrador de RAG con 1,000+ documentos y API FastAPI. Al terminar, sabrás implementar storage y retrieval de vectores para producción — y tendrás criterio para decidir entre ChromaDB, Pinecone, Weaviate y Qdrant según tus requisitos reales.

67
lecciones
8
módulos
Inglés · Español
disponible en
certificado
Incluido en el Club
acceso
NIEVA

Resultados

Lo que vas a poder hacer

  • Entender por qué los sistemas RAG necesitan vector databases (y cuándo SQL, NoSQL o numpy son suficientes)
  • Explicar cómo funcionan las vector databases por dentro: arquitectura, algoritmos HNSW, IVF y PQ
  • Identificar features esenciales para RAG en producción: metadata filtering, hybrid search, multi-tenancy, batch operations
  • Implementar ChromaDB desde setup hasta similarity search optimizado con metadata filtering
  • Construir un sistema RAG completo: ingestion de documentos, indexing, retrieval y generation con FastAPI
  • Comparar Pinecone, Weaviate, Qdrant y Milvus — features, pricing y trade-offs de arquitectura
  • Aplicar un framework de decisión para elegir la vector database correcta según el proyecto
  • Diseñar estrategias de producción: scaling, monitoring, backups, migraciones y optimización de costos

Antes de empezar

Qué necesitas traer

Es para ti si...

  • AI Engineers construyendo sistemas RAG que necesitan almacenar y buscar embeddings a escala
  • Desarrolladores que completaron la guía Embeddings Deep Dive y quieren implementar vector storage para producción
  • Ingenieros backend evaluando opciones de vector databases (ChromaDB vs Pinecone vs Weaviate) para sus proyectos de AI
  • Estudiantes que se preparan para las semanas 7-9 del AI Engineering Bootcamp (módulos de implementación RAG)

Requisitos y materiales

  • Guía Embeddings Deep Dive completada (Guía #6): cómo generar embeddings, distance metrics, semantic search con numpy
  • Guía AI Semantics completada (Guía #5): qué son los vectores, similaridad coseno, keyword vs semantic search
  • Python intermedio: funciones, clases, async/await, paquetes pip
  • Familiaridad básica con REST APIs (requests, endpoints, JSON)

Contenido

El temario, módulo por módulo

Abre cualquiera para ver sus lecciones.

  • Módulo 1: Por qué Vector Databases para AI Engineers
  • Cápsula 02: El problema de fondo — RAG necesita encontrar 5 docs entre millones en milisegundos
  • Por qué SQL/NoSQL no sirven para semantic search
  • Por qué numpy/pandas no escalan a producción
  • Cuándo SÍ necesitas vector database
  • Cuándo NO necesitas vector database
  • Trade-offs: Simplicidad vs Performance vs Costo
  • Resumen del Módulo 1 y Transición

  • Módulo 2: Cómo funcionan Vector Databases (Conceptual)
  • Cápsula 02: Arquitectura de Vector Databases (3 Capas)
  • Cápsula 03: Indexing Algorithms - Overview
  • Cápsula 04: HNSW - Hierarchical Navigable Small World
  • Cápsula 05: IVF - Inverted File Index
  • Cápsula 06: PQ - Product Quantization
  • Cápsula 07: Comparación HNSW vs IVF vs PQ - Decision Framework
  • Cápsula 08: Por qué esto importa para RAG - Resumen del Módulo

  • Módulo 3: Features Esenciales para RAG
  • Cápsula 02: Metadata Filtering (Where Clauses)
  • Cápsula 03: Hybrid Search (Keyword + Semantic)
  • Cápsula 04: Multi-tenancy (Aislamiento de datos)
  • Cápsula 05: Batch Operations — el costo oculto del ingestion ingenuo
  • Cápsula 06: Distance Metrics — la decisión geométrica que casi nadie justifica
  • Cápsula 07: Observability — qué medir cuando ya nadie debugea con prints
  • Cápsula 08: Features Comparison y Resumen del Módulo

  • Módulo 4: ChromaDB Setup y Configuración
  • Cápsula 02: ChromaDB Installation y Setup
  • Cápsula 03: Collection Configuration — los tres parámetros que casi nadie justifica
  • Cápsula 04: Metadata Filtering Implementation — del concepto al código en ChromaDB
  • Cápsula 05: Batch Ingestion en ChromaDB — del concepto al pipeline operable
  • Cápsula 06: Query Optimization — donde se gana o se pierde la latencia real
  • Cápsula 07: Persistence y Durability — qué pasa cuando algo se rompe
  • Cápsula 08: Mini-Proyecto - Document Search System
  • Cápsula 09: Embeddings con OpenAI — Cuándo cambiar del default
  • Cápsula 10: Chunking de documentos — el problema del documento entero
  • Cápsula 11: Pipeline RAG end-to-end con ChromaDB

  • Módulo 5: Landscape de Vector Databases para AI Engineers
  • Cápsula 02: Panorama de Proveedores de Vector DB
  • Cápsula 03: Managed vs Self-Hosted
  • Cápsula 04: Comparación de Features para RAG
  • Cápsula 05: Costos y Trade-offs de Selección
  • Cápsula 06: Cuándo Elegir Cada Opción
  • Cápsula 07: Anti-patrones al Elegir Vector DB
  • Cápsula 08: Proyecto - Decision Tree para Elegir Vector DB

  • Módulo 6: Decision Matrix para AI Engineers
  • Cápsula 02: Requisitos y Criterios de Decisión
  • Cápsula 03: Pesos, Scoring y Metodología de la Matriz
  • Cápsula 04: Matriz de Decisión Práctica
  • Cápsula 05: Análisis de Costos y ROI
  • Cápsula 06: Recomendación por Escenarios
  • Cápsula 07: Casos de Elección Real
  • Cápsula 08: Proyecto - Cuestionario de Decisión

  • Módulo 7: Production Considerations para RAG
  • Cápsula 02: Estrategias de Escalado
  • Cápsula 03: Monitoring y Observabilidad para Sistemas RAG
  • Cápsula 04: Backup y Disaster Recovery
  • Cápsula 05: Seguridad para Sistemas RAG
  • Cápsula 06: Optimización de Costos y Rendimiento para RAG
  • Cápsula 07: Migración sin Downtime (ChromaDB → Pinecone)
  • Cápsula 08: Proyecto - Production Readiness Checklist

  • Módulo 8: Proyecto Integrador RAG con ChromaDB
  • Cápsula 02: Arquitectura del Proyecto
  • Cápsula 03: Pipeline de Ingestion para 1,000+ documentos
  • Cápsula 04: Retrieval, Generation y API
  • Cápsula 05: Testing y Evaluación
  • Cápsula 06: Observabilidad y Deployment
  • Cápsula 07: Hardening Final
  • Cápsula 08: Proyecto - RAG Production-Ready

Dónde encaja

Esta guía es parte de algo más grande

Se estudia dentro de estos programas, con acompañamiento y fechas.

Dudas frecuentes

Lo que suele preguntarse

Empieza cuando quieras

Reseñas

Lo que dicen los estudiantes

Estas reseñas son de estudiantes inscritos que completaron al menos el 50% del curso. Moderamos las reseñas solo por motivos de contenido (spam, lenguaje ofensivo, datos personales), nunca por ser críticas o negativas.

Aún no hay reseñas aprobadas.

¡Sé el primero en compartir tu experiencia!