Módulo 7: RAG y Semantic Search
2. El Problema que RAG Resuelve
Descripción
Antes de entender RAG, debes entender por qué existe. Esta cápsula cubre los problemas fundamentales de los LLMs puros: hallucinations, conocimiento desactualizado, y falta de contexto privado.
Problema 1: Hallucinations (alucinaciones)
¿Qué son hallucinations?
LLM genera información que parece correcta pero es inventada o incorrecta.
Ejemplo:
User: "¿Cuándo fue fundada la empresa XYZ Inc.?"
LLM (sin RAG): "XYZ Inc. fue fundada en 2015 por John Smith."
→ Respuesta inventada (LLM no tiene datos sobre XYZ Inc.)
Por qué ocurre:
- LLM fue entrenado con datos públicos (hasta fecha de corte)
- No tiene información sobre empresas privadas/recientes
- Modelo "rellena huecos" con información plausible pero falsa
Problema 2: Conocimiento desactualizado
Ejemplo:
User: "¿Cuál es el CEO actual de Twitter?"
LLM (entrenado hasta 2023): "Jack Dorsey"
→ Incorrecto (Elon Musk compró Twitter en 2022)
Por qué ocurre:
- Fecha de corte de entrenamiento (ej: GPT-4 hasta Sep 2023)
- Mundo real cambia constantemente
- Re-entrenar modelo es costoso y lento
Problema 3: Sin acceso a datos privados
Ejemplo:
User: "¿Qué dice el manual interno sobre la política de vacaciones?"
LLM: "No tengo acceso a documentos internos de tu empresa."
→ Respuesta correcta pero no útil
Por qué ocurre:
- LLM fue entrenado con datos públicos (web, libros)
- No tiene acceso a:
- Documentos internos de empresas
- Bases de datos privadas
- Archivos personales
Problema 4: Límite de contexto
Ejemplo:
User: "Resume estos 100 PDFs sobre regulaciones financieras"
LLM: [Error] "El contexto supera el límite de 128K tokens"
Por qué ocurre:
- LLMs tienen límite de contexto (ej: GPT-4 Turbo = 128K tokens)
- 100 PDFs pueden ser 1M+ tokens
- No puedes enviar todo al LLM
Solución tradicional: Fine-tuning
¿Qué es?
Re-entrenar el LLM con tus datos específicos.
Limitaciones:
- Costo: $1000+ por fine-tuning (modelos grandes)
- Tiempo: Horas/días de entrenamiento
- Desactualización: Si datos cambian, re-entrenar
- Hallucinations: Sigue ocurriendo (solo reduce frecuencia)
Solución moderna: RAG
Idea clave:
En lugar de re-entrenar el LLM, dale acceso a búsqueda en tiempo real.
Flujo:
1. User pregunta: "¿Qué dice el manual sobre vacaciones?"
2. Sistema busca en documentos internos (semantic search)
→ Encuentra 5 secciones relevantes
3. Sistema envía pregunta + contexto al LLM:
"Contexto: [5 secciones del manual]
Pregunta: ¿Qué dice sobre vacaciones?"
4. LLM genera respuesta basada en contexto
→ Respuesta precisa (no inventa)
Comparación: Con y sin RAG
Sin RAG (LLM puro):
User: "¿Cómo configuro Pinecone para producción?"
LLM: "Para configurar Pinecone en producción, debes:
1. Crear un índice con dimensión correcta
2. Configurar sharding
3. Ajustar throughput
..."
Problema: Respuesta genérica (puede estar desactualizada)
Con RAG:
User: "¿Cómo configuro Pinecone para producción?"
Sistema:
1. Busca en docs de Pinecone (semantic search)
→ Encuentra guía oficial de setup (actualizada)
2. Envía al LLM:
Contexto: [Guía oficial de Pinecone]
Pregunta: ¿Cómo configuro para producción?
LLM: "Según la documentación oficial de Pinecone:
1. Crea un índice con 'pod_type=p1' para producción
2. Configura 'replicas=3' para alta disponibilidad
3. Usa 'metric=cosine' para embeddings de OpenAI
..."
Resultado: Respuesta precisa y actualizada ✅
Ventajas de RAG
- Elimina hallucinations (respuestas basadas en documentos reales)
- Siempre actualizado (búsqueda en docs actuales)
- Acceso a datos privados (busca en tus documentos)
- No requiere re-entrenamiento (agregar docs = actualizar índice)
- Explicable (puedes ver qué docs usó)
Limitaciones de RAG
(Las veremos en profundidad en cápsula 06)
- Latencia mayor (búsqueda + generación)
- Dependencia de búsqueda (si búsqueda falla, respuesta incorrecta)
- Costo por query (embedding + LLM)
- Límite de contexto (solo top-K docs caben en prompt)
Resumen
Puntos clave:
- Problemas de LLMs: Hallucinations, desactualización, sin datos privados
- Fine-tuning: Costoso, lento, sigue alucinando
- RAG: Búsqueda en tiempo real + LLM = Respuestas precisas
- Ventajas: No hallucinations, actualizado, acceso a privados
Próxima cápsula: 03-rag-architecture.md — Componentes y flujos de RAG.