Módulo 7: RAG y Semantic Search

2. El Problema que RAG Resuelve

Descripción

Antes de entender RAG, debes entender por qué existe. Esta cápsula cubre los problemas fundamentales de los LLMs puros: hallucinations, conocimiento desactualizado, y falta de contexto privado.


Problema 1: Hallucinations (alucinaciones)

¿Qué son hallucinations?
LLM genera información que parece correcta pero es inventada o incorrecta.

Ejemplo:

User: "¿Cuándo fue fundada la empresa XYZ Inc.?"

LLM (sin RAG): "XYZ Inc. fue fundada en 2015 por John Smith."
→ Respuesta inventada (LLM no tiene datos sobre XYZ Inc.)

Por qué ocurre:

  • LLM fue entrenado con datos públicos (hasta fecha de corte)
  • No tiene información sobre empresas privadas/recientes
  • Modelo "rellena huecos" con información plausible pero falsa

Problema 2: Conocimiento desactualizado

Ejemplo:

User: "¿Cuál es el CEO actual de Twitter?"

LLM (entrenado hasta 2023): "Jack Dorsey"
→ Incorrecto (Elon Musk compró Twitter en 2022)

Por qué ocurre:

  • Fecha de corte de entrenamiento (ej: GPT-4 hasta Sep 2023)
  • Mundo real cambia constantemente
  • Re-entrenar modelo es costoso y lento

Problema 3: Sin acceso a datos privados

Ejemplo:

User: "¿Qué dice el manual interno sobre la política de vacaciones?"

LLM: "No tengo acceso a documentos internos de tu empresa."
→ Respuesta correcta pero no útil

Por qué ocurre:

  • LLM fue entrenado con datos públicos (web, libros)
  • No tiene acceso a:
    • Documentos internos de empresas
    • Bases de datos privadas
    • Archivos personales

Problema 4: Límite de contexto

Ejemplo:

User: "Resume estos 100 PDFs sobre regulaciones financieras"

LLM: [Error] "El contexto supera el límite de 128K tokens"

Por qué ocurre:

  • LLMs tienen límite de contexto (ej: GPT-4 Turbo = 128K tokens)
  • 100 PDFs pueden ser 1M+ tokens
  • No puedes enviar todo al LLM

Solución tradicional: Fine-tuning

¿Qué es?
Re-entrenar el LLM con tus datos específicos.

Limitaciones:

  1. Costo: $1000+ por fine-tuning (modelos grandes)
  2. Tiempo: Horas/días de entrenamiento
  3. Desactualización: Si datos cambian, re-entrenar
  4. Hallucinations: Sigue ocurriendo (solo reduce frecuencia)

Solución moderna: RAG

Idea clave:
En lugar de re-entrenar el LLM, dale acceso a búsqueda en tiempo real.

Flujo:

1. User pregunta: "¿Qué dice el manual sobre vacaciones?"

2. Sistema busca en documentos internos (semantic search)
   → Encuentra 5 secciones relevantes

3. Sistema envía pregunta + contexto al LLM:
   "Contexto: [5 secciones del manual]
    Pregunta: ¿Qué dice sobre vacaciones?"

4. LLM genera respuesta basada en contexto
   → Respuesta precisa (no inventa)

Comparación: Con y sin RAG

Sin RAG (LLM puro):

User: "¿Cómo configuro Pinecone para producción?"

LLM: "Para configurar Pinecone en producción, debes:
1. Crear un índice con dimensión correcta
2. Configurar sharding
3. Ajustar throughput
..."

Problema: Respuesta genérica (puede estar desactualizada)

Con RAG:

User: "¿Cómo configuro Pinecone para producción?"

Sistema:
1. Busca en docs de Pinecone (semantic search)
   → Encuentra guía oficial de setup (actualizada)

2. Envía al LLM:
   Contexto: [Guía oficial de Pinecone]
   Pregunta: ¿Cómo configuro para producción?

LLM: "Según la documentación oficial de Pinecone:
1. Crea un índice con 'pod_type=p1' para producción
2. Configura 'replicas=3' para alta disponibilidad
3. Usa 'metric=cosine' para embeddings de OpenAI
..."

Resultado: Respuesta precisa y actualizada ✅

Ventajas de RAG

  1. Elimina hallucinations (respuestas basadas en documentos reales)
  2. Siempre actualizado (búsqueda en docs actuales)
  3. Acceso a datos privados (busca en tus documentos)
  4. No requiere re-entrenamiento (agregar docs = actualizar índice)
  5. Explicable (puedes ver qué docs usó)

Limitaciones de RAG

(Las veremos en profundidad en cápsula 06)

  1. Latencia mayor (búsqueda + generación)
  2. Dependencia de búsqueda (si búsqueda falla, respuesta incorrecta)
  3. Costo por query (embedding + LLM)
  4. Límite de contexto (solo top-K docs caben en prompt)

Resumen

Puntos clave:

  • Problemas de LLMs: Hallucinations, desactualización, sin datos privados
  • Fine-tuning: Costoso, lento, sigue alucinando
  • RAG: Búsqueda en tiempo real + LLM = Respuestas precisas
  • Ventajas: No hallucinations, actualizado, acceso a privados

Próxima cápsula: 03-rag-architecture.md — Componentes y flujos de RAG.