Módulo 2: Espacios Vectoriales

6. Espacios Semánticos en AI: Cómo LLMs Organizan Significado

Descripción de la cápsula

En esta cápsula vas a ver cómo los LLMs organizan el embedding space: clusters semánticos (todos los animales juntos), direcciones semánticas (género, tamaño), y por qué operaciones como rey - hombre + mujer = reina funcionan. Esta es la aplicación directa de todo lo que viste en el módulo.


El embedding space como mapa semántico

Cuando un modelo (OpenAI, BERT, GPT) aprende embeddings, el espacio resultante tiene estructura semántica:

1. Clusters (agrupaciones)

Conceptos relacionados se agrupan en regiones:

Región 1 (Animales domésticos):
- "perro", "gato", "hamster"

Región 2 (Animales salvajes):
- "león", "tigre", "elefante"

Región 3 (Vehículos):
- "auto", "avión", "barco"

Visualización conceptual (2D simplificado):

        ↑
        |
   •gato •perro    (Cluster: animales domésticos)
        |
        |     •león •tigre  (Cluster: animales salvajes)
        |
        |────────────────→
        |
        |  •auto •avión    (Cluster: vehículos)
        |

2. Direcciones semánticas

Hay "direcciones" en el espacio que capturan relaciones:

Dirección género:

Vector("rey") - Vector("hombre") ≈ Vector("reina") - Vector("mujer")

Esa "dirección" captura el concepto de "género masculino → femenino".


Dirección tamaño:

Vector("elefante") - Vector("ratón") ≈ "dirección de tamaño"

Dirección tiempo:

Vector("correr") - Vector("corrió") ≈ "dirección presente → pasado"

Por qué rey - hombre + mujer = reina funciona

Paso 1: rey - hombre captura "realeza sin género masculino"

rey = [realeza + masculino]
hombre = [masculino]

rey - hombre ≈ [realeza]

Paso 2: + mujer añade "género femenino"

[realeza] + [femenino] ≈ [realeza + femenino] ≈ reina

Geometría:

        Realeza ↑
                |
    reina •     | • rey
                |
    mujer •     | • hombre
                |───────→ Género

La "dirección género" es horizontal. La operación rey - hombre + mujer navega esa dirección.


Subespacios semánticos

En el embedding space de 1536D, hay subespacios que capturan temas:

Subespacio "animales":

  • Dimensiones que capturan "animalidad", "tamaño", "hábitat"
  • Todos los animales tienen valores altos en esas dimensiones

Subespacio "emociones":

  • Dimensiones que capturan "valencia" (positivo/negativo), "intensidad"
  • Todas las emociones tienen valores altos en esas dimensiones

Uso en semantic search: Cuando buscas "animal doméstico", el sistema busca en el subespacio de animales.


Cómo se forma esa estructura

Durante el entrenamiento:

  1. El modelo ve millones de frases
  2. Ajusta vectores para que palabras en contextos similares queden cerca
  3. Resultado: Estructura emerge naturalmente (no es programada manualmente)

Analogía: Es como aprender un idioma. No memorizas reglas; después de escuchar millones de frases, tu cerebro organiza palabras por temas y relaciones automáticamente.


Aplicaciones en AI Engineering

1. Semantic search con filtros temáticos

Query: "animal rápido"
→ Buscar en subespacio de animales
→ Filtrar por alta velocidad
→ Resultado: "guepardo", "halcón"

2. Clustering automático

Agrupar documentos por tema usando la estructura del espacio:

Cluster 1: Documentos en subespacio "tecnología"
Cluster 2: Documentos en subespacio "medicina"

3. Analogías semánticas

Usar direcciones para encontrar analogías:

"Python" es a "programación" como "MySQL" es a ___?

Vector("MySQL") + (Vector("programación") - Vector("Python"))
≈ Vector("bases de datos")

Limitaciones

1. Estructura no es perfecta

Aunque hay clusters y direcciones, no son matemáticamente perfectos. rey - hombre + mujer da un vector cercano a reina, no idéntico.


2. Sesgos en el espacio

Si el texto de entrenamiento tiene sesgos (género, raza), el espacio los reflejará:

Vector("doctor") - Vector("man") + Vector("woman")

A veces da "nurse" en lugar de "doctor" (sesgo histórico en corpus).


3. Polisemia

Embeddings contextuales (BERT, GPT) ayudan, pero "banco" (orilla vs institución) puede tener vectores que se solapan parcialmente.


Resumen

Puntos clave:

  • Clusters: Conceptos relacionados se agrupan (animales, vehículos, emociones)
  • Direcciones: Relaciones capturadas geométricamente (género, tamaño, tiempo)
  • rey - hombre + mujer = reina: Navegar direcciones semánticas
  • Subespacios: Regiones temáticas en alta dimensión
  • Formación: Emerge durante entrenamiento (no programada)
  • Aplicaciones: Semantic search, clustering, analogías
  • Limitaciones: No perfecto, sesgos, polisemia

Próxima cápsula: 07-capstone-exercise-2.md — Diseñar un espacio 2D para conceptos, identificar subespacios.