Módulo 2: Espacios Vectoriales

1. Introducción al Módulo: Espacios Vectoriales - El Universo del Significado

Descripción

Este es el módulo donde pasas de entender vectores individuales (Módulo 1) a entender el espacio donde viven todos los vectores: el espacio vectorial. Si en Módulo 1 aprendiste qué es un punto en el mapa, aquí aprendes qué es el mapa completo y cómo está estructurado.

Un espacio vectorial es el "universo geométrico" donde cada palabra, documento o concepto tiene una ubicación única. Entender cómo funciona ese espacio (sus dimensiones, bases, subespacios, transformaciones) es clave para entender cómo los LLMs organizan el significado y cómo semantic search encuentra documentos relevantes.

Este módulo es 100% conceptual (como Módulo 1): no hay código, no hay álgebra lineal formal. Solo intuición geométrica aplicada a espacios de alta dimensión. Cuando termines, entenderás por qué el "embedding space" de un LLM es un espacio estructurado donde la geometría captura relaciones semánticas complejas.


¿Por qué este módulo?

El problema:

Después de Módulo 1, entiendes vectores individuales:

  • Vector("perro") = [0.23, -0.45, ..., -0.34] (1536 números)
  • Vector("gato") = [0.25, -0.43, ..., -0.32] (1536 números)

Pero quedan preguntas:

  • ¿Todos estos vectores "viven" en el mismo "lugar"?
  • ¿Qué define ese "lugar"? ¿Por qué tiene 1536 dimensiones y no 500 o 5000?
  • ¿Hay "regiones" del espacio con significado especial? (ej: ¿todos los animales están en una zona?)
  • ¿Cómo visualizamos 1536D si solo podemos dibujar 2D/3D?

Este módulo responde esas preguntas. Verás que todos los vectores viven en un espacio vectorial estructurado, con dimensiones, ejes, subespacios, y propiedades geométricas que capturan significado.


La intuición clave del módulo:

"Un espacio vectorial es el universo geométrico donde cada concepto tiene una ubicación única. La geometría de ese espacio (distancias, direcciones, regiones) refleja la estructura del significado."

Analogía: Si vectores son "casas" en una ciudad, el espacio vectorial es la ciudad completa: sus calles (ejes), sus barrios (subespacios), su extensión (dimensiones). Entender la ciudad te permite navegar entre casas (semantic search), encontrar barrios temáticos (clustering), y transformar mapas (proyecciones 2D).


Objetivos del Módulo

Al completar este módulo, serás capaz de:

  1. Explicar qué es un espacio vectorial (el "contenedor" donde viven todos los vectores)
  2. Entender bases y dimensiones (cómo los ejes estructuran el espacio)
  3. Identificar subespacios (regiones del espacio con propiedades especiales)
  4. Comprender proyecciones (cómo reducir 1536D a 2D para visualizar)
  5. Aplicar normalización (por qué hacer que todos los vectores tengan magnitud 1)
  6. Razonar sobre espacios semánticos (cómo LLMs organizan significado geométricamente)
  7. Visualizar espacios complejos (usar proyecciones, analogías, abstracciones)

Competencia clave ganada: Entenderás que el "embedding space" de un LLM no es un conjunto aleatorio de vectores, sino un espacio estructurado donde la geometría (distancias, direcciones, regiones) captura relaciones semánticas complejas.


Roadmap del módulo: las 7 cápsulas

#CápsulaQué verásQué ganarásDuración aprox.
01Introducción al móduloRoadmap completo, por qué espacios vectoriales importanVisión general del módulo15 min
02¿Qué es un espacio vectorial?Definición intuitiva, axiomas básicos sin formalismo excesivoConcepto de "universo de vectores"20 min
03Bases y dimensionesEjes como "direcciones puras", dimensionalidad como capacidadEntender qué define el "tamaño" del espacio25 min
04Subespacios y proyeccionesRegiones temáticas, reducción dimensional (t-SNE, UMAP conceptual)Visualizar alta dimensión en 2D/3D25 min
05Normalización y transformacionesPor qué magnitud = 1, rotaciones, traslaciones conceptualesOperaciones que preservan o cambian significado20 min
06Espacios semánticos en AICómo LLMs organizan significado, clusters, direcciones semánticasAplicación directa a embeddings25 min
07Ejercicio integradorDiseñar un espacio vectorial 2D para conceptos, identificar subespaciosConsolidar intuición con práctica30 min

Total: ~2.5 horas


Conexión con Módulo 1

En Módulo 1 aprendiste:

  • ✅ Qué es un vector (dirección + magnitud)
  • ✅ Cómo visualizarlo (2D, 3D, alta dimensión)
  • ✅ Cómo operarlo (suma, resta, escalado)
  • ✅ Por qué AI usa vectores (semantic search, embeddings)

En Módulo 2 ampliarás:

  • 🎯 De "un vector" → "todos los vectores juntos" (el espacio)
  • 🎯 De "coordenadas" → "ejes y bases" (qué definen las coordenadas)
  • 🎯 De "cercanía" → "estructura del espacio" (subespacios, regiones)
  • 🎯 De "intuición 2D" → "proyecciones desde 1536D" (reducción dimensional)

Analogía: Módulo 1 te enseñó a leer un mapa (coordenadas, distancias). Módulo 2 te enseña cómo está construido el mapa (proyección geográfica, meridianos, paralelos, regiones, escalas).


Orden pedagógico: cómo está estructurado el módulo

Cápsulas 02-03: Fundamentos abstractos

Cápsula 02 (Qué es un espacio vectorial):

  • Definición intuitiva sin formalismo excesivo
  • Axiomas básicos (suma, escalado) en lenguaje simple
  • Ejemplos: espacio 2D, espacio 1536D

Cápsula 03 (Bases y dimensiones):

  • Qué son "ejes" (bases del espacio)
  • Por qué 1536D tiene 1536 ejes
  • Independencia lineal (concepto sin álgebra pesada)

Objetivo: Entender la estructura formal (pero intuitiva) del espacio.


Cápsulas 04-05: Operaciones y transformaciones

Cápsula 04 (Subespacios y proyecciones):

  • Subespacios como "regiones temáticas" (todos los animales, todos los vehículos)
  • Proyecciones: cómo reducir 1536D a 2D (t-SNE, UMAP, PCA conceptual)
  • Por qué proyecciones pierden información pero preservan intuición

Cápsula 05 (Normalización y transformaciones):

  • Por qué normalizar (magnitud = 1, solo dirección importa)
  • Rotaciones y traslaciones (transformar el espacio)
  • Qué operaciones preservan significado y cuáles no

Objetivo: Ver cómo operamos y visualizamos espacios de alta dimensión.


Cápsulas 06-07: Aplicación a AI y práctica

Cápsula 06 (Espacios semánticos en AI):

  • Cómo LLMs organizan el "embedding space"
  • Clusters semánticos (animales, vehículos, emociones)
  • Direcciones semánticas (género, tamaño, tiempo)
  • Por qué rey - hombre + mujer = reina funciona (geometría del espacio)

Cápsula 07 (Ejercicio integrador):

  • Diseñar un espacio 2D para conceptos
  • Identificar subespacios (regiones temáticas)
  • Proyectar conceptos 3D a 2D
  • Reflexionar sobre cómo escala a 1536D

Objetivo: Aplicar todo conceptualmente y consolidar intuición.


Qué NO verás en este módulo

Para mantener el enfoque conceptual (sin sobrecarga técnica), este módulo NO cubre:

  • Álgebra lineal formal: No verás matrices, determinantes, autovalores, SVD matemático
  • Código: No implementarás proyecciones ni transformaciones (eso es para guías posteriores)
  • Detalles de modelos: No verás cómo BERT o GPT construyen su espacio internamente (eso es Guía #6)
  • Vector databases: No verás índices HNSW, IVF, etc. (eso es Módulo 4 y Guía #7)

Esto es 100% conceptual: Geometría del espacio, intuición de estructura, visualización sin implementación.


Prerrequisitos

Conocimientos previos:

  • Módulo 1 completo: Qué es un vector, operaciones básicas, por qué AI usa vectores
  • Geometría 2D/3D: Saber dibujar puntos en un plano cartesiano
  • Matemática básica: Suma, resta, raíz cuadrada

No necesitas:

  • ❌ Álgebra lineal (no usaremos matrices ni determinantes)
  • ❌ Programación (no hay código en este módulo)
  • ❌ Experiencia con PCA, t-SNE, UMAP (lo veremos conceptualmente)

Nivel: Fundacional. Si completaste Módulo 1 y puedes explicar qué es un vector, estás listo.


Diferenciadores de este módulo

vs Cursos de álgebra lineal tradicionales:

AspectoCursos tradicionalesEste módulo
EnfoqueAxiomas formales, espacios abstractosIntuición geométrica con aplicación a AI
ContextoMatemática puraEmbeddings, semantic search, RAG
CódigoImplementaciones NumPy/SciPyNO hay código (solo conceptos)
VisualizaciónPocas imágenesMuchos diagramas, proyecciones 2D
EjerciciosCálculos con matricesDiseño conceptual, reflexión

Promesa única: Terminar entendiendo cómo LLMs organizan significado geométricamente, sin escribir código ni resolver ecuaciones matriciales.


Conexión con semantic search y RAG

Todo lo que verás en este módulo se usa directamente en semantic search y RAG:

1. Espacio vectorial = Embedding space

Cuando usas OpenAI text-embedding-3-small, cada texto se mapea a un punto en un espacio vectorial de 1536D. Ese espacio tiene:

  • Dimensiones: 1536 ejes (Cápsula 03)
  • Estructura: Regiones semánticas (animales, vehículos, emociones) (Cápsula 06)
  • Operaciones: Normalización (magnitud 1), proyecciones (visualización) (Cápsulas 04-05)

2. Subespacios = Clusters semánticos

En el embedding space, hay "regiones" temáticas:

  • Todos los animales están en un subespacio
  • Todos los vehículos están en otro subespacio
  • Palabras sobre emociones están en otro subespacio

Semantic search explota esa estructura: Buscar "animal doméstico" encuentra vectores en el subespacio de animales.


3. Proyecciones = Visualización de embeddings

Cuando ves visualizaciones de embeddings (ej: blogs, papers), son proyecciones de 1536D a 2D (t-SNE, UMAP). Entender proyecciones (Cápsula 04) te permite interpretar esas visualizaciones sin pensar que "pierdes información crítica" (sí pierdes info, pero la intuición se preserva).


4. Normalización = Similaridad coseno

Cuando usas similaridad coseno (Módulo 3), internamente estás normalizando vectores (magnitud = 1) para que solo importe la dirección. Entender normalización (Cápsula 05) te explica por qué coseno es superior a distancia euclidiana en alta dimensión.


Ejemplos concretos que entenderás después del módulo

Al terminar Módulo 2, podrás responder preguntas como:

P1: ¿Por qué los embeddings de OpenAI son 1536D y no 500D o 5000D?

R: Porque 1536D es el tamaño del espacio vectorial que OpenAI eligió (balance entre capacidad y cómputo). Más dimensiones = más capacidad para capturar matices, pero más costo. Entenderás que la dimensionalidad es una decisión de arquitectura del modelo.


P2: ¿Por qué las visualizaciones t-SNE de embeddings se ven "agrupadas"?

R: Porque t-SNE proyecta el espacio de 1536D a 2D preservando cercanías locales. Los clusters que ves (animales juntos, vehículos juntos) reflejan la estructura del espacio original (subespacios semánticos). Entenderás que es una proyección, no el espacio real.


P3: ¿Por qué normalizar embeddings antes de calcular similaridad?

R: Porque en alta dimensión, la magnitud puede ser ruido (depende de frecuencia de palabras, no de significado). Normalizar (magnitud = 1) elimina ese ruido y hace que solo importe la dirección (qué tipo de concepto es, no cuán "grande" es el vector).


P4: ¿Qué significa "el embedding space de GPT-4 tiene estructura semántica"?

R: Significa que no es un conjunto aleatorio de vectores; hay regiones (subespacios) donde conceptos relacionados se agrupan, y direcciones (ej: género, tamaño) que capturan relaciones. Esa estructura geométrica refleja estructura semántica del lenguaje.


Mapa conceptual del módulo

MÓDULO 2: Espacios Vectoriales
│
├─ 02. ¿Qué es un espacio vectorial?
│   ├─ Definición intuitiva (universo de vectores)
│   ├─ Axiomas básicos (suma, escalado)
│   └─ Ejemplos: espacio 2D, 1536D
│
├─ 03. Bases y dimensiones
│   ├─ Ejes como "direcciones puras"
│   ├─ Dimensionalidad = cantidad de ejes
│   └─ Independencia lineal (concepto simple)
│
├─ 04. Subespacios y proyecciones
│   ├─ Subespacios = regiones temáticas
│   ├─ Proyecciones: 1536D → 2D (t-SNE, UMAP)
│   └─ Qué se pierde y qué se preserva
│
├─ 05. Normalización y transformaciones
│   ├─ Normalización (magnitud = 1)
│   ├─ Rotaciones, traslaciones
│   └─ Qué preserva significado
│
├─ 06. Espacios semánticos en AI
│   ├─ Cómo LLMs organizan el embedding space
│   ├─ Clusters y direcciones semánticas
│   └─ Por qué `rey - hombre + mujer = reina`
│
└─ 07. Ejercicio integrador
    ├─ Diseñar espacio 2D para conceptos
    ├─ Identificar subespacios
    └─ Proyectar y reflexionar

Cómo usar este módulo

Orden recomendado:

  1. Lee Cápsula 01 (esta) — 15 min para entender el roadmap
  2. Trabaja Cápsulas 02-06 en orden — No te saltes; cada una construye sobre la anterior
  3. Dedica tiempo al Ejercicio Integrador (Cápsula 07) — Consolida TODO
  4. Revisa recursos adicionales si quieres profundizar (opcional)

Herramientas recomendadas:

  • Papel y lápiz — Para dibujar espacios 2D, subespacios, proyecciones
  • Embedding Projector de TensorFlow (opcional) — Para ver proyecciones reales de embeddings
  • GeoGebra 3D (opcional) — Para visualizar subespacios en 3D

No necesitas instalar nada. Todo funciona con lápiz y papel.


Estrategia de estudio:

Sesión 1 (1 hora): Cápsulas 02-03 (fundamentos: espacio, bases, dimensiones)

Sesión 2 (1 hora): Cápsulas 04-05 (operaciones: subespacios, proyecciones, normalización)

Sesión 3 (30 min): Cápsula 06 (aplicación: espacios semánticos en AI)

Sesión 4 (30 min): Cápsula 07 (ejercicio integrador)

No lo hagas todo en una sesión. La intuición de "espacio" es más abstracta que "vector"; necesita tiempo para asentar.


Criterios de éxito

Sabrás que completaste el módulo exitosamente si puedes:

  1. ✅ Explicar qué es un espacio vectorial (universo donde viven todos los vectores)
  2. ✅ Dibujar un espacio 2D con ejes y explicar qué representan
  3. ✅ Identificar un subespacio en un diagrama (ej: todos los puntos en una recta)
  4. ✅ Explicar por qué proyecciones (t-SNE) pierden información pero preservan intuición
  5. ✅ Justificar por qué normalizar embeddings (eliminar ruido de magnitud)
  6. ✅ Describir cómo LLMs organizan significado geométricamente (clusters, direcciones)
  7. ✅ Reflexionar sobre cómo alta dimensión (1536D) permite capturar relaciones complejas

Test rápido: Si puedes explicar "¿Por qué el embedding space de un LLM tiene 'estructura semántica'?" sin dudar, estás listo para Módulo 3.


Errores comunes al aprender espacios vectoriales

Error 1: "Espacio vectorial es solo un conjunto de vectores"

Realidad: Un espacio vectorial tiene estructura: dimensiones, ejes, operaciones cerradas (suma, escalado). No es cualquier conjunto de vectores; tiene propiedades geométricas y algebraicas específicas.


Error 2: "No puedo entender espacios sin ver matrices"

Realidad: Puedes entender espacios conceptualmente sin matrices. Matrices son herramientas para calcular en espacios; no son los espacios mismos. Este módulo usa geometría pura, no matrices.


Error 3: "Proyecciones (t-SNE) son el espacio real"

Realidad: Proyecciones 2D son aproximaciones del espacio 1536D. Preservan cercanías locales pero pierden información global. Son útiles para visualizar, no para razonar matemáticamente.


Error 4: "Normalización cambia el significado del vector"

Realidad: Normalización no cambia la dirección (el "tipo de concepto"). Solo cambia la magnitud. Si la magnitud es ruido (frecuencias), normalizar mejora la representación.


Recursos complementarios

Durante el módulo:


Después del módulo:


Próximo Módulo

Módulo 3: Similaridad y Distancia — Formalizarás cómo medir "cercanía" entre vectores:

  • Distancia euclidiana vs coseno
  • Cuándo usar cada métrica
  • Por qué coseno es superior en alta dimensión
  • Cómo calcular similaridad eficientemente

Prerrequisito: Haber completado Módulos 1-2. Si no entiendes qué es un espacio vectorial o cómo se estructura, Módulo 3 será confuso (habla de "ángulos entre vectores" y "normalización", conceptos de Módulo 2).


FAQs

P: ¿Necesito álgebra lineal para este módulo?
R: No. Este módulo usa geometría intuitiva, no álgebra formal. Si completaste Módulo 1, tienes todo lo necesario.

P: ¿Puedo saltarme este módulo si ya sé vectores (Módulo 1)?
R: No recomendado. Módulo 1 te enseña vectores individuales; Módulo 2 te enseña cómo todos los vectores forman un espacio estructurado. Esa intuición es crucial para Módulos 3-8.

P: ¿Este módulo cubre PCA, t-SNE, UMAP técnicamente?
R: No. Lo veremos conceptualmente (qué hacen, por qué son útiles) sin implementación. El código viene en guías posteriores.

P: ¿Cuánto tiempo debo dedicarle?
R: 2-2.5 horas distribuidas en 2-4 sesiones. No lo hagas todo de corrido; la intuición de "espacio" necesita tiempo para asentar.

P: ¿Qué pasa si no entiendo Cápsula 03 (bases y dimensiones)?
R: Es la cápsula más abstracta. Si te trabas, sigue con Cápsulas 04-06 (aplicaciones) y regresa a 03 después. A veces ver aplicaciones ayuda a entender teoría.

P: ¿Hay ejercicios con respuestas?
R: Sí. Cada cápsula tiene ejercicios con soluciones. El Ejercicio Integrador (Cápsula 07) es el más completo.


Notas finales

Este módulo amplía tu intuición de "vectores" a "espacios de vectores". Es un salto conceptual (de puntos individuales a universos completos), pero es esencial para entender cómo LLMs organizan significado y cómo semantic search navega ese significado.

Intuición clave a consolidar:

"El embedding space no es un conjunto aleatorio de puntos; es un universo geométrico estructurado donde regiones capturan temas (animales, vehículos) y direcciones capturan relaciones (género, tamaño). Semantic search navega ese universo usando distancia/similaridad."

Si solo haces una cosa en este módulo: Completa el Ejercicio Integrador (Cápsula 07). Diseñar un espacio 2D para conceptos, identificar subespacios, y reflexionar sobre cómo escala a 1536D consolidará TODO.

¡Disfruta el módulo! La geometría de espacios vectoriales es elegante y poderosa. Cuando termines, verás embeddings no como "listas de números" sino como "puntos en un universo geométrico que refleja significado".


Próxima cápsula: 02-what-is-a-vector-space.md — Definición intuitiva, axiomas básicos, ejemplos 2D y 1536D.