Módulo 2: Espacios Vectoriales

4. Subespacios y Proyecciones: Regiones y Visualización

Descripción de la cápsula

En esta cápsula vas a entender subespacios (regiones del espacio con propiedades especiales) y proyecciones (cómo reducir 1536D a 2D para visualizar). Estos conceptos son fundamentales para interpretar visualizaciones de embeddings y entender clustering semántico.


¿Qué es un subespacio?

Un subespacio es una "región" del espacio que es, en sí misma, un espacio vectorial.

Analogía: Si el espacio 3D es una habitación, un subespacio puede ser:

  • Una pared (espacio 2D dentro de 3D)
  • El suelo (espacio 2D dentro de 3D)
  • Una línea recta (espacio 1D dentro de 3D)

Ejemplos de subespacios

En 2D:

Subespacio 1D (una recta):

Todos los vectores de la forma [t, t] donde t es cualquier número

Ejemplos: [1,1], [2,2], [-3,-3], [0,0]

Visualización:

      ↑ Y
      |
    3 |     •[3,3]
      |    ╱
    2 |   •[2,2]
      |  ╱
    1 | •[1,1]
      |╱
    0 •─────────→ X
      0  1  2  3

Es un subespacio porque:

  • Si sumas dos vectores de la forma [t,t], el resultado sigue siendo [t,t] ✅
  • Si escalas [t,t], el resultado sigue siendo [s×t, s×t] ✅

En 3D:

Subespacio 2D (un plano):

Todos los vectores de la forma [x, y, 0] (plano XY)

Ejemplos: [2,3,0], [-1,5,0], [0,0,0]

Es un subespacio (el plano XY dentro del espacio 3D).


Subespacios en espacios semánticos

En el embedding space de 1536D, hay subespacios semánticos:

Subespacio de "animales":

  • Todos los vectores de palabras relacionadas con animales
  • "perro", "gato", "león", "tigre" están en esta región

Subespacio de "vehículos":

  • Todos los vectores de palabras relacionadas con transporte
  • "auto", "avión", "barco" están en esta región

Uso en AI: Clustering explota subespacios. Si buscas "animal", encuentras vectores en el subespacio de animales.


Proyecciones: De 1536D a 2D

Una proyección es una transformación que reduce dimensionalidad:

Vector 1536D → Proyección → Vector 2D

Objetivo: Visualizar alta dimensión en 2D/3D (dibujable).


Técnicas de proyección

1. PCA (Principal Component Analysis)

Qué hace: Encuentra los 2-3 ejes más importantes y proyecta sobre ellos.

Ventaja: Rápido, determinístico.

Desventaja: Lineal (puede perder estructura no-lineal).


2. t-SNE (t-Distributed Stochastic Neighbor Embedding)

Qué hace: Proyecta preservando cercanías locales (puntos cercanos en 1536D quedan cerca en 2D).

Ventaja: Preserva clusters (agrupaciones).

Desventaja: No preserva distancias globales (puntos lejanos pueden quedar cerca).


3. UMAP (Uniform Manifold Approximation and Projection)

Qué hace: Similar a t-SNE pero más rápido y preserva más estructura global.

Ventaja: Balance entre velocidad y calidad.

Desventaja: No es perfecto (sigue siendo una aproximación).


Qué se pierde y qué se preserva

En proyección 1536D → 2D:

Se preserva (aproximadamente):

  • Cercanías locales (puntos cercanos siguen cerca)
  • Clusters (agrupaciones)
  • Intuición de "similaridad"

Se pierde:

  • Distancias exactas
  • Información de 1534 dimensiones
  • Relaciones globales complejas

Conclusión: Proyecciones son útiles para visualizar intuición, no para calcular matemáticamente.


Interpretación de visualizaciones

Cuando veas un diagrama t-SNE de embeddings:

Lo que ves:

  • Clusters (animales juntos, vehículos juntos)
  • Cercanía relativa

Lo que NO ves:

  • Distancias exactas (1536D comprimido en 2D)
  • Estructura completa del espacio original

Cómo interpretar:

  • Puntos cercanos en 2D → Probablemente cercanos en 1536D ✅
  • Puntos lejanos en 2D → ¿Lejanos en 1536D? Tal vez ⚠️

Resumen

Puntos clave:

  • Subespacio: Región del espacio que es, en sí misma, un espacio vectorial
  • Subespacios semánticos: Regiones temáticas (animales, vehículos, emociones)
  • Proyección: Reducir dimensionalidad (1536D → 2D) para visualizar
  • Técnicas: PCA, t-SNE, UMAP (cada una con trade-offs)
  • Preserva: Cercanías locales, clusters, intuición
  • Pierde: Distancias exactas, información de dimensiones eliminadas

Próxima cápsula: 05-normalization-and-transformations.md — Por qué magnitud = 1, operaciones que preservan significado.