Módulo 2: Espacios Vectoriales
4. Subespacios y Proyecciones: Regiones y Visualización
Descripción de la cápsula
En esta cápsula vas a entender subespacios (regiones del espacio con propiedades especiales) y proyecciones (cómo reducir 1536D a 2D para visualizar). Estos conceptos son fundamentales para interpretar visualizaciones de embeddings y entender clustering semántico.
¿Qué es un subespacio?
Un subespacio es una "región" del espacio que es, en sí misma, un espacio vectorial.
Analogía: Si el espacio 3D es una habitación, un subespacio puede ser:
- Una pared (espacio 2D dentro de 3D)
- El suelo (espacio 2D dentro de 3D)
- Una línea recta (espacio 1D dentro de 3D)
Ejemplos de subespacios
En 2D:
Subespacio 1D (una recta):
Todos los vectores de la forma [t, t] donde t es cualquier número
Ejemplos: [1,1], [2,2], [-3,-3], [0,0]
Visualización:
↑ Y
|
3 | •[3,3]
| ╱
2 | •[2,2]
| ╱
1 | •[1,1]
|╱
0 •─────────→ X
0 1 2 3
Es un subespacio porque:
- Si sumas dos vectores de la forma [t,t], el resultado sigue siendo [t,t] ✅
- Si escalas [t,t], el resultado sigue siendo [s×t, s×t] ✅
En 3D:
Subespacio 2D (un plano):
Todos los vectores de la forma [x, y, 0] (plano XY)
Ejemplos: [2,3,0], [-1,5,0], [0,0,0]
Es un subespacio (el plano XY dentro del espacio 3D).
Subespacios en espacios semánticos
En el embedding space de 1536D, hay subespacios semánticos:
Subespacio de "animales":
- Todos los vectores de palabras relacionadas con animales
- "perro", "gato", "león", "tigre" están en esta región
Subespacio de "vehículos":
- Todos los vectores de palabras relacionadas con transporte
- "auto", "avión", "barco" están en esta región
Uso en AI: Clustering explota subespacios. Si buscas "animal", encuentras vectores en el subespacio de animales.
Proyecciones: De 1536D a 2D
Una proyección es una transformación que reduce dimensionalidad:
Vector 1536D → Proyección → Vector 2D
Objetivo: Visualizar alta dimensión en 2D/3D (dibujable).
Técnicas de proyección
1. PCA (Principal Component Analysis)
Qué hace: Encuentra los 2-3 ejes más importantes y proyecta sobre ellos.
Ventaja: Rápido, determinístico.
Desventaja: Lineal (puede perder estructura no-lineal).
2. t-SNE (t-Distributed Stochastic Neighbor Embedding)
Qué hace: Proyecta preservando cercanías locales (puntos cercanos en 1536D quedan cerca en 2D).
Ventaja: Preserva clusters (agrupaciones).
Desventaja: No preserva distancias globales (puntos lejanos pueden quedar cerca).
3. UMAP (Uniform Manifold Approximation and Projection)
Qué hace: Similar a t-SNE pero más rápido y preserva más estructura global.
Ventaja: Balance entre velocidad y calidad.
Desventaja: No es perfecto (sigue siendo una aproximación).
Qué se pierde y qué se preserva
En proyección 1536D → 2D:
Se preserva (aproximadamente):
- Cercanías locales (puntos cercanos siguen cerca)
- Clusters (agrupaciones)
- Intuición de "similaridad"
Se pierde:
- Distancias exactas
- Información de 1534 dimensiones
- Relaciones globales complejas
Conclusión: Proyecciones son útiles para visualizar intuición, no para calcular matemáticamente.
Interpretación de visualizaciones
Cuando veas un diagrama t-SNE de embeddings:
Lo que ves:
- Clusters (animales juntos, vehículos juntos)
- Cercanía relativa
Lo que NO ves:
- Distancias exactas (1536D comprimido en 2D)
- Estructura completa del espacio original
Cómo interpretar:
- Puntos cercanos en 2D → Probablemente cercanos en 1536D ✅
- Puntos lejanos en 2D → ¿Lejanos en 1536D? Tal vez ⚠️
Resumen
Puntos clave:
- Subespacio: Región del espacio que es, en sí misma, un espacio vectorial
- Subespacios semánticos: Regiones temáticas (animales, vehículos, emociones)
- Proyección: Reducir dimensionalidad (1536D → 2D) para visualizar
- Técnicas: PCA, t-SNE, UMAP (cada una con trade-offs)
- Preserva: Cercanías locales, clusters, intuición
- Pierde: Distancias exactas, información de dimensiones eliminadas
Próxima cápsula: 05-normalization-and-transformations.md — Por qué magnitud = 1, operaciones que preservan significado.