Módulo 3: Similaridad y Distancia
1. Introducción al Módulo: Similaridad y Distancia - Medir Cercanía en el Espacio
Descripción
Este es el módulo donde formalizas cómo medir cercanía entre vectores. Hasta ahora sabes qué son vectores (Módulo 1) y cómo forman espacios estructurados (Módulo 2). Ahora verás cómo cuantificar "qué tan cercanos" están dos vectores, qué significa "similaridad", y cuándo usar cada métrica.
Este módulo es el corazón matemático de semantic search: la "búsqueda de vectores cercanos" requiere una definición precisa de "cercano". Verás tres métricas principales (euclidiana, Manhattan, coseno) y aprenderás que coseno es superior en alta dimensión para embeddings.
Enfoque: 60% teoría conceptual con fórmulas simples, 40% ejercicios numéricos. NO hay código, pero sí cálculos manuales (con calculadora está bien). Cuando termines, entenderás por qué casi todos los sistemas de semantic search usan similaridad coseno.
Tiempo estimado: 2-2.5 horas
Objetivos del Módulo
Al completar este módulo, serás capaz de:
- Calcular distancia euclidiana (línea recta entre puntos)
- Calcular distancia Manhattan (camino en cuadrícula)
- Calcular similaridad coseno (ángulo entre vectores)
- Comparar métricas (cuándo usar cada una)
- Justificar por qué coseno es mejor en alta dimensión
- Aplicar métricas a semantic search (medir relevancia)
- Interpretar valores de similaridad (qué significa 0.85 vs 0.92)
Competencia clave ganada: Entenderás que semantic search no es solo "buscar vectores cercanos" sino "buscar vectores con alta similaridad coseno" (dirección similar, magnitud irrelevante).
Roadmap del módulo: las 7 cápsulas
| # | Cápsula | Qué verás | Duración |
|---|---|---|---|
| 01 | Introducción al módulo | Por qué medir similaridad, overview de métricas | 15 min |
| 02 | Distancia euclidiana | Línea recta, fórmula, ejemplos 2D/3D/1536D | 20 min |
| 03 | Manhattan y otras | Distancia Manhattan, Minkowski, casos de uso | 20 min |
| 04 | Similaridad coseno | Ángulo entre vectores, por qué en AI | 30 min |
| 05 | Comparación de métricas | Euclidiana vs coseno, trade-offs | 25 min |
| 06 | Métricas en semantic search | Cómo se usan en producción | 20 min |
| 07 | Ejercicio integrador | Calcular métricas, comparar, decidir | 30 min |
Total: ~2.5 horas
Conexión con Módulos 1-2
Módulo 1: Vectores individuales (qué son, operaciones)
Módulo 2: Espacios vectoriales (estructura, subespacios)
Módulo 3: Medir cercanía (distancia, similaridad)
Flujo lógico:
- Tienes vectores (Módulo 1) ✅
- Viven en un espacio estructurado (Módulo 2) ✅
- ¿Cómo sabes si dos vectores están "cerca"? (Módulo 3) ← Aquí
El problema central
En semantic search:
Query: "animal doméstico"
Documentos:
- Doc 1: Vector [0.23, -0.45, ..., -0.34]
- Doc 2: Vector [0.25, -0.43, ..., -0.32]
- Doc 3: Vector [9.34, 5.21, ..., 7.56]
Pregunta: ¿Cuál documento es más relevante (más "cercano" a la query)?
Necesitas una métrica de cercanía para responder esa pregunta cuantitativamente.
Las tres métricas principales
1. Distancia euclidiana
Qué mide: Línea recta entre dos puntos.
Cuándo usar: Cuando magnitud importa (ej: distancias físicas).
En AI: Usado, pero no óptimo en alta dimensión (todas las distancias se vuelven similares).
2. Distancia Manhattan
Qué mide: Camino en cuadrícula (suma de diferencias en cada eje).
Cuándo usar: Cuando movimiento solo es horizontal/vertical (ej: calles de ciudad).
En AI: Raro en embeddings (euclidiana o coseno son más comunes).
3. Similaridad coseno
Qué mide: Ángulo entre vectores (dirección, no magnitud).
Cuándo usar: Cuando solo importa dirección (ej: embeddings normalizados).
En AI: Métrica estándar para semantic search. Casi todos los sistemas usan coseno.
Por qué coseno es superior en alta dimensión
Problema con euclidiana en alta dimensión:
En 1536D, todas las distancias parecen similares (maldición de la dimensionalidad). Difícil distinguir "cercano" de "lejano".
Ventaja de coseno:
Coseno mide ángulo (dirección), no distancia. En alta dimensión, ángulos se preservan mejor que distancias.
Resultado: Coseno da valores más discriminativos (0.92 vs 0.45 es una diferencia clara).
Visualización del concepto
En 2D (simplificado):
↑
|
•B | •A (A y B tienen direcciones similares, coseno alto)
\|/
•────→
|
|
•C (C tiene dirección muy diferente, coseno bajo)
Distancia euclidiana: A y C pueden estar a distancias similares del origen.
Similaridad coseno: A y B tienen coseno alto (ángulo pequeño). A y C tienen coseno bajo (ángulo grande).
Aplicación directa a semantic search
Query: "perro"
Doc 1: "El perro es un animal doméstico" → Vector cercano (coseno 0.95)
Doc 2: "El can es leal" → Vector cercano (coseno 0.93)
Doc 3: "Los autos tienen ruedas" → Vector lejano (coseno 0.12)
Ranking por coseno:
- Doc 1 (0.95) — Más relevante
- Doc 2 (0.93) — Muy relevante
- Doc 3 (0.12) — No relevante
Sistema retorna Doc 1 y Doc 2.
Qué NO verás en este módulo
Para mantener enfoque conceptual:
- ❌ Código Python/NumPy: No implementarás métricas (eso es para guías posteriores)
- ❌ Optimizaciones: No verás SIMD, GPU, aproximaciones (eso es Módulo 4)
- ❌ Métricas exóticas: Solo euclidiana, Manhattan, coseno (las 3 más usadas)
Criterios de éxito
Sabrás que completaste el módulo si puedes:
- ✅ Calcular distancia euclidiana entre dos vectores 2D/3D
- ✅ Calcular similaridad coseno entre dos vectores 2D/3D
- ✅ Explicar por qué coseno es mejor que euclidiana en alta dimensión
- ✅ Interpretar valores de coseno (0.95 = muy similar, 0.3 = poco similar)
- ✅ Decidir qué métrica usar en un caso de uso dado
- ✅ Aplicar métricas a semantic search (query → vectores → rankear por coseno)
Test rápido: Si puedes explicar "¿Por qué semantic search usa coseno en lugar de euclidiana?" sin dudar, estás listo para Módulo 4.
Próximas cápsulas
Cápsula 02: Distancia euclidiana (fórmula, ejemplos, cuándo usar)
Cápsula 03: Manhattan y otras métricas
Cápsula 04: Similaridad coseno (la métrica clave para AI)
Cápsula 05: Comparación (euclidiana vs coseno)
Cápsula 06: Métricas en semantic search real
Cápsula 07: Ejercicio integrador
Próxima cápsula: 02-euclidean-distance.md — Línea recta, fórmula, cálculos.