Módulo 3: Similaridad y Distancia

1. Introducción al Módulo: Similaridad y Distancia - Medir Cercanía en el Espacio

Descripción

Este es el módulo donde formalizas cómo medir cercanía entre vectores. Hasta ahora sabes qué son vectores (Módulo 1) y cómo forman espacios estructurados (Módulo 2). Ahora verás cómo cuantificar "qué tan cercanos" están dos vectores, qué significa "similaridad", y cuándo usar cada métrica.

Este módulo es el corazón matemático de semantic search: la "búsqueda de vectores cercanos" requiere una definición precisa de "cercano". Verás tres métricas principales (euclidiana, Manhattan, coseno) y aprenderás que coseno es superior en alta dimensión para embeddings.

Enfoque: 60% teoría conceptual con fórmulas simples, 40% ejercicios numéricos. NO hay código, pero sí cálculos manuales (con calculadora está bien). Cuando termines, entenderás por qué casi todos los sistemas de semantic search usan similaridad coseno.

Tiempo estimado: 2-2.5 horas


Objetivos del Módulo

Al completar este módulo, serás capaz de:

  1. Calcular distancia euclidiana (línea recta entre puntos)
  2. Calcular distancia Manhattan (camino en cuadrícula)
  3. Calcular similaridad coseno (ángulo entre vectores)
  4. Comparar métricas (cuándo usar cada una)
  5. Justificar por qué coseno es mejor en alta dimensión
  6. Aplicar métricas a semantic search (medir relevancia)
  7. Interpretar valores de similaridad (qué significa 0.85 vs 0.92)

Competencia clave ganada: Entenderás que semantic search no es solo "buscar vectores cercanos" sino "buscar vectores con alta similaridad coseno" (dirección similar, magnitud irrelevante).


Roadmap del módulo: las 7 cápsulas

#CápsulaQué verásDuración
01Introducción al móduloPor qué medir similaridad, overview de métricas15 min
02Distancia euclidianaLínea recta, fórmula, ejemplos 2D/3D/1536D20 min
03Manhattan y otrasDistancia Manhattan, Minkowski, casos de uso20 min
04Similaridad cosenoÁngulo entre vectores, por qué en AI30 min
05Comparación de métricasEuclidiana vs coseno, trade-offs25 min
06Métricas en semantic searchCómo se usan en producción20 min
07Ejercicio integradorCalcular métricas, comparar, decidir30 min

Total: ~2.5 horas


Conexión con Módulos 1-2

Módulo 1: Vectores individuales (qué son, operaciones)
Módulo 2: Espacios vectoriales (estructura, subespacios)
Módulo 3: Medir cercanía (distancia, similaridad)

Flujo lógico:

  1. Tienes vectores (Módulo 1) ✅
  2. Viven en un espacio estructurado (Módulo 2) ✅
  3. ¿Cómo sabes si dos vectores están "cerca"? (Módulo 3) ← Aquí

El problema central

En semantic search:

Query: "animal doméstico"
Documentos:
- Doc 1: Vector [0.23, -0.45, ..., -0.34]
- Doc 2: Vector [0.25, -0.43, ..., -0.32]
- Doc 3: Vector [9.34, 5.21, ..., 7.56]

Pregunta: ¿Cuál documento es más relevante (más "cercano" a la query)?

Necesitas una métrica de cercanía para responder esa pregunta cuantitativamente.


Las tres métricas principales

1. Distancia euclidiana

Qué mide: Línea recta entre dos puntos.

Cuándo usar: Cuando magnitud importa (ej: distancias físicas).

En AI: Usado, pero no óptimo en alta dimensión (todas las distancias se vuelven similares).


2. Distancia Manhattan

Qué mide: Camino en cuadrícula (suma de diferencias en cada eje).

Cuándo usar: Cuando movimiento solo es horizontal/vertical (ej: calles de ciudad).

En AI: Raro en embeddings (euclidiana o coseno son más comunes).


3. Similaridad coseno

Qué mide: Ángulo entre vectores (dirección, no magnitud).

Cuándo usar: Cuando solo importa dirección (ej: embeddings normalizados).

En AI: Métrica estándar para semantic search. Casi todos los sistemas usan coseno.


Por qué coseno es superior en alta dimensión

Problema con euclidiana en alta dimensión:

En 1536D, todas las distancias parecen similares (maldición de la dimensionalidad). Difícil distinguir "cercano" de "lejano".

Ventaja de coseno:

Coseno mide ángulo (dirección), no distancia. En alta dimensión, ángulos se preservan mejor que distancias.

Resultado: Coseno da valores más discriminativos (0.92 vs 0.45 es una diferencia clara).


Visualización del concepto

En 2D (simplificado):

        ↑
        |
    •B  | •A    (A y B tienen direcciones similares, coseno alto)
       \|/
        •────→
        |
        |
        •C     (C tiene dirección muy diferente, coseno bajo)

Distancia euclidiana: A y C pueden estar a distancias similares del origen.

Similaridad coseno: A y B tienen coseno alto (ángulo pequeño). A y C tienen coseno bajo (ángulo grande).


Aplicación directa a semantic search

Query: "perro"
Doc 1: "El perro es un animal doméstico"  → Vector cercano (coseno 0.95)
Doc 2: "El can es leal"                   → Vector cercano (coseno 0.93)
Doc 3: "Los autos tienen ruedas"          → Vector lejano (coseno 0.12)

Ranking por coseno:

  1. Doc 1 (0.95) — Más relevante
  2. Doc 2 (0.93) — Muy relevante
  3. Doc 3 (0.12) — No relevante

Sistema retorna Doc 1 y Doc 2.


Qué NO verás en este módulo

Para mantener enfoque conceptual:

  • Código Python/NumPy: No implementarás métricas (eso es para guías posteriores)
  • Optimizaciones: No verás SIMD, GPU, aproximaciones (eso es Módulo 4)
  • Métricas exóticas: Solo euclidiana, Manhattan, coseno (las 3 más usadas)

Criterios de éxito

Sabrás que completaste el módulo si puedes:

  1. ✅ Calcular distancia euclidiana entre dos vectores 2D/3D
  2. ✅ Calcular similaridad coseno entre dos vectores 2D/3D
  3. ✅ Explicar por qué coseno es mejor que euclidiana en alta dimensión
  4. ✅ Interpretar valores de coseno (0.95 = muy similar, 0.3 = poco similar)
  5. ✅ Decidir qué métrica usar en un caso de uso dado
  6. ✅ Aplicar métricas a semantic search (query → vectores → rankear por coseno)

Test rápido: Si puedes explicar "¿Por qué semantic search usa coseno en lugar de euclidiana?" sin dudar, estás listo para Módulo 4.


Próximas cápsulas

Cápsula 02: Distancia euclidiana (fórmula, ejemplos, cuándo usar)
Cápsula 03: Manhattan y otras métricas
Cápsula 04: Similaridad coseno (la métrica clave para AI)
Cápsula 05: Comparación (euclidiana vs coseno)
Cápsula 06: Métricas en semantic search real
Cápsula 07: Ejercicio integrador


Próxima cápsula: 02-euclidean-distance.md — Línea recta, fórmula, cálculos.