Módulo 4: Transformers - La Revolución del AI Moderno
6. Por Qué Transformers Ganan: Paralelización, Contexto Largo y Escalabilidad
Descripción
Ya entiendes cómo funcionan Transformers (attention, encoder, decoder). Ahora vas a entender por qué son superiores a RNNs y por qué dominan AI moderno.
Tres ventajas clave:
- Paralelización: 10-100× más rápidos de entrenar.
- Contexto largo: Captan dependencias a largo plazo sin degradación.
- Escalabilidad: Funcionan con miles de millones de parámetros (GPT-3: 175B, GPT-4: ~1T).
Ventaja 1: Paralelización (Velocidad)
RNN: Procesamiento secuencial
Problema: RNNs procesan palabra por palabra (secuencialmente). Paso 2 depende de paso 1 → no puedes paralelizar.
Consecuencia: Training es lento (días, semanas en datasets grandes).
Transformer: Procesamiento paralelo
Solución: Transformers procesan todas las palabras simultáneamente.
Cómo:
- Self-attention: Cada palabra calcula attention con todas las demás en paralelo (no necesita resultado de palabra anterior).
- GPUs modernas: Miles de cores procesan múltiples palabras simultáneamente.
Resultado: Training es 10-100× más rápido que RNNs.
Comparación: Training en 1M de frases
| Arquitectura | Tiempo de training (estimado) | Por qué |
|---|---|---|
| RNN/LSTM | 2-4 semanas | Secuencial, no paraleliza |
| Transformer | 1-3 días | Paralelo, usa GPUs eficientemente |
Moraleja: Paralelización permite entrenar modelos masivos (GPT-3, GPT-4) en tiempo razonable.
Ventaja 2: Contexto Largo (No Olvida)
RNN: Olvida contexto largo
Problema:
- Estado oculto de tamaño fijo comprime información.
- Vanishing gradients en secuencias largas (50-200 palabras).
Consecuencia: RNN olvida palabras tempranas → mal en dependencias a largo plazo.
Transformer: Captura contexto largo
Solución: Attention permite a cualquier palabra atender directamente a cualquier otra palabra (sin depender de estado oculto comprimido).
Ejemplo:
Frase: "El gato que mi hermana adoptó el año pasado está durmiendo."
RNN: Cuando llega a "está durmiendo", olvidó quién es el sujeto ("El gato" está 9 palabras atrás).
Transformer: "está durmiendo" atiende DIRECTAMENTE a "El gato" → no olvida.
Resultado: Transformers captan dependencias de 100-1,000+ palabras sin degradación.
Context Window
Comparación:
| Modelo | Context Window | Tipo |
|---|---|---|
| RNN/LSTM | ~50-200 palabras | Limitado por memoria |
| BERT | 512 tokens (~400 palabras) | Limitado por cómputo |
| GPT-3 | 4,096 tokens (~3K palabras) | Limitado por cómputo |
| GPT-4 | 128K tokens (~96K palabras) | Limitado por cómputo |
| Claude 3 | 200K tokens (~150K palabras) | Limitado por cómputo |
Nota: Transformers también tienen límite (context window), pero es mucho mayor que RNNs y sin degradación de calidad.
Ventaja 3: Escalabilidad (Modelos Masivos)
RNN: Difícil de escalar
Problema:
- Procesamiento secuencial no aprovecha GPUs grandes.
- Vanishing gradients empeoran con más capas.
Consecuencia: RNNs grandes (50+ capas, 1B+ parámetros) son difíciles de entrenar.
Transformer: Escala perfectamente
Solución:
- Paralelización aprovecha GPUs masivas (ej. 1,000+ GPUs en paralelo).
- Residual connections (Add & Norm) permiten entrenar redes muy profundas (100+ capas).
Resultado: Transformers escalan a miles de millones/trillones de parámetros.
Escala de modelos Transformer
| Modelo | Parámetros | Año | Organización |
|---|---|---|---|
| BERT-base | 110M | 2018 | |
| GPT-2 | 1.5B | 2019 | OpenAI |
| GPT-3 | 175B | 2020 | OpenAI |
| GPT-4 | ~1T (rumor) | 2023 | OpenAI |
| Llama 3 | 400B | 2024 | Meta |
Moraleja: Transformers permiten modelos 1,000× más grandes que RNNs → mejor accuracy, más capacidades emergentes.
Por Qué Importa para un AI Engineer
1. Training eficiente
Si haces fine-tuning:
- Transformers (BERT, GPT) se entrenan mucho más rápido que RNNs.
- Ejemplo: Fine-tunar BERT en 10K ejemplos → 1-2 horas. Fine-tunar RNN equivalente → 10-20 horas.
2. Context window en producción
Aplicación: Chatbot que responde preguntas sobre documentos largos.
Opción A (RNN/LSTM): Context window ~200 palabras → NO puede procesar documento completo → necesitas dividir en chunks pequeños → pierde contexto.
Opción B (Transformer GPT-4): Context window 128K tokens → puede procesar documento completo (ej. 50 páginas) → mejor comprensión.
3. Selección de modelos según context window
| Tarea | Context window necesario | Modelo recomendado |
|---|---|---|
| Clasificar tweets (~50 palabras) | Pequeño | BERT (512 tokens) |
| Analizar emails (~200 palabras) | Mediano | BERT, GPT-3.5 |
| Analizar documentos legales (~10K palabras) | Grande | GPT-4 (128K), Claude 3 (200K) |
Resumen
Tres ventajas de Transformers sobre RNNs:
- Paralelización: Procesan toda la secuencia a la vez (no palabra por palabra) → 10-100× más rápidos de entrenar.
- Contexto largo: Attention directa entre cualquier par de palabras → no olvidan (context window de 1K-200K tokens vs 50-200 de RNNs).
- Escalabilidad: Aprovechan GPUs masivas, entrenan redes profundas → modelos de 175B-1T parámetros (vs <1B en RNNs).
Por qué dominan AI moderno:
- Todos los LLMs (ChatGPT, Claude, BERT) son Transformers.
- RNNs prácticamente no se usan en NLP moderno (2024).
Próximo paso: Cápsula 07: Transformers en Acción — BERT, GPT, T5, aplicaciones reales.
Recursos adicionales
-
Scaling Laws for Neural Language Models — Paper sobre escalabilidad de Transformers. En inglés. Técnico.
-
The Illustrated GPT-2 — Visualización de GPT-2 (decoder-only Transformer). En inglés.