Módulo 4: Transformers - La Revolución del AI Moderno

6. Por Qué Transformers Ganan: Paralelización, Contexto Largo y Escalabilidad

Descripción

Ya entiendes cómo funcionan Transformers (attention, encoder, decoder). Ahora vas a entender por qué son superiores a RNNs y por qué dominan AI moderno.

Tres ventajas clave:

  1. Paralelización: 10-100× más rápidos de entrenar.
  2. Contexto largo: Captan dependencias a largo plazo sin degradación.
  3. Escalabilidad: Funcionan con miles de millones de parámetros (GPT-3: 175B, GPT-4: ~1T).

Ventaja 1: Paralelización (Velocidad)

RNN: Procesamiento secuencial

Problema: RNNs procesan palabra por palabra (secuencialmente). Paso 2 depende de paso 1 → no puedes paralelizar.

Consecuencia: Training es lento (días, semanas en datasets grandes).


Transformer: Procesamiento paralelo

Solución: Transformers procesan todas las palabras simultáneamente.

Cómo:

  • Self-attention: Cada palabra calcula attention con todas las demás en paralelo (no necesita resultado de palabra anterior).
  • GPUs modernas: Miles de cores procesan múltiples palabras simultáneamente.

Resultado: Training es 10-100× más rápido que RNNs.


Comparación: Training en 1M de frases

ArquitecturaTiempo de training (estimado)Por qué
RNN/LSTM2-4 semanasSecuencial, no paraleliza
Transformer1-3 díasParalelo, usa GPUs eficientemente

Moraleja: Paralelización permite entrenar modelos masivos (GPT-3, GPT-4) en tiempo razonable.


Ventaja 2: Contexto Largo (No Olvida)

RNN: Olvida contexto largo

Problema:

  • Estado oculto de tamaño fijo comprime información.
  • Vanishing gradients en secuencias largas (50-200 palabras).

Consecuencia: RNN olvida palabras tempranas → mal en dependencias a largo plazo.


Transformer: Captura contexto largo

Solución: Attention permite a cualquier palabra atender directamente a cualquier otra palabra (sin depender de estado oculto comprimido).

Ejemplo:

Frase: "El gato que mi hermana adoptó el año pasado está durmiendo."
RNN: Cuando llega a "está durmiendo", olvidó quién es el sujeto ("El gato" está 9 palabras atrás).
Transformer: "está durmiendo" atiende DIRECTAMENTE a "El gato" → no olvida.

Resultado: Transformers captan dependencias de 100-1,000+ palabras sin degradación.


Context Window

Comparación:

ModeloContext WindowTipo
RNN/LSTM~50-200 palabrasLimitado por memoria
BERT512 tokens (~400 palabras)Limitado por cómputo
GPT-34,096 tokens (~3K palabras)Limitado por cómputo
GPT-4128K tokens (~96K palabras)Limitado por cómputo
Claude 3200K tokens (~150K palabras)Limitado por cómputo

Nota: Transformers también tienen límite (context window), pero es mucho mayor que RNNs y sin degradación de calidad.


Ventaja 3: Escalabilidad (Modelos Masivos)

RNN: Difícil de escalar

Problema:

  • Procesamiento secuencial no aprovecha GPUs grandes.
  • Vanishing gradients empeoran con más capas.

Consecuencia: RNNs grandes (50+ capas, 1B+ parámetros) son difíciles de entrenar.


Transformer: Escala perfectamente

Solución:

  • Paralelización aprovecha GPUs masivas (ej. 1,000+ GPUs en paralelo).
  • Residual connections (Add & Norm) permiten entrenar redes muy profundas (100+ capas).

Resultado: Transformers escalan a miles de millones/trillones de parámetros.


Escala de modelos Transformer

ModeloParámetrosAñoOrganización
BERT-base110M2018Google
GPT-21.5B2019OpenAI
GPT-3175B2020OpenAI
GPT-4~1T (rumor)2023OpenAI
Llama 3400B2024Meta

Moraleja: Transformers permiten modelos 1,000× más grandes que RNNs → mejor accuracy, más capacidades emergentes.


Por Qué Importa para un AI Engineer

1. Training eficiente

Si haces fine-tuning:

  • Transformers (BERT, GPT) se entrenan mucho más rápido que RNNs.
  • Ejemplo: Fine-tunar BERT en 10K ejemplos → 1-2 horas. Fine-tunar RNN equivalente → 10-20 horas.

2. Context window en producción

Aplicación: Chatbot que responde preguntas sobre documentos largos.

Opción A (RNN/LSTM): Context window ~200 palabras → NO puede procesar documento completo → necesitas dividir en chunks pequeños → pierde contexto.

Opción B (Transformer GPT-4): Context window 128K tokens → puede procesar documento completo (ej. 50 páginas) → mejor comprensión.


3. Selección de modelos según context window

TareaContext window necesarioModelo recomendado
Clasificar tweets (~50 palabras)PequeñoBERT (512 tokens)
Analizar emails (~200 palabras)MedianoBERT, GPT-3.5
Analizar documentos legales (~10K palabras)GrandeGPT-4 (128K), Claude 3 (200K)

Resumen

Tres ventajas de Transformers sobre RNNs:

  1. Paralelización: Procesan toda la secuencia a la vez (no palabra por palabra) → 10-100× más rápidos de entrenar.
  2. Contexto largo: Attention directa entre cualquier par de palabras → no olvidan (context window de 1K-200K tokens vs 50-200 de RNNs).
  3. Escalabilidad: Aprovechan GPUs masivas, entrenan redes profundas → modelos de 175B-1T parámetros (vs <1B en RNNs).

Por qué dominan AI moderno:

  • Todos los LLMs (ChatGPT, Claude, BERT) son Transformers.
  • RNNs prácticamente no se usan en NLP moderno (2024).

Próximo paso: Cápsula 07: Transformers en Acción — BERT, GPT, T5, aplicaciones reales.


Recursos adicionales

  1. Scaling Laws for Neural Language Models — Paper sobre escalabilidad de Transformers. En inglés. Técnico.

  2. The Illustrated GPT-2 — Visualización de GPT-2 (decoder-only Transformer). En inglés.