Módulo 4: Transformers - La Revolución del AI Moderno
1. Introducción al Módulo: Transformers - La Revolución
Descripción
Bienvenido al Módulo 4: Transformers. Este es posiblemente el módulo más importante de toda la guía para entender el AI moderno que usamos hoy (2024).
Por qué es tan importante: Transformers son la arquitectura detrás de ChatGPT, Claude, GPT-4, BERT, Gemini, Llama, Mistral → prácticamente todos los LLMs (Large Language Models) que revolucionaron AI desde 2022-2023.
Sin entender Transformers, no puedes entender:
- Cómo funciona ChatGPT (GPT-4 es un Transformer decoder-only con 1 trillion de parámetros).
- Por qué los LLMs tienen context window limitado (attention escala cuadráticamente con longitud).
- Qué diferencia BERT de GPT (encoder vs decoder).
- Por qué Transformers reemplazaron RNNs (paralelización, contexto largo, escalabilidad).
En este módulo vas a entender qué son Transformers y cómo funcionan (conceptualmente, sin implementar desde cero). El enfoque es visual y conceptual; verás diagramas, analogías, y explicaciones sin fórmulas matemáticas complejas.
El momento "Attention Is All You Need" (2017)
El paper que cambió todo
Junio 2017: Investigadores de Google (Vaswani et al.) publican el paper "Attention Is All You Need".
Idea central: Proponen una nueva arquitectura para procesamiento de secuencias (ej. texto) que NO usa RNNs ni CNNs. Solo usa attention (mecanismo que permite a la red "atender" a partes relevantes del input).
Nombre: La arquitectura se llama Transformer (porque "transforma" secuencias de input en secuencias de output usando attention).
Resultado: En tareas de traducción automática (ej. inglés → alemán), Transformers superaron RNNs (que eran state-of-the-art) y fueron 10-100× más rápidos de entrenar.
Por qué fue revolucionario
Antes de Transformers (pre-2017), el estado del arte en NLP usaba RNNs (Recurrent Neural Networks) o LSTMs (Long Short-Term Memory). Pero RNNs tenían problemas graves:
- Procesamiento secuencial: RNNs procesan palabras una a la vez (palabra 1, luego palabra 2, luego palabra 3) → lentas, no pueden paralelizar.
- Vanishing gradients: En secuencias largas (ej. 100+ palabras), RNNs olvidan palabras anteriores.
- Contexto limitado: RNNs captan mal dependencias a largo plazo (ej. palabra en posición 1 influye en palabra en posición 50).
Transformers resolvieron todos esos problemas:
- Procesamiento paralelo: Procesan toda la secuencia a la vez (no palabra por palabra) → 10-100× más rápidos.
- No vanishing gradients: Attention conecta directamente cualquier palabra con cualquier otra (sin pasar por muchas capas como RNNs).
- Contexto largo: Attention capta dependencias a largo plazo (palabra en posición 1 puede atender directamente a palabra en posición 50).
Moraleja: Transformers son mejores, más rápidos, y más escalables que RNNs → reemplazaron completamente RNNs en NLP.
Cronología: De Transformers a ChatGPT
2017: "Attention Is All You Need"
- Paper introduce Transformers.
- Aplicación inicial: Traducción automática (inglés → alemán).
2018: BERT (Google)
BERT (Bidirectional Encoder Representations from Transformers):
- Usa solo el encoder de Transformers.
- Pre-entrenado en corpus masivo de texto (Wikipedia + libros).
- State-of-the-art en tareas de comprensión de texto (clasificación, NER, Q&A).
Impacto: Google integra BERT en su buscador (mejor comprensión de queries).
2018-2019: GPT y GPT-2 (OpenAI)
GPT (Generative Pre-trained Transformer):
- Usa solo el decoder de Transformers.
- Pre-entrenado para predecir siguiente palabra (autocompletado).
- Genera texto coherente (pero limitado).
GPT-2 (2019):
- 1.5 mil millones de parámetros (10× más que GPT).
- Genera texto muy coherente (OpenAI inicialmente no lo lanza por preocupaciones de uso indebido).
2020: GPT-3 (OpenAI)
GPT-3:
- 175 mil millones de parámetros (100× más que GPT-2).
- Capacidades emergentes: puede hacer tareas que nunca vio en entrenamiento (few-shot learning).
- Genera texto casi indistinguible de humano.
Acceso vía API: OpenAI lanza API para que desarrolladores integren GPT-3 en aplicaciones.
2022: ChatGPT (OpenAI)
ChatGPT (GPT-3.5 + RLHF):
- Basado en GPT-3.5 (versión mejorada de GPT-3).
- Entrenado con RLHF (Reinforcement Learning from Human Feedback) para seguir instrucciones y ser útil.
- Interfaz de chat accesible para cualquiera.
Impacto: Boom masivo de AI. 100 millones de usuarios en 2 meses (aplicación de más rápido crecimiento en la historia).
2023-2024: GPT-4, Claude, Gemini, Llama 3
GPT-4 (OpenAI, 2023):
- ~1 trillion de parámetros (rumores; OpenAI no confirma).
- Multimodal (texto + imágenes).
- Mejora significativa en razonamiento.
Claude 3 (Anthropic, 2024):
- Transformer con énfasis en seguridad y precisión.
- Context window de 200K tokens (5× más que GPT-4).
Gemini (Google, 2023-2024):
- Transformer multimodal (texto, imagen, audio, video).
Llama 3 (Meta, 2024):
- Transformer open-source (puedes descargar pesos y correr localmente).
- 70-400 mil millones de parámetros.
Moraleja: Todos son Transformers. La revolución de AI (2022-2024) es una revolución de Transformers a escala masiva.
¿Qué aprenderás en este módulo?
Conceptos clave (8 cápsulas)
| # | Cápsula | Qué aprenderás |
|---|---|---|
| 01 | Introducción al módulo | Cronología 2017-2024, por qué Transformers revolucionaron AI (esta cápsula) |
| 02 | El problema con RNNs | Por qué RNNs son limitadas (secuencial, vanishing gradients, contexto corto) |
| 03 | Attention mechanism | Qué es attention (conceptualmente, sin fórmulas) |
| 04 | Self-attention explicado | Cómo las palabras se "ven" entre sí (ejemplo concreto) |
| 05 | Arquitectura Transformer | Encoder, decoder, positional encoding, multi-head attention |
| 06 | Por qué Transformers ganan | Paralelización, contexto largo, escalabilidad |
| 07 | Transformers en acción | BERT, GPT, T5, aplicaciones reales |
| 08 | Ejercicio integrador | Visualizar attention, elegir modelos según problema |
Por qué importa para un AI Engineer
1. Todos los LLMs modernos son Transformers
Cuando trabajas como AI Engineer (2024), casi todo lo que usas son Transformers:
- ChatGPT (GPT-4): Transformer decoder-only.
- Claude (Anthropic): Transformer decoder-only.
- BERT (Google): Transformer encoder-only.
- Gemini (Google): Transformer multimodal.
- Llama 3 (Meta): Transformer decoder-only (open-source).
Moraleja: Si no entiendes Transformers, no puedes trabajar con LLMs (la herramienta principal del AI Engineer).
2. Selección de modelos
Necesitas saber qué tipo de Transformer usar según el problema:
| Tipo | Ejemplo | Uso común | Por qué |
|---|---|---|---|
| Encoder-only | BERT | Clasificación, NER, Q&A | Solo comprende texto, no genera |
| Decoder-only | GPT, Claude | Generación, chat, autocompletado | Genera texto secuencialmente |
| Encoder-decoder | T5, BART | Traducción, resumen | Transforma texto de formato A a B |
Ejemplo: Si necesitas clasificar reviews de productos (positiva/negativa), usas BERT (encoder). Si necesitas generar respuestas en un chatbot, usas GPT o Claude (decoder).
3. Entender limitaciones
Context window:
- Todos los LLMs basados en Transformers tienen context window limitado (ej. GPT-4: ~128K tokens, Claude 3: ~200K tokens).
- Por qué: Attention escala cuadráticamente con longitud de secuencia → secuencias muy largas son lentas y costosas.
Implicaciones para tu trabajo:
- Si un usuario te pasa un documento de 500 páginas (ej. 200K tokens) y el modelo tiene context window de 128K → necesitas dividir el documento en chunks o usar técnicas como RAG (Retrieval-Augmented Generation).
Costos:
- Modelos con más parámetros (GPT-4: ~1T vs GPT-3.5: ~175B) son más caros por token.
- Por qué: Más parámetros → más cómputo por forward pass → más costo.
4. Debugging
Si un LLM da respuestas incorrectas:
Causa 1: Context window excedido
- El input es muy largo (supera context window) → el modelo "olvida" información del inicio.
- Solución: Dividir input en chunks, usar modelos con context window más grande (Claude 3: 200K), o usar RAG.
Causa 2: Attention no capta relación
- La relación entre palabras A y B es muy sutil o muy lejana (ej. palabra en posición 1 influye en palabra en posición 100) → attention no la capta.
- Solución: Reformular input (poner información relevante más cerca), usar prompt engineering, o fine-tuning.
5. Comunicación técnica
Cuando producto o negocio pregunte:
"¿Por qué GPT-4 es más caro que GPT-3.5?"
- Respuesta técnica: "GPT-4 tiene ~1 trillion de parámetros vs GPT-3.5 con ~175 billion. Más parámetros → más cómputo por token (forward pass más costoso) → más caro. GPT-4 también tiene más capas y más attention heads → más expresivo pero más costoso."
"¿Por qué no podemos pasarle un documento de 1 millón de palabras a ChatGPT?"
- Respuesta técnica: "ChatGPT (GPT-4) tiene context window de ~128K tokens (~96K palabras). Attention escala cuadráticamente con longitud → pasar 1M de palabras requeriría cómputo masivo (lento y muy costoso). Alternativa: dividir en chunks o usar RAG para buscar información relevante."
Roadmap del módulo
Fase 1: Problema y solución (Cápsulas 02-03)
Objetivo: Entender por qué RNNs son limitadas y cómo attention resuelve esos problemas.
- Cápsula 02: Problemas de RNNs (secuencial, vanishing gradients, olvida contexto).
- Cápsula 03: Qué es attention (mecanismo que permite "atender" a partes relevantes del input).
Analogía central: Leer un documento largo. RNN lee palabra por palabra secuencialmente (lento, olvida el inicio). Attention te permite volver a cualquier parte anterior cuando necesitas contexto (rápido, no olvida).
Fase 2: Cómo funciona (Cápsulas 04-05)
Objetivo: Entender cómo funciona self-attention y la arquitectura completa de Transformers.
- Cápsula 04: Self-attention (cómo las palabras se "ven" entre sí, ejemplo concreto).
- Cápsula 05: Arquitectura Transformer (encoder, decoder, positional encoding, multi-head attention).
Ejemplo: En la frase "The cat sat on the mat", self-attention permite que "cat" atienda a "sat" y "mat" para entender relación (el gato es el sujeto que sat, y mat es dónde sat).
Fase 3: Por qué ganan y aplicaciones (Cápsulas 06-07)
Objetivo: Entender por qué Transformers son mejores que RNNs y qué aplicaciones tienen.
- Cápsula 06: Por qué Transformers ganan (paralelización, contexto largo, escalabilidad).
- Cápsula 07: Transformers en acción (BERT, GPT, T5, aplicaciones reales).
Comparación clave: RNN procesa "The cat sat on the mat" secuencialmente (palabra por palabra). Transformer procesa toda la frase a la vez (paralelo) → 10-100× más rápido.
Fase 4: Práctica (Cápsula 08)
Objetivo: Aplicar conceptos visualizando attention y eligiendo modelos según problema.
- Cápsula 08: Ejercicio integrador (visualizar attention, identificar qué modelo usar para problemas dados).
Errores frecuentes al aprender Transformers
1. Pensar que necesitas las matemáticas desde el principio
Error: Empezar leyendo el paper "Attention Is All You Need" (muy técnico: matrices, softmax, producto punto).
Realidad: Para AI Engineering, primero necesitas conceptos visuales (qué hace attention, por qué es útil, cómo se diferencia de RNN). Las matemáticas son útiles si quieres implementar Transformers desde cero, pero frameworks (PyTorch, Hugging Face) lo hacen por ti.
Consejo: Empieza con este módulo (conceptual). Si luego quieres profundizar, lee "The Illustrated Transformer" (blog visual) antes que el paper original.
2. Confundir "entender" con "implementar desde cero"
Error: Pensar que no entiendes Transformers si no puedes programar attention desde cero en PyTorch.
Realidad: Implementar desde cero es útil como ejercicio académico, pero en la práctica usas Hugging Face Transformers (from transformers import BertModel) que lo hace por ti. Lo importante es entender qué hace cada componente (qué es attention, qué es encoder, qué es decoder).
3. No diferenciar encoder, decoder, y encoder-decoder
Error: Pensar que "Transformer" es una sola cosa y no distinguir variantes.
Realidad: Hay 3 tipos principales:
- Encoder-only (BERT): Para comprensión (clasificación, NER, Q&A).
- Decoder-only (GPT): Para generación (chat, autocompletado).
- Encoder-decoder (T5): Para transformación (traducción, resumen).
Consecuencia: Si intentas usar BERT para generar texto (ej. chatbot), no funcionará (BERT no es generativo). Necesitas GPT.
Preguntas frecuentes
¿Veré código en este módulo?
No. Este módulo es conceptual (sin código). El objetivo es que entiendas cómo funcionan Transformers para poder usarlos (via APIs, Hugging Face) sin necesidad de implementarlos desde cero.
Si quieres código: Al final de cada cápsula hay recursos opcionales (ej. Hugging Face Course con código PyTorch).
¿Cuánto tarda aprender esto?
Este módulo: 3 horas (2.5h lectura + 0.5h ejercicios).
Para dominar Transformers (implementación, fine-tuning): 2-4 semanas (curso de Hugging Face, práctica con proyectos).
Para AI Engineering (usar Transformers via APIs): Este módulo + Módulo 5 (LLMs) + Módulo 6 (APIs) = fundamentos suficientes. Luego práctica en proyectos reales (bootcamp).
¿Puedo saltar este módulo y pasar directo a LLMs (Módulo 5)?
No recomendado. LLMs (ChatGPT, Claude, GPT-4) son Transformers. Si no entiendes qué es attention, encoder vs decoder, por qué Transformers escalan mejor que RNNs, te costará entender cómo funcionan LLMs y por qué tienen ciertas limitaciones (context window, costos, etc.).
Progresión lógica:
Módulo 3: Neural Networks (RNNs, CNNs, forward/backward)
↓
Módulo 4: Transformers (attention, encoder-decoder) ← ESTÁS AQUÍ
↓
Módulo 5: LLMs (GPT, Claude, tokenización, embeddings)
Evidencia de éxito
Sabes que has aprovechado bien este módulo cuando:
- Puedes explicar qué es attention sin usar fórmulas (con analogías: "es como buscar en un documento largo, puedes volver a partes anteriores cuando necesitas contexto").
- Puedes identificar la diferencia entre RNN y Transformer (secuencial vs paralelo, contexto corto vs largo).
- Puedes diferenciar encoder (BERT), decoder (GPT), y encoder-decoder (T5) y saber cuándo usar cada uno.
- Puedes interpretar documentación de modelos (ej. "BERT-base: 12 layers, 12 attention heads, 768 hidden size").
- Puedes razonar sobre limitaciones (por qué LLMs tienen context window limitado, por qué attention es costosa para secuencias largas).
Si al final del módulo (Cápsula 08) puedes resolver el ejercicio integrador sin consultar cápsulas anteriores, estás listo para Módulo 5 (LLMs).
Resumen de esta cápsula
Por qué Transformers revolucionaron AI:
- 2017: Paper "Attention Is All You Need" introduce Transformers.
- 2018-2020: BERT (Google), GPT-2/GPT-3 (OpenAI) usan Transformers → state-of-the-art en NLP.
- 2022: ChatGPT (GPT-3.5) → boom masivo de AI.
- 2023-2024: GPT-4, Claude, Gemini, Llama 3 → todos son Transformers.
Por qué son mejores que RNNs:
- Paralelización: Procesan toda la secuencia a la vez (no palabra por palabra) → 10-100× más rápidos.
- Contexto largo: Attention capta dependencias a largo plazo (no olvidan como RNNs).
- Escalabilidad: Funcionan con miles de millones de parámetros (GPT-3: 175B, GPT-4: ~1T).
Qué aprenderás:
- Cómo funciona attention (Cápsulas 03-04).
- Arquitectura completa (encoder, decoder, positional encoding) (Cápsula 05).
- Por qué ganan y aplicaciones (BERT, GPT, T5) (Cápsulas 06-07).
Próximo paso: Pasa a Cápsula 02: El Problema con RNNs donde verás por qué RNNs son limitadas y por qué necesitamos Transformers.
Recursos adicionales (opcionales)
-
The Illustrated Transformer (Jay Alammar) — Post visual sobre Transformers. En inglés. Muy recomendado.
-
Attention Is All You Need (paper original) — Paper de 2017. En inglés. Muy técnico (matemáticas).
-
Stanford CS224N: Transformers and Pretraining — Lectures sobre Transformers. En inglés. Académico.
-
Hugging Face Course: The Transformer Architecture — Curso práctico con código. En inglés.
-
3Blue1Brown: Attention in transformers, visually explained — Video visual sobre attention. En inglés con subtítulos.
Nota: NO necesitas estos recursos para AI Engineering; este módulo cubre lo esencial. Son opcionales si quieres profundizar.