Módulo 2: El cerebro del agente: modelo y system prompt
2. Elegir el modelo: familias vigentes en 2026 (y cuáles evitar)
Descripción
En esta lección vas a poder elegir, con un criterio de costo, latencia y calidad — no por costumbre ni por copiar un tutorial viejo —, qué familia y qué tier de modelo conectar al nodo Chat Model de tu agente. Y vas a saber reconocer, con la tabla vigente de julio de 2026, cuáles modelos ya están retirados o a punto de retirarse, para no dejarlos escritos en un flujo nuevo.
Esto importa porque el escenario más común de un agente roto en producción no es un bug de n8n: es un ID de modelo copiado de un video o un artículo de hace año y medio. Alguien conecta gpt-4o o claude-3-5-sonnet-20241022 porque así lo vio en un tutorial, el flujo corre bien en las pruebas (el proveedor todavía no lo apagó) y semanas después, sin aviso, el nodo empieza a fallar con un error de modelo no encontrado — justo cuando nadie se acuerda de haber tocado esa parte del flujo.
Conexión con el módulo: en la lección anterior viste que el modelo es una de las piezas obligatorias del agente — el criterio de decisión detrás de cada respuesta. Ahora toca elegir cuál, concretamente, entre las familias que existen hoy. Todavía no vas a conectar credenciales (eso es la lección 3) ni vas a correr nada local con Ollama (lección 4) — esta lección es sobre proveedores de nube, y sobre el mapa que necesitas antes de tocar el nodo.
El menú de modelos: por qué no existe "el mejor"
Piensa en una empresa de reparto con tres vehículos disponibles: un camión grande, una camioneta y una bici. El camión mueve cualquier carga pero es lento y caro por viaje; la bici es barata y rápida para distancias cortas, pero no carga un refrigerador. Nadie usa el camión para llevar un sobre, y nadie intenta mudar una casa en bici. La elección depende de la carga (qué tan compleja es la tarea), la velocidad que necesitas y el costo que estás dispuesto a pagar por viaje.
Con los modelos de lenguaje pasa lo mismo. Los tres proveedores que vas a usar en esta guía — Anthropic, OpenAI y Google — organizan su catálogo casi calcado a esa lógica: un tier "frontier" (razona más, cuesta más, responde más lento), un tier de "balance" (el que casi siempre vas a elegir por defecto) y un tier "económico" (rápido y barato para tareas acotadas y de alto volumen). La pregunta que vas a hacerte para cada agente no es "¿cuál es el mejor modelo?" sino "¿qué tan compleja es la tarea de este agente, y cuántas veces al mes la va a ejecutar?".
Las familias vigentes en julio de 2026
| Proveedor | Frontier | Balance (default recomendado) | Económico |
|---|---|---|---|
| Anthropic | Claude Opus 4.8 (claude-opus-4-8) | Claude Sonnet 5 (claude-sonnet-5) | Claude Haiku 4.5 (claude-haiku-4-5) |
| OpenAI | GPT-5.6 Sol (gpt-5.6-sol) | GPT-5.6 Terra (gpt-5.6-terra) | GPT-5.6 Luna (gpt-5.6-luna) |
| Gemini 2.5 Pro | Gemini 2.5 Flash | Gemini 2.5 Flash-Lite |
Anthropic tiene, además, un cuarto tier por encima del frontier — Claude Fable 5 — pensado para agentes que corren tareas muy largas y complejas de forma autónoma. Para un agente típico de soporte, ventas o back-office armado en n8n rara vez lo vas a necesitar: el costo por token es notablemente más alto que Opus 4.8 y la diferencia de calidad, en tareas acotadas, no se nota.
Google ya empezó a mover su catálogo a una generación 3.x (Gemini 3.5 Flash, Gemini 3.1 Pro, entre otros), pero varias piezas de esa generación siguen en preview. Para un flujo que va a producción, la recomendación por defecto sigue siendo la línea 2.5 — es la que tiene disponibilidad general estable. Si quieres experimentar con la generación nueva, hazlo, pero no la fijes todavía como el modelo de un flujo que no puedes darte el lujo de que falle.
Legacy y retirados: lo que no deberías escribir en un flujo nuevo
"Legacy" no es lo mismo que "retirado". Un modelo legacy todavía responde si lo conectas — el proveedor no apagó el servidor —, pero ya no es el que Anthropic, OpenAI o Google recomiendan para código nuevo, y en algún momento sí lo van a apagar. Un modelo retirado directamente ya no existe: el nodo va a tirar un error cuando intente llamarlo.
| Proveedor | Legacy (funciona, pero no es tu punto de partida) | Retirado o a punto de retirarse (evítalo) |
|---|---|---|
| Anthropic | Opus 4.7, Opus 4.6, Sonnet 4.6, Sonnet 4.5, Opus 4.5 | Opus 4.1 — se retira el 5 de agosto de 2026, dentro de dos semanas desde hoy. Cualquier Claude 3.x (Opus 3, Sonnet 3.5, Haiku 3) o Claude 2.x, ya fuera de servicio. |
| OpenAI | GPT-5.5, GPT-5.4 (y sus variantes mini/nano/pro) | GPT-4o, GPT-4, GPT-4 Turbo, GPT-3.5 — toda la familia GPT-4 y anteriores ya está fuera. |
| Gemini 3.x en preview (3.5 Flash, 3.1 Pro) — válido para probar, no como default de producción todavía | Gemini 2.0 Flash, Gemini 2.0 Flash-Lite y Gemini 3 Pro Preview — el propio Google los marca para apagado próximo. Gemini 1.5 y 1.0, ya fuera de servicio. |
Hay un detalle de los IDs de Claude que vale la pena marcar porque rompe una intuición común: desde la generación 4.6 en adelante, un ID sin fecha como claude-sonnet-5 no es un puntero que se actualiza solo con el tiempo — es, igual que los IDs con fecha de generaciones anteriores, una versión fija y congelada. "Sin fecha en el nombre" no significa "siempre la última versión". Vuelve sobre esto en los errores comunes, porque es la causa más silenciosa de que un flujo quede corriendo un modelo que ya nadie recuerda haber fijado.
Nota para cuando vuelvas a esta lección dentro de unos meses: esta tabla es una fotografía de julio de 2026. Los tres proveedores actualizan catálogo, precios y hasta la estructura de tiers cada pocos meses. Antes de fijar un modelo en un flujo real — o antes de dictar este módulo a un cohorte nuevo — confirma el ID vigente contra la página oficial de modelos del proveedor, no contra esta tabla de memoria.
Ejemplo trabajado
Vas a montar un agente que recibe tickets de soporte de una tienda en línea y hace dos cosas por ticket: clasifica la urgencia (1 a 5) y redacta un borrador de respuesta corto. Volumen estimado: 5,000 tickets al mes. Es una tarea acotada — no requiere razonamiento en varios pasos, y nadie espera la respuesta en vivo frente a un cliente; corre en segundo plano.
Paso 1 — estimar el tamaño de la tarea. Cada ticket promedia 150 tokens de texto, más ~300 tokens de system prompt e instrucciones = 450 tokens de entrada. La salida (clasificación + borrador corto) promedia 120 tokens.
Paso 2 — como la tarea es acotada y de alto volumen, comparas solo el tier "balance" de cada proveedor (el frontier sería pagar de más por una tarea que no lo necesita):
| Modelo | Precio entrada (por MTok) | Precio salida (por MTok) | Costo estimado / mes (5,000 tickets) |
|---|---|---|---|
| Claude Sonnet 5 (precio de lanzamiento, vigente hasta 31-ago-2026) | $2 | $10 | 2.25 MTok × $2 + 0.6 MTok × $10 = $10.50 |
| GPT-5.6 Terra | $2.50 | $15 | 2.25 MTok × $2.50 + 0.6 MTok × $15 = $14.63 |
| Gemini 2.5 Flash | $0.30 | $2.50 | 2.25 MTok × $0.30 + 0.6 MTok × $2.50 = $2.18 |
Qué esperar — resultado interpretado. Para este perfil exacto (tarea corta, volumen alto, sin usuario esperando en vivo), Gemini 2.5 Flash sale entre 5 y 7 veces más barato que las otras dos opciones. Eso no cierra la decisión solo: la calidad real de la clasificación y del borrador hay que confirmarla corriendo los tres candidatos sobre una muestra de tickets reales con el motor de depuración que vas a usar en la lección 7 — el costo por token es un filtro para armar la lista corta, no el único criterio para elegir. Si tu equipo ya usa Anthropic para otros flujos y prefiere no sumar un proveedor nuevo solo para esta tarea, Sonnet 5 sigue siendo una elección razonable a $10.50/mes; lo que sí queda descartado, para este volumen y esta complejidad, es cualquier tier frontier (Opus 4.8, GPT-5.6 Sol, Gemini 2.5 Pro).
Errores comunes
Pensar que un ID sin fecha se actualiza solo. Configuras claude-sonnet-5 hoy y das por hecho que, si Anthropic mejora ese modelo el próximo año, tu agente lo va a usar automáticamente. Qué pasa: no es así — desde la generación 4.6, cada ID (con fecha o sin ella) es un snapshot fijo, así que tu flujo sigue corriendo exactamente la misma versión hasta que tú la cambies, y el día que Anthropic retire ese snapshot, el flujo falla de golpe y sin aviso previo dentro de n8n. Por qué pasa: el formato sin fecha se diseñó para dar un nombre estable y fácil de leer, no para indicar "siempre la última versión" — esa distinción no es obvia si vienes de otros productos donde "sin versión" sí significa "la más reciente". Cómo detectarlo: revisa periódicamente la página de modelos del proveedor contra el ID que tienes escrito en el nodo — si tu ID aparece en la sección de legacy o deprecados, actúa antes de la fecha de retiro. Cómo corregirlo: agenda una revisión trimestral del modelo configurado en cada agente productivo, en vez de asumir que "sin fecha" significa "sin mantenimiento".
Copiar el ID de un modelo retirado desde un tutorial viejo. Un video o artículo de 2024 muestra gpt-4o o claude-3-5-sonnet-20241022 en el nodo Chat Model, y lo copias tal cual porque el resto del tutorial sigue siendo válido. Qué pasa: al ejecutar el flujo, el nodo devuelve un error del proveedor (modelo no encontrado o ya no soportado por esa credencial) en vez de una respuesta — y si el flujo corre desatendido, el fallo puede pasar inadvertido hasta que alguien revisa las ejecuciones. Por qué pasa: el contenido del tutorial no caduca, pero los nombres de modelo que menciona sí — los tres proveedores retiran modelos cada pocos meses. Cómo detectarlo: el error aparece en el panel de ejecuciones de n8n apenas corres el flujo, con un mensaje del proveedor sobre el modelo solicitado. Cómo corregirlo: nunca fijes un ID de modelo sin confirmarlo contra la tabla de esta lección o la doc oficial del proveedor el mismo día que armas el flujo — el nombre del tutorial es una referencia de qué proveedor usar, no del ID exacto.
Asumir que el modelo más caro siempre da mejor resultado. Para una tarea acotada y bien definida — como clasificar y redactar un borrador corto — es tentador conectar el tier frontier "para no arriesgar calidad". Qué pasa: pagas de 4 a 8 veces más por token y esperas más por respuesta, sin que la calidad percibida mejore de forma notoria frente al tier de balance o incluso el económico. Por qué pasa: los modelos frontier están optimizados para razonamiento largo y tareas ambiguas de varios pasos; en una tarea corta y acotada ese margen de razonamiento extra no tiene mucho donde aplicarse. Cómo detectarlo: corre la misma tarea con dos o tres candidatos de distinto tier sobre el mismo lote de datos de prueba y compara el resultado real, no la reputación del modelo. Cómo corregirlo: si la calidad es indistinguible entre tiers para tu tarea específica, quédate con el más barato y rápido — reserva el tier frontier para los agentes donde el razonamiento en varios pasos sí mueve la aguja.
Ejercicios
Ejercicio 1. Vas a montar un agente que resume, una vez por semana, la transcripción completa de una reunión de una hora (mucho contexto, hay que extraer decisiones y pendientes de forma correcta) para un equipo pequeño — unas 50 ejecuciones al mes. ¿Qué tier elegirías por defecto, de cualquiera de las tres familias, y por qué?
Ver solución
El tier frontier (Opus 4.8, GPT-5.6 Sol o Gemini 2.5 Pro) es razonable aquí, y a diferencia del ejemplo trabajado, no hace falta descartarlo por costo: el volumen es bajo (50 ejecuciones/mes), así que aunque el precio por token sea el más alto de la tabla, el gasto total mensual sigue siendo bajo. Además la tarea premia justo lo que el tier frontier hace mejor — sostener mucho contexto y extraer conclusiones correctas de un documento largo y poco estructurado, no responder rápido a una pregunta corta.
Por qué funciona: el criterio no es "¿qué tan importante es la tarea?" sino la combinación de dos variables — volumen (bajo, así que el costo total no explota) y naturaleza de la tarea (razonamiento sobre mucho contexto, donde el tier frontier sí rinde más). Cuando ambas apuntan al mismo lado, la elección es clara.
Ejercicio 2. Heredas un flujo n8n con el nodo Chat Model configurado con el ID claude-3-5-sonnet-20241022, copiado de un tutorial. ¿Cuál es el problema y cómo lo corregirías?
Ver solución
Ese ID corresponde a una generación de Claude anterior a la 4.x — para julio de 2026 es un modelo retirado hace tiempo (la línea vigente ya va en Sonnet 5, con Opus 4.8 y Haiku 4.5 como el resto del catálogo actual). El flujo probablemente ya está fallando, o va a fallar apenas el proveedor termine de desactivar esa versión. La corrección es cambiar el ID por el vigente de la familia equivalente — claude-sonnet-5 si la tarea sigue siendo de tier "balance" — y, antes de darlo por cerrado, confirmar contra la página oficial de modelos de Anthropic que ese ID sigue activo (no legacy, no en camino a retirarse).
Por qué funciona: un ID con fecha de una generación vieja es la señal más directa de "esto se copió de una fuente que no se actualizó" — el paso correcto no es solo cambiar el número, sino verificar el estado vigente antes de fijar el reemplazo.
Ejercicio 3. Un agente de FAQ para una app responde 20,000 consultas al mes, con un promedio de 200 tokens de entrada y 60 de salida por consulta. Compara el costo mensual entre Gemini 2.5 Flash ($0.30 / $2.50 por MTok) y Claude Haiku 4.5 ($1 / $5 por MTok). ¿Cuál sale más barato?
Ver solución
Volumen: 20,000 × 200 = 4,000,000 tokens de entrada (4 MTok); 20,000 × 60 = 1,200,000 tokens de salida (1.2 MTok).
Gemini 2.5 Flash: 4 × $0.30 + 1.2 × $2.50 = $1.20 + $3.00 = $4.20/mes. Claude Haiku 4.5: 4 × $1 + 1.2 × $5 = $4.00 + $6.00 = $10.00/mes.
Gemini 2.5 Flash sale más barato para este perfil de volumen y tamaño de mensaje.
Por qué funciona: es la misma mecánica del ejemplo trabajado — multiplicar el volumen de tokens (en millones) por el precio por millón, por separado para entrada y salida, y sumar. El resultado cambia con cada perfil de tarea, así que el cálculo hay que rehacerlo por agente, no asumir que el ganador de un caso gana siempre.
Resumen y siguiente paso
Ya tienes el mapa de julio de 2026: tres proveedores, cada uno con un tier frontier, uno de balance y uno económico; una tabla de qué es legacy (funciona, pero no es tu default) y qué está retirado o a punto de estarlo; y un método — costo por volumen de tokens, latencia según si hay un usuario esperando en vivo, calidad confirmada sobre datos reales — para elegir entre ellos en vez de copiar un nombre de un tutorial.
Esto es la base para lo que sigue: en la próxima lección vas a crear y conectar las credenciales de Anthropic, OpenAI y Google al nodo del agente, para que el modelo que elegiste acá deje de ser una fila en una tabla y empiece a responder de verdad. Si tu prioridad es correr a costo cero en vez de pagar por token, la lección 4 te muestra la alternativa con modelos locales vía Ollama.
Antes de avanzar deberías poder: nombrar el tier frontier, balance y económico de al menos dos de los tres proveedores; explicar por qué un ID sin fecha no es un puntero que se actualiza solo; y, dado un caso de uso con su volumen mensual, calcular y comparar el costo estimado entre dos candidatos.
Recursos
- Models overview — Claude Docs — tabla oficial de modelos vigentes y legacy de Anthropic, con IDs, precios y ventana de contexto.
- Model deprecations — Claude Docs — fechas de retiro de cada modelo de Anthropic; revísala antes de fijar un ID en producción.
- Models — OpenAI Platform — catálogo vigente de modelos de OpenAI, con IDs y capacidades.
- Pricing — Gemini API — precios por millón de tokens de cada modelo Gemini, útil para repetir el cálculo del ejemplo trabajado con tus propios números.
- Anthropic Chat Model node — n8n Docs — cómo se configura el selector de modelo dentro del nodo que vas a conectar en la lección 3.