Módulo 7: Comparación técnica de proveedores
Tabla comparativa completa
Llegaste a la cápsula de referencia rápida. Aquí consolidamos todo lo aprendido en el módulo (y el path entero hasta ahora) en una sola vista. No es una cápsula para leer linealmente — es una cápsula para marcar y volver cuando tengas que decidir o explicar.
Al terminar vas a poder:
- Tener a la mano una tabla maestra de los 5 proveedores en todas las dimensiones
- Reconocer en segundos qué proveedor es mejor para qué caso
- Compartir la tabla con tu equipo o cofounder como referencia común
- Adaptar la tabla a tu producto agregando o quitando dimensiones según tu contexto
La tabla maestra
Datos a inicios de 2026. Los números cambian — usa esta tabla como template estructural, no como verdad eterna. Reemplaza con tus benchmarks reales para producción.
Resumen ejecutivo
| Proveedor | Tipo | Setup | Latencia P95 típica | Costo /M tokens | Calidad típica | Cuándo gana |
|---|---|---|---|---|---|---|
| OpenAI | Managed cloud | 5 min | 1.5-3s | $0.15-$2.50 input | ⭐⭐⭐⭐⭐ | Default seguro, MVP, calidad alta |
| Anthropic | Managed cloud | 5 min | 1.8-3.5s | $3-$15 input | ⭐⭐⭐⭐⭐ | Razonamiento complejo, contextos largos |
| OpenRouter | Agregador | 5 min | 2-4s | $0.07-$15 (variable) | ⭐⭐⭐⭐ | Multi-modelo, fallback, costo bajo con OSS |
| LM Studio | Local (GUI) | 10 min | 4-8s (CPU/GPU local) | $0 operativo | ⭐⭐⭐ | Dev local, privacidad, no API key |
| Ollama | Local (CLI) | 15 min | 3-7s (varía hardware) | $0 operativo | ⭐⭐⭐ | Producción on-prem, integración Docker |
| Modal | Serverless GPU | 20 min | 2-4s (warm) / 15-30s (cold) | GPU-second | ⭐⭐⭐ (modelo OSS) a ⭐⭐⭐⭐⭐ (si pones GPT-equivalent) | Tráfico variable, modelos OSS sin DevOps |
Por dimensión técnica
| Dimensión | OpenAI | Anthropic | OpenRouter | LM Studio | Ollama | Modal |
|---|---|---|---|---|---|---|
| Setup | 5min | 5min | 5min | 10min | 15min | 20min |
| Hosting | USA / multi | USA | USA / EU configurable | Local | Local / VPS | Multi-región |
| Auth | API key | API key | API key | Sin auth (local) | Sin auth (local) | Token Bearer |
| Modelos disponibles | ~10 (cerrados) | ~6 (cerrados) | 100+ (open + cerrados) | Open (HF) | Open (curated) | Cualquiera (open) |
| Streaming | ✅ SSE | ✅ SSE | ✅ SSE | ✅ SSE | ✅ SSE | ✅ con tu impl |
| Function calling | ✅ Maduro | ✅ Maduro | ⚠️ Depende del modelo | ⚠️ Limitado | ⚠️ Limitado | ✅ con tu impl |
| JSON mode estricto | ✅ | ✅ | ⚠️ Depende del modelo | ⚠️ Limitado | ⚠️ Limitado | ✅ con tu impl |
| Multimodal (visión) | ✅ gpt-4o | ✅ Claude 3+ | ⚠️ Algunos modelos | ⚠️ Algunos | ⚠️ Algunos (llava) | ✅ con tu impl |
| Vendor lock-in | Medio-alto | Medio-alto | Bajo (multi-model) | Bajo | Bajo | Bajo (tu código) |
Por dimensión económica
| Dimensión | OpenAI | Anthropic | OpenRouter | LM Studio | Ollama (self-host) | Modal |
|---|---|---|---|---|---|---|
| Modelo de costo | Por token | Por token | Por token | $0 + hardware | $0 + hardware/VM | GPU-second |
| Free tier inicial | Trial limitado | Créditos | Créditos | N/A | N/A | $30/mes |
| Costo para 10K req/mes | ~$5-50 | ~$15-100 | ~$1-30 | $0 | $0 (local) | ~$10-30 |
| Costo para 1M req/mes | ~$500-5000 | ~$1500-15000 | ~$100-3000 | $0 (no escala así) | ~$720 (1 GPU) | ~$300-1500 |
| Warm pool / fijo | No aplica | No aplica | No aplica | No aplica | Sí: VM 24/7 | Opcional con min_containers |
| Predicción de costo | Alta (por token) | Alta (por token) | Alta | N/A | Muy alta (fijo) | Media (depende uso) |
| Cost optimization disponible | Caching, modelos chicos | Caching, prompt batching | Cambiar modelo barato | N/A | Optimizar batching | Cuantización, GPU sizing |
Por requisitos operacionales
| Requisito | OpenAI | Anthropic | OpenRouter | LM Studio | Ollama | Modal |
|---|---|---|---|---|---|---|
| Necesita API key externa | ✅ | ✅ | ✅ | ❌ | ❌ | ✅ |
| Necesita tarjeta de crédito | ✅ | ✅ | ✅ | ❌ | ❌ | ✅ (después de free tier) |
| Funciona offline | ❌ | ❌ | ❌ | ✅ | ✅ | ❌ |
| DevOps necesario | Mínimo | Mínimo | Mínimo | Mínimo | Medio-alto | Mínimo |
| Mantenimiento humano | Casi cero | Casi cero | Casi cero | Bajo | Medio | Bajo |
| Autoscaling | ✅ Auto | ✅ Auto | ✅ Auto | ❌ | ❌ (manual) | ✅ Auto |
| Cold starts | No | No | No | No | Solo al levantar | Sí (mitigable) |
| Soporte enterprise / SLA | ✅ Plans | ✅ Plans | ⚠️ Limitado | ❌ | ❌ | ⚠️ Pro plans |
Por requisitos de compliance / privacidad
| Requisito | OpenAI | Anthropic | OpenRouter | LM Studio | Ollama | Modal |
|---|---|---|---|---|---|---|
| SOC2 Type II | ✅ | ✅ | Verificar | N/A | N/A | ✅ |
| HIPAA BAA | ✅ (plans) | ✅ (plans) | Verificar | ⚠️ Tú lo controlas | ⚠️ Tú lo controlas | Verificar |
| GDPR | ✅ | ✅ | ✅ | ✅ (local) | ✅ (local) | ✅ |
| Data residency EU | ⚠️ Configurable | ⚠️ Configurable | ⚠️ Por proveedor | ✅ (local) | ✅ (local) | ✅ con región EU |
| No data retention para training | ✅ default | ✅ default | Depende provider | ✅ | ✅ | ✅ |
| On-premise possible | ❌ | Limited (Bedrock) | ❌ | ✅ | ✅ | ❌ |
La tabla "para qué uso cada uno"
Mapeo rápido de caso de uso → recomendación primaria + alternativas:
| Caso de uso | Recomendación primaria | Alternativas | Por qué |
|---|---|---|---|
| MVP con presupuesto chico ($0) | LM Studio o Ollama local | OpenRouter free tier | Sin pagar y aprendes |
| MVP rápido para validar | OpenAI GPT-4o-mini | Anthropic Claude 3.5 Haiku | Setup 5min, calidad alta, costo bajo a poco volumen |
| Producto B2C alto volumen | OpenRouter con Mistral/Mixtral | Self-hosted si volumen >2M req/mes | Costo bajo, calidad aceptable |
| Producto B2B premium | OpenAI gpt-4o o Anthropic Claude 3.5 Sonnet | Modal con Mixtral 8x22B | Calidad importa más que costo |
| Asistente médico / legal | Anthropic Claude (razonamiento) | OpenAI gpt-4o | Precisión + reasoning |
| Chatbot multi-idioma | OpenAI o Anthropic | OpenRouter con modelo especializado | Soporte robusto multilingüe |
| Análisis batch nocturno | OpenRouter con Mistral | Modal con cuantización | Costo bajo, latencia no importa |
| Tráfico burst (eventos) | Modal | OpenAI con autoscaling externo | Serverless escala automático |
| Privacidad on-prem mandatoria | Ollama self-hosted | LM Studio en máquinas dedicadas | Datos nunca salen |
| Dev / experimentación local | LM Studio (GUI) o Ollama (CLI) | Modal con free tier | Sin costo, iteración rápida |
| Multi-provider fallback | OpenRouter | Tu Unified Client (M08) | Failover automático |
| Edge / IoT con LLM ligero | Ollama en device + modelo pequeño | LM Studio con phi-3 | Local, sin red |
Diagrama de decisión rápida
¿Restricción de privacidad/on-prem?
├── SÍ → Ollama o LM Studio (local)
└── NO ↓
¿Volumen mensual esperado?
├── < 50K req/mes → OpenAI GPT-4o-mini o Anthropic Claude Haiku
├── 50K-500K req/mes ↓
│ ├── Calidad crítica → OpenAI gpt-4o o Anthropic Claude Sonnet
│ ├── Costo crítico → OpenRouter Mistral
│ └── Tráfico burst → Modal
└── > 500K req/mes ↓
├── Calidad GPT-4 mandatoria → OpenAI (más rate limit)
├── OSS aceptable, constante → Self-hosted Ollama
└── OSS aceptable, variable → Modal con autoscaling
Cómo usar esta tabla en una conversación de decisión
Mal patrón: "Modal es mejor porque tiene autoscaling."
Buen patrón: "Para nuestro tráfico de 200K req/mes con bursts de 3× en horario laboral, Modal sale en ~$300/mes y OpenAI sale en ~$200/mes. La diferencia de costo es marginal ($100/mes); decide la calidad: con GPT-4o-mini obtenemos 86% en nuestro eval set, con Mistral 7B obtenemos 69%. Si necesitas el 86%, OpenAI; si 69% basta, Modal nos da control del modelo. Recomiendo OpenAI dado nuestro SLA."
La diferencia: la segunda es una decisión técnica con números.
Trampas comunes al usar tablas comparativas
Trampa 1 — "Confío en la tabla de un blog." Las tablas de blogs envejecen. Los precios cambian, los modelos salen y entran. Esta tabla es template. Sustituye con tus benchmarks antes de comprometerte.
Trampa 2 — "Estrellitas son métrica." "⭐⭐⭐⭐ vs ⭐⭐⭐⭐⭐" no es información medible. Esas estrellitas en esta tabla son orientativas para empezar; tu decisión real va con números.
Trampa 3 — "Una sola tabla decide todo." Una tabla es input. La decisión incluye: familiaridad del equipo, soporte enterprise, contratos legales, roadmap del proveedor. La tabla acota, no decide.
Trampa 4 — "No considero combinar proveedores." Tu producto puede usar OpenAI para razonamiento complejo + Modal para alto volumen barato + Ollama local para dev. La elección no tiene que ser one-size-fits-all.
Ejercicio
Adapta esta tabla a tu producto. Específicamente:
- Elimina dimensiones que no te importan. Si no haces multimodal, borra la fila. Si no necesitas HIPAA, borra esa.
- Agrega dimensiones que sí. ¿Te importa soporte en español? ¿Latencia desde tu región específica? ¿Compatibilidad con tu API gateway?
- Sustituye los números genéricos por benchmarks que mediste en cápsulas 02-04.
- Marca tu top 3 con explicación de una línea cada uno.
- Pégala en tu repo (
docs/llm-providers.md) o Notion del equipo.
Esto es infraestructura compartida del equipo. Cuando un PM pregunta "¿usamos OpenAI o Anthropic para X feature?", la tabla es la primera respuesta.
Resumen
Tienes:
- ✅ Tabla maestra estructurada por dimensiones técnicas, económicas, operacionales y compliance
- ✅ Mapeo caso de uso → recomendación primaria + alternativas
- ✅ Árbol de decisión rápido para conversación con stakeholders
- ✅ Recomendaciones de cómo usar tablas en discusiones técnicas
Checkpoint: si abres esta cápsula 6 meses después y puedes decidir en 30 segundos qué proveedor evaluar para un caso nuevo, la tabla está cumpliendo su trabajo.
Siguiente cápsula
08 — Proyecto: decision tool. Cerramos el módulo construyendo una herramienta Python automatizada que toma como input un perfil de requisitos (volumen, latencia objetivo, presupuesto, restricciones) y emite una recomendación con justificación. Es la materialización ejecutable de todo lo aprendido en M07.
Recursos
- Artificial Analysis — Provider Comparison — benchmarks públicos comparativos actualizados.
- LLM Performance Leaderboard (Vellum) — benchmarks de calidad.
- LMSys Chatbot Arena — comparación human-eval pareada.
- Awesome LLM Ops — listado curado de herramientas.