Módulo 7: Comparación técnica de proveedores

Tabla comparativa completa

Llegaste a la cápsula de referencia rápida. Aquí consolidamos todo lo aprendido en el módulo (y el path entero hasta ahora) en una sola vista. No es una cápsula para leer linealmente — es una cápsula para marcar y volver cuando tengas que decidir o explicar.

Al terminar vas a poder:

  • Tener a la mano una tabla maestra de los 5 proveedores en todas las dimensiones
  • Reconocer en segundos qué proveedor es mejor para qué caso
  • Compartir la tabla con tu equipo o cofounder como referencia común
  • Adaptar la tabla a tu producto agregando o quitando dimensiones según tu contexto

La tabla maestra

Datos a inicios de 2026. Los números cambian — usa esta tabla como template estructural, no como verdad eterna. Reemplaza con tus benchmarks reales para producción.

Resumen ejecutivo

ProveedorTipoSetupLatencia P95 típicaCosto /M tokensCalidad típicaCuándo gana
OpenAIManaged cloud5 min1.5-3s$0.15-$2.50 input⭐⭐⭐⭐⭐Default seguro, MVP, calidad alta
AnthropicManaged cloud5 min1.8-3.5s$3-$15 input⭐⭐⭐⭐⭐Razonamiento complejo, contextos largos
OpenRouterAgregador5 min2-4s$0.07-$15 (variable)⭐⭐⭐⭐Multi-modelo, fallback, costo bajo con OSS
LM StudioLocal (GUI)10 min4-8s (CPU/GPU local)$0 operativo⭐⭐⭐Dev local, privacidad, no API key
OllamaLocal (CLI)15 min3-7s (varía hardware)$0 operativo⭐⭐⭐Producción on-prem, integración Docker
ModalServerless GPU20 min2-4s (warm) / 15-30s (cold)GPU-second⭐⭐⭐ (modelo OSS) a ⭐⭐⭐⭐⭐ (si pones GPT-equivalent)Tráfico variable, modelos OSS sin DevOps

Por dimensión técnica

DimensiónOpenAIAnthropicOpenRouterLM StudioOllamaModal
Setup5min5min5min10min15min20min
HostingUSA / multiUSAUSA / EU configurableLocalLocal / VPSMulti-región
AuthAPI keyAPI keyAPI keySin auth (local)Sin auth (local)Token Bearer
Modelos disponibles~10 (cerrados)~6 (cerrados)100+ (open + cerrados)Open (HF)Open (curated)Cualquiera (open)
Streaming✅ SSE✅ SSE✅ SSE✅ SSE✅ SSE✅ con tu impl
Function calling✅ Maduro✅ Maduro⚠️ Depende del modelo⚠️ Limitado⚠️ Limitado✅ con tu impl
JSON mode estricto⚠️ Depende del modelo⚠️ Limitado⚠️ Limitado✅ con tu impl
Multimodal (visión)✅ gpt-4o✅ Claude 3+⚠️ Algunos modelos⚠️ Algunos⚠️ Algunos (llava)✅ con tu impl
Vendor lock-inMedio-altoMedio-altoBajo (multi-model)BajoBajoBajo (tu código)

Por dimensión económica

DimensiónOpenAIAnthropicOpenRouterLM StudioOllama (self-host)Modal
Modelo de costoPor tokenPor tokenPor token$0 + hardware$0 + hardware/VMGPU-second
Free tier inicialTrial limitadoCréditosCréditosN/AN/A$30/mes
Costo para 10K req/mes~$5-50~$15-100~$1-30$0$0 (local)~$10-30
Costo para 1M req/mes~$500-5000~$1500-15000~$100-3000$0 (no escala así)~$720 (1 GPU)~$300-1500
Warm pool / fijoNo aplicaNo aplicaNo aplicaNo aplicaSí: VM 24/7Opcional con min_containers
Predicción de costoAlta (por token)Alta (por token)AltaN/AMuy alta (fijo)Media (depende uso)
Cost optimization disponibleCaching, modelos chicosCaching, prompt batchingCambiar modelo baratoN/AOptimizar batchingCuantización, GPU sizing

Por requisitos operacionales

RequisitoOpenAIAnthropicOpenRouterLM StudioOllamaModal
Necesita API key externa
Necesita tarjeta de crédito✅ (después de free tier)
Funciona offline
DevOps necesarioMínimoMínimoMínimoMínimoMedio-altoMínimo
Mantenimiento humanoCasi ceroCasi ceroCasi ceroBajoMedioBajo
Autoscaling✅ Auto✅ Auto✅ Auto❌ (manual)✅ Auto
Cold startsNoNoNoNoSolo al levantarSí (mitigable)
Soporte enterprise / SLA✅ Plans✅ Plans⚠️ Limitado⚠️ Pro plans

Por requisitos de compliance / privacidad

RequisitoOpenAIAnthropicOpenRouterLM StudioOllamaModal
SOC2 Type IIVerificarN/AN/A
HIPAA BAA✅ (plans)✅ (plans)Verificar⚠️ Tú lo controlas⚠️ Tú lo controlasVerificar
GDPR✅ (local)✅ (local)
Data residency EU⚠️ Configurable⚠️ Configurable⚠️ Por proveedor✅ (local)✅ (local)✅ con región EU
No data retention para training✅ default✅ defaultDepende provider
On-premise possibleLimited (Bedrock)

La tabla "para qué uso cada uno"

Mapeo rápido de caso de uso → recomendación primaria + alternativas:

Caso de usoRecomendación primariaAlternativasPor qué
MVP con presupuesto chico ($0)LM Studio o Ollama localOpenRouter free tierSin pagar y aprendes
MVP rápido para validarOpenAI GPT-4o-miniAnthropic Claude 3.5 HaikuSetup 5min, calidad alta, costo bajo a poco volumen
Producto B2C alto volumenOpenRouter con Mistral/MixtralSelf-hosted si volumen >2M req/mesCosto bajo, calidad aceptable
Producto B2B premiumOpenAI gpt-4o o Anthropic Claude 3.5 SonnetModal con Mixtral 8x22BCalidad importa más que costo
Asistente médico / legalAnthropic Claude (razonamiento)OpenAI gpt-4oPrecisión + reasoning
Chatbot multi-idiomaOpenAI o AnthropicOpenRouter con modelo especializadoSoporte robusto multilingüe
Análisis batch nocturnoOpenRouter con MistralModal con cuantizaciónCosto bajo, latencia no importa
Tráfico burst (eventos)ModalOpenAI con autoscaling externoServerless escala automático
Privacidad on-prem mandatoriaOllama self-hostedLM Studio en máquinas dedicadasDatos nunca salen
Dev / experimentación localLM Studio (GUI) o Ollama (CLI)Modal con free tierSin costo, iteración rápida
Multi-provider fallbackOpenRouterTu Unified Client (M08)Failover automático
Edge / IoT con LLM ligeroOllama en device + modelo pequeñoLM Studio con phi-3Local, sin red

Diagrama de decisión rápida

¿Restricción de privacidad/on-prem?
├── SÍ → Ollama o LM Studio (local)
└── NO ↓

¿Volumen mensual esperado?
├── < 50K req/mes → OpenAI GPT-4o-mini o Anthropic Claude Haiku
├── 50K-500K req/mes ↓
│   ├── Calidad crítica → OpenAI gpt-4o o Anthropic Claude Sonnet
│   ├── Costo crítico → OpenRouter Mistral
│   └── Tráfico burst → Modal
└── > 500K req/mes ↓
    ├── Calidad GPT-4 mandatoria → OpenAI (más rate limit)
    ├── OSS aceptable, constante → Self-hosted Ollama
    └── OSS aceptable, variable → Modal con autoscaling

Cómo usar esta tabla en una conversación de decisión

Mal patrón: "Modal es mejor porque tiene autoscaling."

Buen patrón: "Para nuestro tráfico de 200K req/mes con bursts de 3× en horario laboral, Modal sale en ~$300/mes y OpenAI sale en ~$200/mes. La diferencia de costo es marginal ($100/mes); decide la calidad: con GPT-4o-mini obtenemos 86% en nuestro eval set, con Mistral 7B obtenemos 69%. Si necesitas el 86%, OpenAI; si 69% basta, Modal nos da control del modelo. Recomiendo OpenAI dado nuestro SLA."

La diferencia: la segunda es una decisión técnica con números.


Trampas comunes al usar tablas comparativas

Trampa 1 — "Confío en la tabla de un blog." Las tablas de blogs envejecen. Los precios cambian, los modelos salen y entran. Esta tabla es template. Sustituye con tus benchmarks antes de comprometerte.

Trampa 2 — "Estrellitas son métrica." "⭐⭐⭐⭐ vs ⭐⭐⭐⭐⭐" no es información medible. Esas estrellitas en esta tabla son orientativas para empezar; tu decisión real va con números.

Trampa 3 — "Una sola tabla decide todo." Una tabla es input. La decisión incluye: familiaridad del equipo, soporte enterprise, contratos legales, roadmap del proveedor. La tabla acota, no decide.

Trampa 4 — "No considero combinar proveedores." Tu producto puede usar OpenAI para razonamiento complejo + Modal para alto volumen barato + Ollama local para dev. La elección no tiene que ser one-size-fits-all.


Ejercicio

Adapta esta tabla a tu producto. Específicamente:

  1. Elimina dimensiones que no te importan. Si no haces multimodal, borra la fila. Si no necesitas HIPAA, borra esa.
  2. Agrega dimensiones que sí. ¿Te importa soporte en español? ¿Latencia desde tu región específica? ¿Compatibilidad con tu API gateway?
  3. Sustituye los números genéricos por benchmarks que mediste en cápsulas 02-04.
  4. Marca tu top 3 con explicación de una línea cada uno.
  5. Pégala en tu repo (docs/llm-providers.md) o Notion del equipo.

Esto es infraestructura compartida del equipo. Cuando un PM pregunta "¿usamos OpenAI o Anthropic para X feature?", la tabla es la primera respuesta.


Resumen

Tienes:

  • ✅ Tabla maestra estructurada por dimensiones técnicas, económicas, operacionales y compliance
  • ✅ Mapeo caso de uso → recomendación primaria + alternativas
  • ✅ Árbol de decisión rápido para conversación con stakeholders
  • ✅ Recomendaciones de cómo usar tablas en discusiones técnicas

Checkpoint: si abres esta cápsula 6 meses después y puedes decidir en 30 segundos qué proveedor evaluar para un caso nuevo, la tabla está cumpliendo su trabajo.


Siguiente cápsula

08 — Proyecto: decision tool. Cerramos el módulo construyendo una herramienta Python automatizada que toma como input un perfil de requisitos (volumen, latencia objetivo, presupuesto, restricciones) y emite una recomendación con justificación. Es la materialización ejecutable de todo lo aprendido en M07.


Recursos

  1. Artificial Analysis — Provider Comparison — benchmarks públicos comparativos actualizados.
  2. LLM Performance Leaderboard (Vellum) — benchmarks de calidad.
  3. LMSys Chatbot Arena — comparación human-eval pareada.
  4. Awesome LLM Ops — listado curado de herramientas.