Módulo 1: Decision Framework para Acceso a LLMs

Trade-offs Cuantitativos: Comparación con Datos Reales

Descripción de la cápsula

Ya sabes las 5 dimensiones de evaluación y el panorama de opciones. Ahora necesitas datos cuantitativos para validar tu decisión.

Esta cápsula te da benchmarks reales actualizados (Febrero 2026) para comparar proveedores objetivamente. No más "OpenAI es rápido" (vago), sino "OpenAI: 1.5s latency vs Ollama: 5.8s" (específico).

Los datos provienen de:

  • Pricing oficial de proveedores (Febrero 2026)
  • Benchmarks públicos (Artificial Analysis, LMSys)
  • Tests propios en hardware estándar
  • Políticas de privacidad actualizadas

Importante: Estos datos pueden cambiar. Valida precios actuales en los links de recursos antes de tomar decisiones finales.


💰 Comparación de Costo

Pricing actualizado (Febrero 2026):

OpenAI API:

ModeloInput ($/1M tokens)Output ($/1M tokens)ContextMejor para
GPT-4-turbo$10.00$30.00128kTareas complejas
GPT-4$30.00$60.008kMáxima calidad
GPT-3.5-turbo$0.50$1.5016kBalance costo/calidad

Cálculo ejemplo (10k queries/día):

GPT-3.5-turbo:
- 10k queries × 500 tokens promedio × 30 días = 150M tokens/mes
- Input (300 tokens): 150M × 0.6 × $0.50/1M = $45
- Output (200 tokens): 150M × 0.4 × $1.50/1M = $90
- Total: $135/mes

Ollama local:

CostoValorNotas
Setup hardware$500-5000Depende GPU (RTX 4090: $1800, Mac M2: $2000)
Operativo$0/mesElectricidad ~$10/mes (negligible)
Mantenimiento$0-500/mesSi necesitas DevOps (20% time senior = $500)

Cálculo ejemplo:

Año 1:
- Hardware: $2000 (one-time)
- Operativo: $0 × 12 = $0
- Mantenimiento: $200/mes × 12 = $2400
- Total: $4400 año 1

Año 2+:
- Hardware: $0 (ya comprado)
- Operativo: $0
- Mantenimiento: $2400/año
- Total: $2400/año

Break-even vs OpenAI ($135/mes = $1620/año):
- Año 1: Ollama más caro ($4400 vs $1620)
- Año 2: Ollama más barato ($2400 vs $1620... wait, $1620 < $2400)
- **Conclusión: OpenAI CHEAPER** para este volumen

Ollama es cheaper cuando volumen es ALTO (>1M queries/mes).


OpenRouter:

ModeloPrecio ($/1M tokens)vs OpenAIAhorro
GPT-3.5-turbo$0.50Igual0%
Claude 3 Haiku$0.2550%50%
Mixtral 8x7B$0.2452%95% vs GPT-4
Llama 2 70B$0.7040% cheaper GPT-3.5-

Ventaja: Puedes usar modelos baratos para queries simples, GPT-4 para complejas.

Estrategia híbrida:
- 80% queries simples: Mixtral ($0.24/1M) = $108/mes
- 20% queries complejas: GPT-4 ($20/1M) = $600/mes
- Total: $708/mes

vs OpenAI solo GPT-4: $3000/mes
Ahorro: $2292/mes (76%)

Modal serverless:

RecursoCostoNotas
CPU (vCPU-second)$0.000180Para modelos pequeños
GPU A10G$0.000700/s~$2.52/hora
GPU A100$0.002500/s~$9/hora
Cold startGratisPero añade latency

Cálculo ejemplo (Mistral 7B en A10G):

10k queries/día:
- Promedio 3s/query (GPU time)
- 10k × 3s = 30,000s GPU/día
- 30,000s × $0.0007 = $21/día = $630/mes

vs OpenAI GPT-3.5: $135/mes
→ Modal es 4.6x MÁS CARO para este volumen

**Conclusión: Modal es mejor para tráfico VARIABLE, no constante.**

⚡ Comparación de Velocidad

Latency benchmarks (prompt 200 tokens → output 200 tokens):

Fuente: Tests propios + Artificial Analysis (Enero 2026)

ProveedorTime to First TokenTokens/segundoLatency totalConsistency
OpenAI GPT-3.5300ms90 tok/s1.5sAlta (±200ms)
OpenAI GPT-4800ms40 tok/s3.2sAlta (±300ms)
OpenRouter Mixtral400ms70 tok/s2.1sMedia (±500ms)
Ollama Mistral 7B (M2 Mac)1200ms35 tok/s5.8sMedia (±1s)
Ollama Llama 2 70B (A100 GPU)600ms60 tok/s3.5sAlta (±400ms)
Modal Mistral 7B (warm)400ms80 tok/s1.9sAlta (±300ms)
Modal Mistral 7B (cold)3500ms80 tok/s5.4sN/A

Observaciones:

  1. OpenAI GPT-3.5 es el más rápido (1.5s)
  2. Ollama local varía MUCHO (hardware dependiente)
  3. Modal tiene cold start problem (3.5s overhead primera request)
  4. Consistency importa: OpenAI es predecible, Ollama local puede variar

🏆 Comparación de Calidad

Accuracy benchmarks (MMLU, MT-Bench):

Fuente: LMSys Chatbot Arena + OpenAI evals (Enero 2026)

ModeloMMLU (%)MT-BenchEspañolMejor para
GPT-4-turbo86.4%9.32ExcelenteRazonamiento complejo
GPT-3.5-turbo70.0%8.39ExcelenteBalance calidad/costo
Claude 3 Opus86.8%9.18ExcelenteTextos largos
Mixtral 8x7B70.6%8.30Muy buenoOpen source quality
Mistral 7B62.5%7.60BuenoLocal ligero
Llama 2 70B68.9%8.18BuenoLocal con calidad
Llama 2 13B54.8%6.89BásicoPrototipos

Interpretación:

  • 86%+ MMLU: Tareas complejas (legal, médico, financiero)
  • 70-85% MMLU: Chatbots, soporte, escritura general
  • 60-70% MMLU: Prototipos, desarrollo
  • <60% MMLU: Solo experimentación

Para e-commerce chatbot (soporte básico): 70%+ es suficiente

  • ✅ GPT-3.5, Claude 3, Mixtral, Llama 2 70B
  • ⚠️ Mistral 7B (borderline)
  • ❌ Llama 2 13B (insuficiente)

🔐 Comparación de Privacidad

Políticas de data retention (Febrero 2026):

ProveedorRetenciónTrainingUbicaciónGDPRHIPAA
OpenAI API30 días (puede cambiar)NO (opt-out default)USA (Azure)ParcialNo
Ollama localNUNCA (no sale)NUNCATu hardware✅ Compliant✅ Compliant
OpenRouterVariable (depende modelo)VariableUSA + otrosParcialNo
ModalDurante ejecuciónNOUSA (AWS)ParcialNo
LM StudioNUNCA (local)NUNCATu laptop✅ Compliant✅ Compliant

Fuentes oficiales:

Interpretación:

Si necesitas HIPAA/GDPR strict:

  • ✅ SOLO opciones locales (Ollama, LM Studio)
  • ❌ OpenAI, Modal, OpenRouter NO son compliant sin BAA (Business Associate Agreement)

Si datos son públicos:

  • ✅ Cualquier opción funciona
  • Considera simplicidad y costo como factores principales

🎯 Scorecard Comparativo

Proyecto ejemplo: E-commerce chatbot (15k queries/día)

DimensiónOpenAI GPT-3.5Ollama Mistral 7BOpenRouter MixtralModal MistralGanador
Costo/mes$135$2200* (año 1)$108$630OpenRouter
Latency1.5s5.8s2.1s1.9s (warm)OpenAI
Calidad (MMLU)70%62.5%70.6%70.6%OpenRouter
PrivacidadMedia (30d)Máxima (local)MediaMediaOllama
SimplicidadAlta (1 día)Media (1 sem)Alta (1 día)Media (2-3 días)OpenAI/Router
EscalabilidadAutoManualAutoAutoOpenAI/Modal

*Año 1 incluye $2k hardware. Año 2+: $2400/año.

Análisis:

Para este proyecto específico (e-commerce, 15k queries/día):

Si prioridad = Velocidad + Simplicidad:OpenAI API gana (1.5s, setup 1 día)

Si prioridad = Costo:OpenRouter gana ($108/mes, 20% cheaper que OpenAI)

Si prioridad = Privacidad:Ollama gana (100% local), pero costo año 1 es 16x más caro


📊 Resumen

Conceptos clave:

  1. Costo NO es binario (gratis/caro):

    • OpenAI: $135/mes para 15k queries
    • Ollama: $0 operativo, pero $2200 año 1 (hardware + DevOps)
    • OpenRouter: $108/mes (20% saving vs OpenAI)
    • Modal: $630/mes (4.6x más caro para volumen constante)
  2. Velocidad varía significativamente:

    • OpenAI: 1.5s (más rápido)
    • Modal warm: 1.9s (casi igual)
    • OpenRouter: 2.1s (aceptable)
    • Ollama local: 5.8s (3.8x más lento en hardware modesto)
  3. Calidad está convergiendo:

    • GPT-4: 86% MMLU (líder)
    • GPT-3.5/Mixtral: ~70% (suficiente para most use cases)
    • Mistral 7B: 62.5% (prototipos)
  4. Privacidad es binario (local vs cloud):

    • Ollama/LM Studio: 100% private
    • OpenAI/Modal/OpenRouter: Cloud (políticas aceptables pero no zero-trust)
  5. Usa datos para validar decisión:

    • No decidas solo por "feeling"
    • Calcula costo exacto para TU volumen
    • Benchmark en TU hardware (si local)

🔗 Recursos adicionales

  1. Artificial Analysis - LLM Comparison - Benchmarks actualizados
  2. OpenAI Pricing - Oficial, actualizado
  3. OpenRouter Model Pricing - Compare todos los modelos
  4. LMSys Chatbot Arena - Quality leaderboard
  5. Modal Pricing Calculator - Estima costos serverless

⚠️ Importante: Pricing cambia frecuentemente. Valida estos números ANTES de decidir (links arriba siempre actualizados).


➡️ Próximo paso

Siguiente cápsula: 06-casos-uso-reales.md

Ahora que tienes datos cuantitativos, verás casos de uso reales donde se aplicó el framework:

  • Startup sin presupuesto
  • Enterprise con datos sensibles
  • Prototipo rápido
  • Producción escalable

Aprenderás de decisiones reales y por qué se eligió cada proveedor.


Tiempo de lectura: 10-12 minutos
Siguiente: 06-casos-uso-reales.md