Módulo 1: Decision Framework para Acceso a LLMs
Trade-offs Cuantitativos: Comparación con Datos Reales
Descripción de la cápsula
Ya sabes las 5 dimensiones de evaluación y el panorama de opciones. Ahora necesitas datos cuantitativos para validar tu decisión.
Esta cápsula te da benchmarks reales actualizados (Febrero 2026) para comparar proveedores objetivamente. No más "OpenAI es rápido" (vago), sino "OpenAI: 1.5s latency vs Ollama: 5.8s" (específico).
Los datos provienen de:
- Pricing oficial de proveedores (Febrero 2026)
- Benchmarks públicos (Artificial Analysis, LMSys)
- Tests propios en hardware estándar
- Políticas de privacidad actualizadas
Importante: Estos datos pueden cambiar. Valida precios actuales en los links de recursos antes de tomar decisiones finales.
💰 Comparación de Costo
Pricing actualizado (Febrero 2026):
OpenAI API:
| Modelo | Input ($/1M tokens) | Output ($/1M tokens) | Context | Mejor para |
|---|---|---|---|---|
| GPT-4-turbo | $10.00 | $30.00 | 128k | Tareas complejas |
| GPT-4 | $30.00 | $60.00 | 8k | Máxima calidad |
| GPT-3.5-turbo | $0.50 | $1.50 | 16k | Balance costo/calidad |
Cálculo ejemplo (10k queries/día):
GPT-3.5-turbo:
- 10k queries × 500 tokens promedio × 30 días = 150M tokens/mes
- Input (300 tokens): 150M × 0.6 × $0.50/1M = $45
- Output (200 tokens): 150M × 0.4 × $1.50/1M = $90
- Total: $135/mes
Ollama local:
| Costo | Valor | Notas |
|---|---|---|
| Setup hardware | $500-5000 | Depende GPU (RTX 4090: $1800, Mac M2: $2000) |
| Operativo | $0/mes | Electricidad ~$10/mes (negligible) |
| Mantenimiento | $0-500/mes | Si necesitas DevOps (20% time senior = $500) |
Cálculo ejemplo:
Año 1:
- Hardware: $2000 (one-time)
- Operativo: $0 × 12 = $0
- Mantenimiento: $200/mes × 12 = $2400
- Total: $4400 año 1
Año 2+:
- Hardware: $0 (ya comprado)
- Operativo: $0
- Mantenimiento: $2400/año
- Total: $2400/año
Break-even vs OpenAI ($135/mes = $1620/año):
- Año 1: Ollama más caro ($4400 vs $1620)
- Año 2: Ollama más barato ($2400 vs $1620... wait, $1620 < $2400)
- **Conclusión: OpenAI CHEAPER** para este volumen
Ollama es cheaper cuando volumen es ALTO (>1M queries/mes).
OpenRouter:
| Modelo | Precio ($/1M tokens) | vs OpenAI | Ahorro |
|---|---|---|---|
| GPT-3.5-turbo | $0.50 | Igual | 0% |
| Claude 3 Haiku | $0.25 | 50% | 50% |
| Mixtral 8x7B | $0.24 | 52% | 95% vs GPT-4 |
| Llama 2 70B | $0.70 | 40% cheaper GPT-3.5 | - |
Ventaja: Puedes usar modelos baratos para queries simples, GPT-4 para complejas.
Estrategia híbrida:
- 80% queries simples: Mixtral ($0.24/1M) = $108/mes
- 20% queries complejas: GPT-4 ($20/1M) = $600/mes
- Total: $708/mes
vs OpenAI solo GPT-4: $3000/mes
Ahorro: $2292/mes (76%)
Modal serverless:
| Recurso | Costo | Notas |
|---|---|---|
| CPU (vCPU-second) | $0.000180 | Para modelos pequeños |
| GPU A10G | $0.000700/s | ~$2.52/hora |
| GPU A100 | $0.002500/s | ~$9/hora |
| Cold start | Gratis | Pero añade latency |
Cálculo ejemplo (Mistral 7B en A10G):
10k queries/día:
- Promedio 3s/query (GPU time)
- 10k × 3s = 30,000s GPU/día
- 30,000s × $0.0007 = $21/día = $630/mes
vs OpenAI GPT-3.5: $135/mes
→ Modal es 4.6x MÁS CARO para este volumen
**Conclusión: Modal es mejor para tráfico VARIABLE, no constante.**
⚡ Comparación de Velocidad
Latency benchmarks (prompt 200 tokens → output 200 tokens):
Fuente: Tests propios + Artificial Analysis (Enero 2026)
| Proveedor | Time to First Token | Tokens/segundo | Latency total | Consistency |
|---|---|---|---|---|
| OpenAI GPT-3.5 | 300ms | 90 tok/s | 1.5s | Alta (±200ms) |
| OpenAI GPT-4 | 800ms | 40 tok/s | 3.2s | Alta (±300ms) |
| OpenRouter Mixtral | 400ms | 70 tok/s | 2.1s | Media (±500ms) |
| Ollama Mistral 7B (M2 Mac) | 1200ms | 35 tok/s | 5.8s | Media (±1s) |
| Ollama Llama 2 70B (A100 GPU) | 600ms | 60 tok/s | 3.5s | Alta (±400ms) |
| Modal Mistral 7B (warm) | 400ms | 80 tok/s | 1.9s | Alta (±300ms) |
| Modal Mistral 7B (cold) | 3500ms | 80 tok/s | 5.4s | N/A |
Observaciones:
- OpenAI GPT-3.5 es el más rápido (1.5s)
- Ollama local varía MUCHO (hardware dependiente)
- Modal tiene cold start problem (3.5s overhead primera request)
- Consistency importa: OpenAI es predecible, Ollama local puede variar
🏆 Comparación de Calidad
Accuracy benchmarks (MMLU, MT-Bench):
Fuente: LMSys Chatbot Arena + OpenAI evals (Enero 2026)
| Modelo | MMLU (%) | MT-Bench | Español | Mejor para |
|---|---|---|---|---|
| GPT-4-turbo | 86.4% | 9.32 | Excelente | Razonamiento complejo |
| GPT-3.5-turbo | 70.0% | 8.39 | Excelente | Balance calidad/costo |
| Claude 3 Opus | 86.8% | 9.18 | Excelente | Textos largos |
| Mixtral 8x7B | 70.6% | 8.30 | Muy bueno | Open source quality |
| Mistral 7B | 62.5% | 7.60 | Bueno | Local ligero |
| Llama 2 70B | 68.9% | 8.18 | Bueno | Local con calidad |
| Llama 2 13B | 54.8% | 6.89 | Básico | Prototipos |
Interpretación:
- 86%+ MMLU: Tareas complejas (legal, médico, financiero)
- 70-85% MMLU: Chatbots, soporte, escritura general
- 60-70% MMLU: Prototipos, desarrollo
- <60% MMLU: Solo experimentación
Para e-commerce chatbot (soporte básico): 70%+ es suficiente
- ✅ GPT-3.5, Claude 3, Mixtral, Llama 2 70B
- ⚠️ Mistral 7B (borderline)
- ❌ Llama 2 13B (insuficiente)
🔐 Comparación de Privacidad
Políticas de data retention (Febrero 2026):
| Proveedor | Retención | Training | Ubicación | GDPR | HIPAA |
|---|---|---|---|---|---|
| OpenAI API | 30 días (puede cambiar) | NO (opt-out default) | USA (Azure) | Parcial | No |
| Ollama local | NUNCA (no sale) | NUNCA | Tu hardware | ✅ Compliant | ✅ Compliant |
| OpenRouter | Variable (depende modelo) | Variable | USA + otros | Parcial | No |
| Modal | Durante ejecución | NO | USA (AWS) | Parcial | No |
| LM Studio | NUNCA (local) | NUNCA | Tu laptop | ✅ Compliant | ✅ Compliant |
Fuentes oficiales:
- OpenAI: https://openai.com/policies/api-data-usage-policies
- Ollama: https://ollama.com/ (no envía datos)
- OpenRouter: https://openrouter.ai/privacy
- Modal: https://modal.com/privacy
Interpretación:
Si necesitas HIPAA/GDPR strict:
- ✅ SOLO opciones locales (Ollama, LM Studio)
- ❌ OpenAI, Modal, OpenRouter NO son compliant sin BAA (Business Associate Agreement)
Si datos son públicos:
- ✅ Cualquier opción funciona
- Considera simplicidad y costo como factores principales
🎯 Scorecard Comparativo
Proyecto ejemplo: E-commerce chatbot (15k queries/día)
| Dimensión | OpenAI GPT-3.5 | Ollama Mistral 7B | OpenRouter Mixtral | Modal Mistral | Ganador |
|---|---|---|---|---|---|
| Costo/mes | $135 | $2200* (año 1) | $108 | $630 | OpenRouter |
| Latency | 1.5s | 5.8s | 2.1s | 1.9s (warm) | OpenAI |
| Calidad (MMLU) | 70% | 62.5% | 70.6% | 70.6% | OpenRouter |
| Privacidad | Media (30d) | Máxima (local) | Media | Media | Ollama |
| Simplicidad | Alta (1 día) | Media (1 sem) | Alta (1 día) | Media (2-3 días) | OpenAI/Router |
| Escalabilidad | Auto | Manual | Auto | Auto | OpenAI/Modal |
*Año 1 incluye $2k hardware. Año 2+: $2400/año.
Análisis:
Para este proyecto específico (e-commerce, 15k queries/día):
Si prioridad = Velocidad + Simplicidad: → OpenAI API gana (1.5s, setup 1 día)
Si prioridad = Costo: → OpenRouter gana ($108/mes, 20% cheaper que OpenAI)
Si prioridad = Privacidad: → Ollama gana (100% local), pero costo año 1 es 16x más caro
📊 Resumen
Conceptos clave:
-
Costo NO es binario (gratis/caro):
- OpenAI: $135/mes para 15k queries
- Ollama: $0 operativo, pero $2200 año 1 (hardware + DevOps)
- OpenRouter: $108/mes (20% saving vs OpenAI)
- Modal: $630/mes (4.6x más caro para volumen constante)
-
Velocidad varía significativamente:
- OpenAI: 1.5s (más rápido)
- Modal warm: 1.9s (casi igual)
- OpenRouter: 2.1s (aceptable)
- Ollama local: 5.8s (3.8x más lento en hardware modesto)
-
Calidad está convergiendo:
- GPT-4: 86% MMLU (líder)
- GPT-3.5/Mixtral: ~70% (suficiente para most use cases)
- Mistral 7B: 62.5% (prototipos)
-
Privacidad es binario (local vs cloud):
- Ollama/LM Studio: 100% private
- OpenAI/Modal/OpenRouter: Cloud (políticas aceptables pero no zero-trust)
-
Usa datos para validar decisión:
- No decidas solo por "feeling"
- Calcula costo exacto para TU volumen
- Benchmark en TU hardware (si local)
🔗 Recursos adicionales
- Artificial Analysis - LLM Comparison - Benchmarks actualizados
- OpenAI Pricing - Oficial, actualizado
- OpenRouter Model Pricing - Compare todos los modelos
- LMSys Chatbot Arena - Quality leaderboard
- Modal Pricing Calculator - Estima costos serverless
⚠️ Importante: Pricing cambia frecuentemente. Valida estos números ANTES de decidir (links arriba siempre actualizados).
➡️ Próximo paso
Siguiente cápsula: 06-casos-uso-reales.md
Ahora que tienes datos cuantitativos, verás casos de uso reales donde se aplicó el framework:
- Startup sin presupuesto
- Enterprise con datos sensibles
- Prototipo rápido
- Producción escalable
Aprenderás de decisiones reales y por qué se eligió cada proveedor.
Tiempo de lectura: 10-12 minutos
Siguiente: 06-casos-uso-reales.md