Módulo 1: Decision Framework para Acceso a LLMs
Matriz de Decisión: Framework Estructurado para Elegir Proveedor LLM
Descripción de la cápsula
Ahora que conoces las 5 dimensiones de evaluación (cápsula 02) y el panorama de opciones disponibles (cápsula 03), necesitas un framework estructurado para tomar la decisión final.
Esta cápsula te da ese framework: una matriz de decisión que mapea requisitos específicos a proveedores recomendados. No es "opinión" ni "feeling", es un proceso sistemático basado en datos.
La matriz funciona así:
- Identificas tus requisitos críticos
- La matriz sugiere 2-3 opciones que encajan
- Evalúas trade-offs específicos
- Tomas decisión informada
Al finalizar esta cápsula, podrás elegir proveedor para cualquier proyecto en <30 minutos siguiendo el framework.
🎯 Objetivo de la cápsula
Objetivo: Aplicar una matriz de decisión estructurada para elegir proveedor LLM basándote en requisitos priorizados.
Al finalizar esta cápsula:
- ✅ Sabrás usar la matriz de decisión
- ✅ Podrás mapear requisitos → proveedor recomendado
- ✅ Entenderás cuándo hay múltiples opciones válidas
- ✅ Tendrás criterios de desempate claros
📊 La Matriz de Decisión
Formato de la matriz:
SI tus requisitos son:
- Dimensión Crítica 1: [Valor]
- Dimensión Crítica 2: [Valor]
ENTONCES:
- Opción recomendada: [Proveedor]
- Por qué: [Justificación]
- Trade-offs: [Qué aceptas]
- Alternativa: [Si opción 1 no funciona]
🎯 Matriz por Combinación de Requisitos
Caso 1: Priv acidad + Costo
Requisitos:
- Privacidad: CRÍTICA (datos sensibles, on-premise obligatorio)
- Costo: CRÍTICO ($0-500/mes)
Proveedor recomendado: Ollama local
Por qué:
- ✅ Privacidad: Datos NUNCA salen de tu máquina
- ✅ Costo: $0 operativo (solo hardware upfront $500-2000)
- ✅ Compliance: Tú controlas 100% (GDPR, HIPAA, cualquier regulación)
Trade-offs aceptados:
- ⚠️ Calidad: Mistral 7B/Llama 2 13B son ~80-85% de GPT-3.5
- ⚠️ Complejidad: Setup inicial 2-4 horas, necesitas skills Linux/CLI
- ⚠️ Velocidad: 5-10s latency (vs 1-2s OpenAI) si hardware modesto
Alternativa: LM Studio (si prefieres GUI vs CLI)
Ejemplo real:
- Bufete de abogados procesando contratos confidenciales
- Hospital analizando historiales médicos
- Banco con PII (personally identifiable information)
Caso 2: Calidad + Velocidad
Requisitos:
- Calidad: CRÍTICA (accuracy 95%+, reasoning complejo)
- Velocidad: CRÍTICA (latency <2s)
Proveedor recomendado: OpenAI API (GPT-4 o GPT-3.5-turbo)
Por qué:
- ✅ Calidad: GPT-4 es state-of-the-art (99%+ accuracy tareas complejas)
- ✅ Velocidad: GPT-3.5-turbo ~1.5s, GPT-4 ~3s
- ✅ Infraestructura: OpenAI tiene CDN global, baja latency worldwide
- ✅ Mantenimiento: Cero (managed service)
Trade-offs aceptados:
- ⚠️ Costo: $0.03/1k tokens (GPT-4) puede ser $500-2000/mes a escala
- ⚠️ Privacidad: Datos van a cloud USA (30 días retention)
- ⚠️ Vendor lock-in: Dependes de OpenAI (mitigar con OpenRouter fallback)
Alternativa: OpenRouter (mismo acceso a GPT-4, más flexibility)
Ejemplo real:
- Customer support enterprise (accuracy crítica, volumen alto)
- Análisis financiero automatizado
- Legal document review (tier 1 quality needed)
Caso 3: Simplicidad + Costo
Requisitos:
- Simplicidad: CRÍTICA (equipo junior, deadline apretado)
- Costo: IMPORTANTE ($0-200/mes)
Proveedor recomendado: OpenRouter (modelos económicos)
Por qué:
- ✅ Simplicidad: API compatible OpenAI (drop-in replacement)
- ✅ Costo: Modelos desde $0.001/1k tokens (20x más barato que GPT-4)
- ✅ Flexibilidad: Cambias modelo sin refactoring
- ✅ Setup: <1 hora (pip install, API key, done)
Trade-offs aceptados:
- ⚠️ Calidad: Modelos baratos son 70-80% de GPT-4
- ⚠️ Velocidad: Variable según modelo (2-5s latency)
- ⚠️ Privacidad: Depende del modelo (algunos pasan por OpenRouter servers)
Alternativa: OpenAI API con GPT-3.5-turbo (si $200/mes alcanza)
Ejemplo real:
- Startup en fase prototipo (MVP rápido)
- Side project personal (sin presupuesto)
- Agencia consultando múltiples modelos (A/B testing)
Caso 4: Escalabilidad + Velocidad
Requisitos:
- Velocidad: CRÍTICA (latency <1s, throughput alto)
- Escalabilidad: CRÍTICA (picos 10-100x tráfico normal)
Proveedor recomendado: Modal (serverless)
Por qué:
- ✅ Escalabilidad: Autoscaling 0→1000 instancias en segundos
- ✅ Velocidad: Warm instances ~1s, cold start ~3s (optimizable)
- ✅ Costo: Pay-per-use (no pagas idle time)
- ✅ Infraestructura: Modal gestiona GPUs, containers, networking
Trade-offs aceptados:
- ⚠️ Complejidad: Necesitas aprender Modal decorators (curva 1-2 días)
- ⚠️ Cold starts: Primeras requests ~3s (mitigar con warm pools)
- ⚠️ Costo variable: Puede ser impredecible con picos súbitos
Alternativa: OpenAI API (también autoscale, pero vendor lock-in)
Ejemplo real:
- App viral que puede tener picos 100x (Product Hunt launch, TikTok)
- E-commerce con Black Friday (tráfico predecible pero masivo)
- API pública con SLA estricto (<1s p95 latency)
Caso 5: Privacidad + Calidad
Requisitos:
- Privacidad: CRÍTICA (on-premise obligatorio)
- Calidad: CRÍTICA (accuracy 90%+)
Proveedor recomendado: Ollama con Llama 2 70B (o Mixtral 8x7B)
Por qué:
- ✅ Privacidad: 100% local, datos nunca salen
- ✅ Calidad: Llama 2 70B es ~90-92% de GPT-3.5 (acceptable para most tasks)
- ✅ Costo operativo: $0 (solo hardware upfront ~$3000-5000 para GPU)
- ✅ Control: Tú gestionas updates, modelo, seguridad
Trade-offs aceptados:
- ⚠️ Hardware: Necesitas GPU potente (A100, 4090 Ti, o M2 Ultra Mac)
- ⚠️ Complejidad: Setup avanzado (Docker, GPU drivers, networking)
- ⚠️ Mantenimiento: Updates manuales, monitoring 24/7 si production
Alternativa: LM Studio (si prefieres GUI y tu hardware alcanza)
Ejemplo real:
- Gobierno procesando documentos clasificados
- Healthcare con datos HIPAA strict
- Enterprise con compliance extremo (banking, defense)
Caso 6: Prototipo Rápido (MVP)
Requisitos:
- Simplicidad: CRÍTICA (lanzar en 1-3 días)
- Todas las demás: SECUNDARIAS (optimizarás después)
Proveedor recomendado: OpenAI API (GPT-3.5-turbo)
Por qué:
- ✅ Simplicidad: SDK oficial, docs excelentes, ejemplos everywhere
- ✅ Velocidad: ~1.5s latency (bueno para demo)
- ✅ Calidad: 85-90% (suficiente para validar idea)
- ✅ Costo: ~$10-50 para MVP (volumen bajo)
Trade-offs aceptados:
- ⚠️ Vendor lock-in: No importa en fase MVP (refactor después si needed)
- ⚠️ Costo a escala: Si MVP funciona, migraríasafter validation
- ⚠️ Privacidad: OK para MVP (no hay usuarios reales aún)
Alternativa: LM Studio (si tienes laptop decente y quieres gratis)
Ejemplo real:
- Hackathon (48 horas para demo funcional)
- Pitch a inversionistas (necesitas working prototype, no production)
- Validar idea antes de invertir en infra
Caso 7: Multi-Provider Flexibility
Requisitos:
- Flexibilidad: CRÍTICA (poder cambiar proveedor sin refactoring)
- Costo: IMPORTANTE (optimizar eligiendo modelo más barato)
Proveedor recomendado: OpenRouter
Por qué:
- ✅ Flexibilidad: 100+ modelos (GPT-4, Claude, Gemini, Llama, Mistral)
- ✅ Costo: Compara precios automáticamente, elige más barato
- ✅ Fallback: Si modelo falla, switch a otro sin código
- ✅ API compatible: Drop-in replacement de OpenAI SDK
Trade-offs aceptados:
- ⚠️ Intermediario: OpenRouter entre tú y modelo (añade latency ~100-200ms)
- ⚠️ Privacidad: Algunos modelos pasan por OpenRouter (leer policies)
- ⚠️ Rate limits: Diferentes por modelo
Alternativa: Unified client propio (Módulo 8 de esta guía)
Ejemplo real:
- Agencia que ofrece chatbots a clientes (cada cliente elige modelo)
- Startup optimizando costos (empieza GPT-4, luego migra a Mistral)
- Developer comparando modelos (A/B testing)
🔄 Proceso de Decisión (4 Pasos)
Paso 1: Identifica dimensiones CRÍTICAS (2-3 máximo)
Usa scorecard de cápsula 02:
De las 5 dimensiones, ¿cuáles son CRÍTICAS (no negociables)?
[ ] Costo
[ ] Calidad
[ ] Privacidad
[ ] Velocidad
[ ] Simplicidad
Marca 2-3 máximo. Si marcas 5, ninguna es realmente crítica.
Paso 2: Busca en matriz
Encuentra combinación que match tus dimensiones críticas:
Mis dimensiones CRÍTICAS: Privacidad + Costo
Busco en matriz...
→ Caso 1: Privacidad + Costo → Ollama local
Mis dimensiones CRÍTICAS: Calidad + Velocidad
Busco en matriz...
→ Caso 2: Calidad + Velocidad → OpenAI API
Paso 3: Evalúa trade-offs
La matriz te dice qué aceptas a cambio:
Opción recomendada: Ollama local
Trade-offs:
- ⚠️ Calidad: 80-85% vs 95% GPT-4
- ⚠️ Complejidad: Setup 2-4 hrs vs <1hr OpenAI
- ⚠️ Velocidad: 5-10s vs 1-2s OpenAI
¿Son aceptables?
- Si privacidad es CRÍTICA (datos médicos) → SÍ, trade-offs OK
- Si privacidad es solo "nice-to-have" → NO, usa OpenAI
Paso 4: Define plan de fallback
Siempre ten plan B:
Opción principal: OpenAI API (GPT-3.5)
Fallback si:
- OpenAI cae (outage) → OpenRouter con gpt-3.5-turbo
- OpenAI demasiado caro a escala → Migrar a Ollama Mistral 7B
- Requisitos privacidad cambian → Ollama local desde día 1
Escribe el plan ANTES de implementar.
🎯 Criterios de Desempate
¿Qué pasa si 2 opciones son igual de buenas?
Criterio 1: Time-to-market
Si empate, elige la más simple:
- OpenAI API: <1 día
- OpenRouter: <1 día
- Modal: 1-2 días
- Ollama local: 2-4 días
Ganador: OpenAI API o OpenRouter
Criterio 2: Costo a 12 meses
Calcula TCO (Total Cost of Ownership):
OpenAI API:
- Costo operativo: $500/mes × 12 = $6000
- Costo setup: $0
- Costo mantenimiento: $0 (managed)
- TOTAL: $6000/año
Ollama local:
- Costo operativo: $0
- Costo setup: $2000 (GPU)
- Costo mantenimiento: $100/mes × 12 = $1200 (DevOps time)
- TOTAL: $3200/año
Si volumen es constante → Ollama cheaper a 12 meses
Si volumen es bajo (primeros meses) → OpenAI cheaper a corto plazo
Ganador: Depende de volumen y plazo
Criterio 3: Flexibility futura
¿Qué opción te da más opciones después?
OpenAI API:
- Vendor lock-in: Alto
- Migración a otro proveedor: Refactoring necesario
- Flexibility: Baja
OpenRouter:
- Vendor lock-in: Bajo (cambias modelo sin código)
- Migración: Fácil (API compatible)
- Flexibility: Alta
Ollama local:
- Vendor lock-in: Cero (tienes el modelo)
- Migración: N/A (ya eres independiente)
- Flexibility: Máxima
Ganador: Ollama local (más independencia) u OpenRouter (más opciones cloud)
Criterio 4: Team skills
¿Tu equipo puede mantenerlo?
Equipo junior Python:
→ OpenAI API (managed, SDK simple)
Equipo mid con algo de DevOps:
→ OpenRouter o Modal (intermediate complexity)
Equipo senior DevOps + ML:
→ Ollama local (full control, pero requiere skills)
Ganador: Match skills del equipo
💡 Casos de Uso Reales (Aplicando Matriz)
Caso Real 1: Startup SaaS (Chatbot de soporte)
Requisitos:
- 1000 usuarios/mes (creciendo)
- Necesita <2s latency
- Budget: $200/mes inicialmente
- Equipo: 2 devs junior
- Datos: No sensibles (soporte público)
Aplicando matriz:
Dimensiones CRÍTICAS: Simplicidad + Velocidad
Busco en matriz... No hay match exacto "Simplicidad + Velocidad"
Opciones candidatas:
- Caso 2 (Calidad + Velocidad) → OpenAI API
- Caso 3 (Simplicidad + Costo) → OpenRouter
Evaluación:
OpenAI API (GPT-3.5):
- ✅ Simplicidad: Setup <1 día
- ✅ Velocidad: ~1.5s (cumple <2s)
- ⚠️ Costo: 1000 users × 10 queries × 500 tokens = 5M tokens/mes = $7.50/mes
- COSTO OK (dentro de $200/mes)
OpenRouter (Mixtral):
- ✅ Simplicidad: Setup ~1 día (similar OpenAI)
- ✅ Velocidad: ~2-3s (border <2s)
- ✅ Costo: ~$3/mes (más barato)
Decisión: OpenAI API
- Cumple velocidad más holgadamente
- $7.50/mes es insignificante
- Docs mejores para equipo junior
Fallback: OpenRouter si OpenAI sube precio o latency degrada
Caso Real 2: Healthcare App (Análisis de síntomas)
Requisitos:
- 500 pacientes/día
- Datos médicos (HIPAA compliance)
- Accuracy 95%+ (vidas en juego)
- Budget: Sin límite (hospital grande)
- Equipo: DevOps senior in-house
Aplicando matriz:
Dimensiones CRÍTICAS: Privacidad + Calidad
Busco en matriz... → Caso 5: Privacidad + Calidad → Ollama con Llama 2 70B
Evaluación:
Ollama Llama 2 70B local:
- ✅ Privacidad: On-premise, HIPAA compliant
- ✅ Calidad: 90-92% (aceptable con human oversight)
- ✅ Costo: $5k upfront (hardware), luego $0
- ✅ Skills: Equipo DevOps senior puede mantenerlo
Trade-offs:
- ⚠️ Calidad: 90% vs 99% GPT-4
- Mitigación: Human-in-the-loop (médico revisa sugerencias)
- ⚠️ Complejidad: Setup 1 semana
- Aceptable: No hay deadline apretado, seguridad > velocidad
Decisión: Ollama local
- Privacidad NO negociable (HIPAA)
- Calidad con human oversight es suficiente
- Costo no es problema
Fallback: NINGUNO (privacidad es hard requirement, no puede ir a cloud)
Alternativa futura: Si FDA aprueba GPT-4 con data residency garantizada
Caso Real 3: E-commerce (Recomendaciones personalizadas)
Requisitos:
- 50k usuarios/día
- Picos Black Friday (10x tráfico)
- Latency <1s (UX crítica)
- Budget: $2000/mes
- Equipo: Mid-level DevOps
Aplicando matriz:
Dimensiones CRÍTICAS: Escalabilidad + Velocidad
Busco en matriz... → Caso 4: Escalabilidad + Velocidad → Modal serverless
Evaluación:
Modal serverless (Mistral 7B):
- ✅ Escalabilidad: 0→1000 instancias automático
- ✅ Velocidad: ~1-2s (warm), ~3s (cold start)
- ✅ Costo: Pay-per-use, ~$1500/mes normal, $15k Black Friday (pico 1 día)
- Costo anualizado: ($1500 × 11) + $15k = $31.5k/año = $2625/mes promedio
- ⚠️ EXCEDE BUDGET ($2000/mes)
OpenAI API (GPT-3.5):
- ✅ Escalabilidad: Automática
- ✅ Velocidad: ~1.5s
- ✅ Costo: 50k × 5 queries × 200 tokens × 30 = 1.5B tokens/mes = $3k normal
- Black Friday (10x): $30k ese mes
- Anualizado: $36k/año = $3k/mes promedio
- ⚠️ TAMBIÉN EXCEDE BUDGET
Re-evaluación:
Budget de $2000/mes NO es realista para 50k usuarios/día con picos.
Opciones:
- Aumentar budget a $3-4k/mes (justificable con revenue)
- Ollama local con GPU cluster ($10k upfront, luego gratis)
- Cumple costo a largo plazo
- Pero complejidad es alta para equipo mid
- Hybrid: OpenAI normal, Ollama para Black Friday (pre-cache)
Decisión: Aumentar budget + OpenAI API
- $3k/mes es 0.3% de revenue típico e-commerce
- Simplicidad operativa > ahorro marginal
- Black Friday peak es 1 día (cost spike acceptable)
Fallback: Si budget NO se aprueba → Ollama local (requiere contratar DevOps senior)
✅ Checklist de Decisión
Usa este checklist ANTES de implementar:
## Checklist de Decisión Final
### 1. Requisitos claros
- [ ] Identifiqué 2-3 dimensiones CRÍTICAS
- [ ] Cuantifiqué valores ($/mes, latency ms, accuracy %)
- [ ] Validé con stakeholders (product, legal, finance)
### 2. Opción elegida
- [ ] Apliqué matriz de decisión
- [ ] Evaluaré trade-offs específicos
- [ ] Trade-offs son aceptables dado contexto
### 3. Plan de fallback
- [ ] Tengo opción B si opción A falla
- [ ] Fallback es viable (no es "esperamos que funcione")
- [ ] Criterios de trigger claros ("si latency > 5s por 10 min, switch")
### 4. Validación técnica
- [ ] Mi equipo tiene skills necesarios
- [ ] Time-to-market es aceptable
- [ ] Costo a 12 meses es sostenible
### 5. Compliance y legal
- [ ] Privacidad: Revisada por legal (si datos sensibles)
- [ ] Compliance: GDPR/HIPAA/SOC2 verificado
- [ ] Contratos: Terms of service aceptables
SI todos los checks son ✅ → PROCEDE A IMPLEMENTAR
SI algún check es ❌ → RE-EVALÚA opción
📝 Ejercicio: Aplica la Matriz
Ejercicio 1: Startup Fintech
Contexto:
- App de asesoría financiera personal
- 5000 usuarios registrados
- Necesita analizar transacciones (datos sensibles)
- Budget: $1000/mes
- Equipo: 3 devs mid-level
- Necesita lanzar en 2 semanas (investor demo)
Tu tarea:
- Identifica dimensiones CRÍTICAS (2-3)
- Busca en matriz la combinación
- Evalúa trade-offs
- Define plan de fallback
Ver respuesta recomendada
Análisis:
Dimensiones CRÍTICAS:
- Privacidad (datos financieros sensibles)
- Simplicidad (deadline 2 semanas, equipo mid)
Dimensiones IMPORTANTES: 3. Costo ($1000/mes es límite)
Dimensiones SECUNDARIAS: 4. Calidad (80% OK con human review) 5. Velocidad (asesoría no es real-time, <5s OK)
Busco en matriz:
No hay match exacto "Privacidad + Simplicidad"
Candidatos:
- Caso 1 (Privacidad + Costo) → Ollama local
- Caso 5 (Privacidad + Calidad) → Ollama local
Problema: Ollama local tiene BAJA simplicidad (setup 2-4 días, skills needed)
Conflict: Privacidad CRÍTICA pero Simplicidad también CRÍTICA
Opciones:
Opción A: Ollama local
- ✅ Privacidad máxima
- ✅ Costo $0 operativo
- ❌ Simplicidad: Setup 2-4 días (consume deadline)
- ❌ Requiere skills DevOps que equipo mid no tiene bien
Opción B: OpenAI API
- ❌ Privacidad: Datos financieros a cloud (riesgo legal/compliance)
- ✅ Simplicidad: Setup 1 día
- ✅ Cumple deadline 2 semanas
- ⚠️ Costo: ~$500/mes (dentro de budget)
Opción C: Hybrid (para demo)
- OpenAI API para investor demo (2 semanas)
- Migrar a Ollama después del demo (4-6 semanas)
- ✅ Cumple deadline
- ✅ Privacidad a medio plazo
- ⚠️ Refactoring necesario
Decisión: Opción C (Hybrid)
Justificación:
-
Short-term (demo): OpenAI API
- Datos de demo son mock (no reales)
- Setup 1 día, funciona para pitch
- Mencionas en pitch "migraremos a on-premise post-funding"
-
Long-term (post-funding): Ollama local
- Contratas DevOps senior
- Setup en 4-6 semanas
- Compliance BEFORE usuarios reales
Trade-offs:
- ⚠️ Refactoring costo (~1 semana dev time)
- ✅ Acceptable porque demo NO usa datos reales
Plan de fallback:
- Si investors preguntan privacidad → Tienes plan claro (Ollama post-funding)
- Si funding no se consigue → Ollama de todas formas (con tiempo, sin deadline)
📊 Resumen
Conceptos clave:
-
Matriz de decisión estructura la elección:
- No es ad-hoc ni "feeling"
- Mapea requisitos → proveedor sistemáticamente
- 7 casos comunes cubiertos
-
Proceso de 4 pasos:
- Paso 1: Identifica 2-3 dimensiones CRÍTICAS
- Paso 2: Busca combinación en matriz
- Paso 3: Evalúa trade-offs
- Paso 4: Define plan de fallback
-
Criterios de desempate:
- Time-to-market (más simple gana)
- TCO a 12 meses (más barato a largo plazo)
- Flexibility futura (menos vendor lock-in)
- Team skills (match capacidades)
-
Siempre ten plan B:
- OpenAI API → Fallback: OpenRouter
- Ollama local → Fallback: NINGUNO (si privacidad crítica)
- Modal → Fallback: OpenAI API
🔗 Recursos adicionales
- Decision Framework Template (Google Sheet) - Template reutilizable
- LLM Provider Comparison Tool - Compare specs
- TCO Calculator for LLMs - Costo total ownership
- GDPR Compliance Checker - Privacidad validation
➡️ Próximo paso
Siguiente cápsula: 05-trade-offs-cuantitativos.md
Ahora que tienes el framework de decisión, aprenderás a comparar opciones con datos cuantitativos reales:
- Costo exacto ($/1M tokens)
- Latency promedio (benchmarks)
- Calidad (accuracy scores)
- Privacidad (políticas comparadas)
Los números te ayudarán a validar tu decisión de la matriz.
Tiempo de lectura: 12-15 minutos
Siguiente: 05-trade-offs-cuantitativos.md