Módulo 1: Decision Framework para Acceso a LLMs

Matriz de Decisión: Framework Estructurado para Elegir Proveedor LLM

Descripción de la cápsula

Ahora que conoces las 5 dimensiones de evaluación (cápsula 02) y el panorama de opciones disponibles (cápsula 03), necesitas un framework estructurado para tomar la decisión final.

Esta cápsula te da ese framework: una matriz de decisión que mapea requisitos específicos a proveedores recomendados. No es "opinión" ni "feeling", es un proceso sistemático basado en datos.

La matriz funciona así:

  1. Identificas tus requisitos críticos
  2. La matriz sugiere 2-3 opciones que encajan
  3. Evalúas trade-offs específicos
  4. Tomas decisión informada

Al finalizar esta cápsula, podrás elegir proveedor para cualquier proyecto en <30 minutos siguiendo el framework.


🎯 Objetivo de la cápsula

Objetivo: Aplicar una matriz de decisión estructurada para elegir proveedor LLM basándote en requisitos priorizados.

Al finalizar esta cápsula:

  • ✅ Sabrás usar la matriz de decisión
  • ✅ Podrás mapear requisitos → proveedor recomendado
  • ✅ Entenderás cuándo hay múltiples opciones válidas
  • ✅ Tendrás criterios de desempate claros

📊 La Matriz de Decisión

Formato de la matriz:

SI tus requisitos son:
  - Dimensión Crítica 1: [Valor]
  - Dimensión Crítica 2: [Valor]
  
ENTONCES:
  - Opción recomendada: [Proveedor]
  - Por qué: [Justificación]
  - Trade-offs: [Qué aceptas]
  - Alternativa: [Si opción 1 no funciona]

🎯 Matriz por Combinación de Requisitos

Caso 1: Priv acidad + Costo

Requisitos:

  • Privacidad: CRÍTICA (datos sensibles, on-premise obligatorio)
  • Costo: CRÍTICO ($0-500/mes)

Proveedor recomendado: Ollama local

Por qué:

  • ✅ Privacidad: Datos NUNCA salen de tu máquina
  • ✅ Costo: $0 operativo (solo hardware upfront $500-2000)
  • ✅ Compliance: Tú controlas 100% (GDPR, HIPAA, cualquier regulación)

Trade-offs aceptados:

  • ⚠️ Calidad: Mistral 7B/Llama 2 13B son ~80-85% de GPT-3.5
  • ⚠️ Complejidad: Setup inicial 2-4 horas, necesitas skills Linux/CLI
  • ⚠️ Velocidad: 5-10s latency (vs 1-2s OpenAI) si hardware modesto

Alternativa: LM Studio (si prefieres GUI vs CLI)

Ejemplo real:

  • Bufete de abogados procesando contratos confidenciales
  • Hospital analizando historiales médicos
  • Banco con PII (personally identifiable information)

Caso 2: Calidad + Velocidad

Requisitos:

  • Calidad: CRÍTICA (accuracy 95%+, reasoning complejo)
  • Velocidad: CRÍTICA (latency <2s)

Proveedor recomendado: OpenAI API (GPT-4 o GPT-3.5-turbo)

Por qué:

  • ✅ Calidad: GPT-4 es state-of-the-art (99%+ accuracy tareas complejas)
  • ✅ Velocidad: GPT-3.5-turbo ~1.5s, GPT-4 ~3s
  • ✅ Infraestructura: OpenAI tiene CDN global, baja latency worldwide
  • ✅ Mantenimiento: Cero (managed service)

Trade-offs aceptados:

  • ⚠️ Costo: $0.03/1k tokens (GPT-4) puede ser $500-2000/mes a escala
  • ⚠️ Privacidad: Datos van a cloud USA (30 días retention)
  • ⚠️ Vendor lock-in: Dependes de OpenAI (mitigar con OpenRouter fallback)

Alternativa: OpenRouter (mismo acceso a GPT-4, más flexibility)

Ejemplo real:

  • Customer support enterprise (accuracy crítica, volumen alto)
  • Análisis financiero automatizado
  • Legal document review (tier 1 quality needed)

Caso 3: Simplicidad + Costo

Requisitos:

  • Simplicidad: CRÍTICA (equipo junior, deadline apretado)
  • Costo: IMPORTANTE ($0-200/mes)

Proveedor recomendado: OpenRouter (modelos económicos)

Por qué:

  • ✅ Simplicidad: API compatible OpenAI (drop-in replacement)
  • ✅ Costo: Modelos desde $0.001/1k tokens (20x más barato que GPT-4)
  • ✅ Flexibilidad: Cambias modelo sin refactoring
  • ✅ Setup: <1 hora (pip install, API key, done)

Trade-offs aceptados:

  • ⚠️ Calidad: Modelos baratos son 70-80% de GPT-4
  • ⚠️ Velocidad: Variable según modelo (2-5s latency)
  • ⚠️ Privacidad: Depende del modelo (algunos pasan por OpenRouter servers)

Alternativa: OpenAI API con GPT-3.5-turbo (si $200/mes alcanza)

Ejemplo real:

  • Startup en fase prototipo (MVP rápido)
  • Side project personal (sin presupuesto)
  • Agencia consultando múltiples modelos (A/B testing)

Caso 4: Escalabilidad + Velocidad

Requisitos:

  • Velocidad: CRÍTICA (latency <1s, throughput alto)
  • Escalabilidad: CRÍTICA (picos 10-100x tráfico normal)

Proveedor recomendado: Modal (serverless)

Por qué:

  • ✅ Escalabilidad: Autoscaling 0→1000 instancias en segundos
  • ✅ Velocidad: Warm instances ~1s, cold start ~3s (optimizable)
  • ✅ Costo: Pay-per-use (no pagas idle time)
  • ✅ Infraestructura: Modal gestiona GPUs, containers, networking

Trade-offs aceptados:

  • ⚠️ Complejidad: Necesitas aprender Modal decorators (curva 1-2 días)
  • ⚠️ Cold starts: Primeras requests ~3s (mitigar con warm pools)
  • ⚠️ Costo variable: Puede ser impredecible con picos súbitos

Alternativa: OpenAI API (también autoscale, pero vendor lock-in)

Ejemplo real:

  • App viral que puede tener picos 100x (Product Hunt launch, TikTok)
  • E-commerce con Black Friday (tráfico predecible pero masivo)
  • API pública con SLA estricto (<1s p95 latency)

Caso 5: Privacidad + Calidad

Requisitos:

  • Privacidad: CRÍTICA (on-premise obligatorio)
  • Calidad: CRÍTICA (accuracy 90%+)

Proveedor recomendado: Ollama con Llama 2 70B (o Mixtral 8x7B)

Por qué:

  • ✅ Privacidad: 100% local, datos nunca salen
  • ✅ Calidad: Llama 2 70B es ~90-92% de GPT-3.5 (acceptable para most tasks)
  • ✅ Costo operativo: $0 (solo hardware upfront ~$3000-5000 para GPU)
  • ✅ Control: Tú gestionas updates, modelo, seguridad

Trade-offs aceptados:

  • ⚠️ Hardware: Necesitas GPU potente (A100, 4090 Ti, o M2 Ultra Mac)
  • ⚠️ Complejidad: Setup avanzado (Docker, GPU drivers, networking)
  • ⚠️ Mantenimiento: Updates manuales, monitoring 24/7 si production

Alternativa: LM Studio (si prefieres GUI y tu hardware alcanza)

Ejemplo real:

  • Gobierno procesando documentos clasificados
  • Healthcare con datos HIPAA strict
  • Enterprise con compliance extremo (banking, defense)

Caso 6: Prototipo Rápido (MVP)

Requisitos:

  • Simplicidad: CRÍTICA (lanzar en 1-3 días)
  • Todas las demás: SECUNDARIAS (optimizarás después)

Proveedor recomendado: OpenAI API (GPT-3.5-turbo)

Por qué:

  • ✅ Simplicidad: SDK oficial, docs excelentes, ejemplos everywhere
  • ✅ Velocidad: ~1.5s latency (bueno para demo)
  • ✅ Calidad: 85-90% (suficiente para validar idea)
  • ✅ Costo: ~$10-50 para MVP (volumen bajo)

Trade-offs aceptados:

  • ⚠️ Vendor lock-in: No importa en fase MVP (refactor después si needed)
  • ⚠️ Costo a escala: Si MVP funciona, migraríasafter validation
  • ⚠️ Privacidad: OK para MVP (no hay usuarios reales aún)

Alternativa: LM Studio (si tienes laptop decente y quieres gratis)

Ejemplo real:

  • Hackathon (48 horas para demo funcional)
  • Pitch a inversionistas (necesitas working prototype, no production)
  • Validar idea antes de invertir en infra

Caso 7: Multi-Provider Flexibility

Requisitos:

  • Flexibilidad: CRÍTICA (poder cambiar proveedor sin refactoring)
  • Costo: IMPORTANTE (optimizar eligiendo modelo más barato)

Proveedor recomendado: OpenRouter

Por qué:

  • ✅ Flexibilidad: 100+ modelos (GPT-4, Claude, Gemini, Llama, Mistral)
  • ✅ Costo: Compara precios automáticamente, elige más barato
  • ✅ Fallback: Si modelo falla, switch a otro sin código
  • ✅ API compatible: Drop-in replacement de OpenAI SDK

Trade-offs aceptados:

  • ⚠️ Intermediario: OpenRouter entre tú y modelo (añade latency ~100-200ms)
  • ⚠️ Privacidad: Algunos modelos pasan por OpenRouter (leer policies)
  • ⚠️ Rate limits: Diferentes por modelo

Alternativa: Unified client propio (Módulo 8 de esta guía)

Ejemplo real:

  • Agencia que ofrece chatbots a clientes (cada cliente elige modelo)
  • Startup optimizando costos (empieza GPT-4, luego migra a Mistral)
  • Developer comparando modelos (A/B testing)

🔄 Proceso de Decisión (4 Pasos)

Paso 1: Identifica dimensiones CRÍTICAS (2-3 máximo)

Usa scorecard de cápsula 02:

De las 5 dimensiones, ¿cuáles son CRÍTICAS (no negociables)?

[ ] Costo
[ ] Calidad
[ ] Privacidad
[ ] Velocidad
[ ] Simplicidad

Marca 2-3 máximo. Si marcas 5, ninguna es realmente crítica.

Paso 2: Busca en matriz

Encuentra combinación que match tus dimensiones críticas:

Mis dimensiones CRÍTICAS: Privacidad + Costo

Busco en matriz...
→ Caso 1: Privacidad + Costo → Ollama local

Mis dimensiones CRÍTICAS: Calidad + Velocidad

Busco en matriz...
→ Caso 2: Calidad + Velocidad → OpenAI API

Paso 3: Evalúa trade-offs

La matriz te dice qué aceptas a cambio:

Opción recomendada: Ollama local

Trade-offs:
- ⚠️ Calidad: 80-85% vs 95% GPT-4
- ⚠️ Complejidad: Setup 2-4 hrs vs <1hr OpenAI
- ⚠️ Velocidad: 5-10s vs 1-2s OpenAI

¿Son aceptables?
- Si privacidad es CRÍTICA (datos médicos) → SÍ, trade-offs OK
- Si privacidad es solo "nice-to-have" → NO, usa OpenAI

Paso 4: Define plan de fallback

Siempre ten plan B:

Opción principal: OpenAI API (GPT-3.5)

Fallback si:
- OpenAI cae (outage) → OpenRouter con gpt-3.5-turbo
- OpenAI demasiado caro a escala → Migrar a Ollama Mistral 7B
- Requisitos privacidad cambian → Ollama local desde día 1

Escribe el plan ANTES de implementar.

🎯 Criterios de Desempate

¿Qué pasa si 2 opciones son igual de buenas?

Criterio 1: Time-to-market

Si empate, elige la más simple:

  • OpenAI API: <1 día
  • OpenRouter: <1 día
  • Modal: 1-2 días
  • Ollama local: 2-4 días

Ganador: OpenAI API o OpenRouter


Criterio 2: Costo a 12 meses

Calcula TCO (Total Cost of Ownership):

OpenAI API:
- Costo operativo: $500/mes × 12 = $6000
- Costo setup: $0
- Costo mantenimiento: $0 (managed)
- TOTAL: $6000/año

Ollama local:
- Costo operativo: $0
- Costo setup: $2000 (GPU)
- Costo mantenimiento: $100/mes × 12 = $1200 (DevOps time)
- TOTAL: $3200/año

Si volumen es constante → Ollama cheaper a 12 meses
Si volumen es bajo (primeros meses) → OpenAI cheaper a corto plazo

Ganador: Depende de volumen y plazo


Criterio 3: Flexibility futura

¿Qué opción te da más opciones después?

OpenAI API:
- Vendor lock-in: Alto
- Migración a otro proveedor: Refactoring necesario
- Flexibility: Baja

OpenRouter:
- Vendor lock-in: Bajo (cambias modelo sin código)
- Migración: Fácil (API compatible)
- Flexibility: Alta

Ollama local:
- Vendor lock-in: Cero (tienes el modelo)
- Migración: N/A (ya eres independiente)
- Flexibility: Máxima

Ganador: Ollama local (más independencia) u OpenRouter (más opciones cloud)


Criterio 4: Team skills

¿Tu equipo puede mantenerlo?

Equipo junior Python:
→ OpenAI API (managed, SDK simple)

Equipo mid con algo de DevOps:
→ OpenRouter o Modal (intermediate complexity)

Equipo senior DevOps + ML:
→ Ollama local (full control, pero requiere skills)

Ganador: Match skills del equipo


💡 Casos de Uso Reales (Aplicando Matriz)

Caso Real 1: Startup SaaS (Chatbot de soporte)

Requisitos:

  • 1000 usuarios/mes (creciendo)
  • Necesita <2s latency
  • Budget: $200/mes inicialmente
  • Equipo: 2 devs junior
  • Datos: No sensibles (soporte público)

Aplicando matriz:

Dimensiones CRÍTICAS: Simplicidad + Velocidad

Busco en matriz... No hay match exacto "Simplicidad + Velocidad"

Opciones candidatas:

  1. Caso 2 (Calidad + Velocidad) → OpenAI API
  2. Caso 3 (Simplicidad + Costo) → OpenRouter

Evaluación:

OpenAI API (GPT-3.5):

  • ✅ Simplicidad: Setup <1 día
  • ✅ Velocidad: ~1.5s (cumple <2s)
  • ⚠️ Costo: 1000 users × 10 queries × 500 tokens = 5M tokens/mes = $7.50/mes
  • COSTO OK (dentro de $200/mes)

OpenRouter (Mixtral):

  • ✅ Simplicidad: Setup ~1 día (similar OpenAI)
  • ✅ Velocidad: ~2-3s (border <2s)
  • ✅ Costo: ~$3/mes (más barato)

Decisión: OpenAI API

  • Cumple velocidad más holgadamente
  • $7.50/mes es insignificante
  • Docs mejores para equipo junior

Fallback: OpenRouter si OpenAI sube precio o latency degrada


Caso Real 2: Healthcare App (Análisis de síntomas)

Requisitos:

  • 500 pacientes/día
  • Datos médicos (HIPAA compliance)
  • Accuracy 95%+ (vidas en juego)
  • Budget: Sin límite (hospital grande)
  • Equipo: DevOps senior in-house

Aplicando matriz:

Dimensiones CRÍTICAS: Privacidad + Calidad

Busco en matriz... → Caso 5: Privacidad + Calidad → Ollama con Llama 2 70B

Evaluación:

Ollama Llama 2 70B local:

  • ✅ Privacidad: On-premise, HIPAA compliant
  • ✅ Calidad: 90-92% (aceptable con human oversight)
  • ✅ Costo: $5k upfront (hardware), luego $0
  • ✅ Skills: Equipo DevOps senior puede mantenerlo

Trade-offs:

  • ⚠️ Calidad: 90% vs 99% GPT-4
    • Mitigación: Human-in-the-loop (médico revisa sugerencias)
  • ⚠️ Complejidad: Setup 1 semana
    • Aceptable: No hay deadline apretado, seguridad > velocidad

Decisión: Ollama local

  • Privacidad NO negociable (HIPAA)
  • Calidad con human oversight es suficiente
  • Costo no es problema

Fallback: NINGUNO (privacidad es hard requirement, no puede ir a cloud)

Alternativa futura: Si FDA aprueba GPT-4 con data residency garantizada


Caso Real 3: E-commerce (Recomendaciones personalizadas)

Requisitos:

  • 50k usuarios/día
  • Picos Black Friday (10x tráfico)
  • Latency <1s (UX crítica)
  • Budget: $2000/mes
  • Equipo: Mid-level DevOps

Aplicando matriz:

Dimensiones CRÍTICAS: Escalabilidad + Velocidad

Busco en matriz... → Caso 4: Escalabilidad + Velocidad → Modal serverless

Evaluación:

Modal serverless (Mistral 7B):

  • ✅ Escalabilidad: 0→1000 instancias automático
  • ✅ Velocidad: ~1-2s (warm), ~3s (cold start)
  • ✅ Costo: Pay-per-use, ~$1500/mes normal, $15k Black Friday (pico 1 día)
    • Costo anualizado: ($1500 × 11) + $15k = $31.5k/año = $2625/mes promedio
    • ⚠️ EXCEDE BUDGET ($2000/mes)

OpenAI API (GPT-3.5):

  • ✅ Escalabilidad: Automática
  • ✅ Velocidad: ~1.5s
  • ✅ Costo: 50k × 5 queries × 200 tokens × 30 = 1.5B tokens/mes = $3k normal
    • Black Friday (10x): $30k ese mes
    • Anualizado: $36k/año = $3k/mes promedio
    • ⚠️ TAMBIÉN EXCEDE BUDGET

Re-evaluación:

Budget de $2000/mes NO es realista para 50k usuarios/día con picos.

Opciones:

  1. Aumentar budget a $3-4k/mes (justificable con revenue)
  2. Ollama local con GPU cluster ($10k upfront, luego gratis)
    • Cumple costo a largo plazo
    • Pero complejidad es alta para equipo mid
  3. Hybrid: OpenAI normal, Ollama para Black Friday (pre-cache)

Decisión: Aumentar budget + OpenAI API

  • $3k/mes es 0.3% de revenue típico e-commerce
  • Simplicidad operativa > ahorro marginal
  • Black Friday peak es 1 día (cost spike acceptable)

Fallback: Si budget NO se aprueba → Ollama local (requiere contratar DevOps senior)


✅ Checklist de Decisión

Usa este checklist ANTES de implementar:

## Checklist de Decisión Final

### 1. Requisitos claros
- [ ] Identifiqué 2-3 dimensiones CRÍTICAS
- [ ] Cuantifiqué valores ($/mes, latency ms, accuracy %)
- [ ] Validé con stakeholders (product, legal, finance)

### 2. Opción elegida
- [ ] Apliqué matriz de decisión
- [ ] Evaluaré trade-offs específicos
- [ ] Trade-offs son aceptables dado contexto

### 3. Plan de fallback
- [ ] Tengo opción B si opción A falla
- [ ] Fallback es viable (no es "esperamos que funcione")
- [ ] Criterios de trigger claros ("si latency > 5s por 10 min, switch")

### 4. Validación técnica
- [ ] Mi equipo tiene skills necesarios
- [ ] Time-to-market es aceptable
- [ ] Costo a 12 meses es sostenible

### 5. Compliance y legal
- [ ] Privacidad: Revisada por legal (si datos sensibles)
- [ ] Compliance: GDPR/HIPAA/SOC2 verificado
- [ ] Contratos: Terms of service aceptables

SI todos los checks son ✅ → PROCEDE A IMPLEMENTAR
SI algún check es ❌ → RE-EVALÚA opción

📝 Ejercicio: Aplica la Matriz

Ejercicio 1: Startup Fintech

Contexto:

  • App de asesoría financiera personal
  • 5000 usuarios registrados
  • Necesita analizar transacciones (datos sensibles)
  • Budget: $1000/mes
  • Equipo: 3 devs mid-level
  • Necesita lanzar en 2 semanas (investor demo)

Tu tarea:

  1. Identifica dimensiones CRÍTICAS (2-3)
  2. Busca en matriz la combinación
  3. Evalúa trade-offs
  4. Define plan de fallback
Ver respuesta recomendada

Análisis:

Dimensiones CRÍTICAS:

  1. Privacidad (datos financieros sensibles)
  2. Simplicidad (deadline 2 semanas, equipo mid)

Dimensiones IMPORTANTES: 3. Costo ($1000/mes es límite)

Dimensiones SECUNDARIAS: 4. Calidad (80% OK con human review) 5. Velocidad (asesoría no es real-time, <5s OK)


Busco en matriz:

No hay match exacto "Privacidad + Simplicidad"

Candidatos:

  • Caso 1 (Privacidad + Costo) → Ollama local
  • Caso 5 (Privacidad + Calidad) → Ollama local

Problema: Ollama local tiene BAJA simplicidad (setup 2-4 días, skills needed)

Conflict: Privacidad CRÍTICA pero Simplicidad también CRÍTICA


Opciones:

Opción A: Ollama local

  • ✅ Privacidad máxima
  • ✅ Costo $0 operativo
  • ❌ Simplicidad: Setup 2-4 días (consume deadline)
  • ❌ Requiere skills DevOps que equipo mid no tiene bien

Opción B: OpenAI API

  • ❌ Privacidad: Datos financieros a cloud (riesgo legal/compliance)
  • ✅ Simplicidad: Setup 1 día
  • ✅ Cumple deadline 2 semanas
  • ⚠️ Costo: ~$500/mes (dentro de budget)

Opción C: Hybrid (para demo)

  • OpenAI API para investor demo (2 semanas)
  • Migrar a Ollama después del demo (4-6 semanas)
  • ✅ Cumple deadline
  • ✅ Privacidad a medio plazo
  • ⚠️ Refactoring necesario

Decisión: Opción C (Hybrid)

Justificación:

  1. Short-term (demo): OpenAI API

    • Datos de demo son mock (no reales)
    • Setup 1 día, funciona para pitch
    • Mencionas en pitch "migraremos a on-premise post-funding"
  2. Long-term (post-funding): Ollama local

    • Contratas DevOps senior
    • Setup en 4-6 semanas
    • Compliance BEFORE usuarios reales

Trade-offs:

  • ⚠️ Refactoring costo (~1 semana dev time)
  • ✅ Acceptable porque demo NO usa datos reales

Plan de fallback:

  • Si investors preguntan privacidad → Tienes plan claro (Ollama post-funding)
  • Si funding no se consigue → Ollama de todas formas (con tiempo, sin deadline)

📊 Resumen

Conceptos clave:

  1. Matriz de decisión estructura la elección:

    • No es ad-hoc ni "feeling"
    • Mapea requisitos → proveedor sistemáticamente
    • 7 casos comunes cubiertos
  2. Proceso de 4 pasos:

    • Paso 1: Identifica 2-3 dimensiones CRÍTICAS
    • Paso 2: Busca combinación en matriz
    • Paso 3: Evalúa trade-offs
    • Paso 4: Define plan de fallback
  3. Criterios de desempate:

    • Time-to-market (más simple gana)
    • TCO a 12 meses (más barato a largo plazo)
    • Flexibility futura (menos vendor lock-in)
    • Team skills (match capacidades)
  4. Siempre ten plan B:

    • OpenAI API → Fallback: OpenRouter
    • Ollama local → Fallback: NINGUNO (si privacidad crítica)
    • Modal → Fallback: OpenAI API

🔗 Recursos adicionales

  1. Decision Framework Template (Google Sheet) - Template reutilizable
  2. LLM Provider Comparison Tool - Compare specs
  3. TCO Calculator for LLMs - Costo total ownership
  4. GDPR Compliance Checker - Privacidad validation

➡️ Próximo paso

Siguiente cápsula: 05-trade-offs-cuantitativos.md

Ahora que tienes el framework de decisión, aprenderás a comparar opciones con datos cuantitativos reales:

  • Costo exacto ($/1M tokens)
  • Latency promedio (benchmarks)
  • Calidad (accuracy scores)
  • Privacidad (políticas comparadas)

Los números te ayudarán a validar tu decisión de la matriz.


Tiempo de lectura: 12-15 minutos
Siguiente: 05-trade-offs-cuantitativos.md