Módulo 1: Decision Framework para Acceso a LLMs

Las 5 Dimensiones de Evaluación para Elegir Proveedor de LLM

Descripción de la cápsula

Para elegir el proveedor óptimo de LLM, necesitas evaluar tu proyecto según 5 dimensiones críticas: Costo, Calidad, Privacidad, Velocidad y Simplicidad.

Cada dimensión tiene trade-offs. No existe "la mejor opción" universal. OpenAI API puede ser perfecta para un proyecto (máxima calidad, simplicidad) pero terrible para otro (costo prohibitivo, privacidad inaceptable). Ollama local puede ser ideal para uno (gratis, privado) pero inadecuado para otro (setup complejo, hardware caro).

Esta cápsula te enseña a evaluar sistemáticamente estas 5 dimensiones para cualquier proyecto. Al final, tendrás un scorecard que te dirá qué proveedor encaja mejor con tus requisitos específicos.


🎯 Objetivo de la cápsula

Objetivo: Ser capaz de evaluar cualquier proyecto según las 5 dimensiones y priorizar cuáles son críticas vs nice-to-have.

Al finalizar esta cápsula:

  • ✅ Entenderás qué evaluar en cada dimensión
  • ✅ Sabrás hacer preguntas clave para extraer requisitos
  • ✅ Podrás priorizar dimensiones según contexto
  • ✅ Tendrás scorecard básico para usar en cápsula 08

📊 Dimensión 1: Costo

¿Qué evaluar?

Costo NO es solo "$/mes". Incluye:

  1. Costo por uso (pay-per-use)

    • $/1M tokens (input + output)
    • $/request
    • $/hora de cómputo
  2. Costos upfront (one-time)

    • Hardware (GPU, RAM para local)
    • Licenses (si aplicable)
    • Setup inicial (tiempo de equipo)
  3. Costos ocultos

    • Mantenimiento (updates, monitoring)
    • Scaling (qué pasa si 10x users)
    • Downtime (si proveedor cae, ¿pierdes ventas?)

Preguntas clave:

1. ¿Cuál es mi presupuesto mensual? ($0, $50, $500, $5000, ilimitado)
2. ¿Cuántos usuarios/requests espero? (100/día, 10k/día, 1M/día)
3. ¿Tengo budget para hardware inicial? (¿Puedo comprar GPU de $2000?)
4. ¿El costo es predecible o variable? (¿Necesito saber cuánto gastaré cada mes?)

Ejemplos por proveedor:

ProveedorCosto por usoUpfrontEscalabilidad
OpenAI API$0.0015/1k tokens (GPT-3.5)
$0.03/1k tokens (GPT-4)
$0 (gratis empezar)Lineal (2x users = 2x costo)
Ollama local$0 (gratis siempre)$500-2000 (hardware)Fijo (mismo costo 100 o 10k users)
Modal serverless$0.000185/s de GPU$0 (pay-per-use)Automático (escala sin intervención)
OpenRouterVariable ($0.001-0.03 según modelo)$0 (gratis empezar)Lineal

Cómo priorizar:

Costo es CRÍTICO si:

  • ✅ Startup sin funding
  • ✅ Proyecto personal/side project
  • ✅ Volumen alto (millones de requests/mes)
  • ✅ Margen de ganancia ajustado

Costo es SECUNDARIO si:

  • ⚠️ Empresa con presupuesto
  • ⚠️ Prototipo (optimización prematura)
  • ⚠️ B2B con contratos grandes (costo se pasa al cliente)

Tip de evaluación:

Calcula costo estimado mensual:

Costo mensual = (requests/día) × (tokens/request) × ($/token) × 30 días

Ejemplo:
- 10,000 requests/día
- 500 tokens/request promedio
- $0.002/1k tokens (GPT-3.5)
- 30 días

Costo = 10k × 500 × ($0.002/1000) × 30 = $300/mes

Si tu cálculo da >$500/mes, considera opciones locales o serverless con cost optimization.


🏆 Dimensión 2: Calidad

¿Qué evaluar?

Calidad NO es solo "qué tan bueno es el modelo". Incluye:

  1. Capabilities del modelo

    • Reasoning (lógica, matemáticas)
    • Conocimiento (qué sabe)
    • Lenguajes soportados
    • Context window (cuánto texto puede procesar)
  2. Accuracy

    • ¿Qué tan correcto es? (90%, 95%, 99%?)
    • ¿Alucina? (inventa información)
    • ¿Sigue instrucciones? (si dices "solo responde SI/NO", ¿lo hace?)
  3. Consistencia

    • ¿Da misma respuesta a misma pregunta?
    • ¿Cambia de "personalidad"?

Preguntas clave:

1. ¿Qué tan crítico es accuracy? (Soporte técnico: 95%+. Chatbot casual: 80% OK.)
2. ¿Necesito reasoning complejo? (Análisis legal: SÍ. Traducción simple: NO.)
3. ¿Qué context window necesito? (Documentos largos: 32k+. Chat breve: 4k OK.)
4. ¿Puedo tolerar alucinaciones? (Datos médicos: NO. Ideas creativas: Sí.)

Ejemplos por proveedor/modelo:

ModeloReasoningContextAlucinacionesMejor para
GPT-4 (OpenAI)Excelente128k tokensBajasTareas complejas, análisis
GPT-3.5 (OpenAI)Bueno16k tokensMediasChatbots, soporte
Claude 3 (OpenRouter)Excelente200k tokensMuy bajasDocumentos largos
Mistral 7B (Ollama local)Moderado8k tokensMedias-AltasPrototipos, dev
Llama 2 70B (Local)Bueno4k tokensMediasBalance local/calidad

Cómo priorizar:

Calidad es CRÍTICA si:

  • ✅ Decisiones de negocio (finanzas, legal, médico)
  • ✅ Customer-facing (reputación de marca)
  • ✅ Compliance/regulatory (no puedes dar respuestas incorrectas)

Calidad es SECUNDARIA si:

  • ⚠️ Prototipo interno (solo para testear idea)
  • ⚠️ Tareas simples (traducción, resumen básico)
  • ⚠️ Puedes validar manualmente después (human-in-the-loop)

Tip de evaluación:

Test de calidad rápido:

  1. Escribe 5 preguntas representativas de tu uso
  2. Prueba con GPT-4 (baseline alto)
  3. Prueba con modelo más barato (GPT-3.5, Mistral 7B)
  4. ¿La diferencia de calidad justifica la diferencia de costo?

Si GPT-3.5 es 95% tan bueno que GPT-4 pero 20x más barato → usa GPT-3.5


🔒 Dimensión 3: Privacidad

¿Qué evaluar?

Privacidad NO es solo "¿se guarda mi data?". Incluye:

  1. Data retention (retención de datos)

    • ¿Cuánto tiempo guardan tus requests?
    • ¿Los usan para entrenar modelos?
    • ¿Pueden leerlos humanos?
  2. Compliance (cumplimiento normativo)

    • GDPR (Europa)
    • HIPAA (salud USA)
    • CCPA (California)
    • SOC 2, ISO 27001
  3. Ubicación de datos

    • ¿Dónde están los servidores?
    • ¿Cruzan fronteras?
    • ¿On-premise vs cloud?

Preguntas clave:

1. ¿Mis datos son sensibles? (Médicos, financieros, legales, personales)
2. ¿Tengo restricciones legales? (GDPR, HIPAA, contratos cliente)
3. ¿Puedo enviar datos a USA? (Si eres EU, puede ser problema legal)
4. ¿Necesito auditoría? (¿Debo poder demostrar que datos nunca salieron?)

Ejemplos por proveedor:

ProveedorData retentionTrainingOn-premiseCompliance
OpenAI API30 días (puede cambiar)NO (opt-out default desde 2023)NO (cloud USA)SOC 2
Ollama localNUNCA (todo local)NUNCASÍ (tu hardware)Tú controlas
ModalDurante ejecuciónNONO (cloud)SOC 2
OpenRouterDepende del modeloDepende del modeloNOVariable

Cómo priorizar:

Privacidad es CRÍTICA si:

  • ✅ Datos médicos (HIPAA)
  • ✅ Datos financieros (PCI-DSS)
  • ✅ Datos legales (privilegio abogado-cliente)
  • ✅ Datos personales (GDPR strict)
  • ✅ Contratos con clientes enterprise (cláusulas de confidencialidad)

Privacidad es SECUNDARIA si:

  • ⚠️ Datos públicos (FAQ, documentación pública)
  • ⚠️ Datos anonimizados
  • ⚠️ Prototipo sin datos reales

Tip de evaluación:

Test de privacidad:

Pregúntate: ¿Qué pasa si estos datos aparecen en el New York Times mañana?

A. "Nada, son públicos" → Privacidad secundaria
B. "Perdemos clientes" → Privacidad importante
C. "Vamos a la cárcel" → Privacidad CRÍTICA (usa local)

Si respuesta es C, SOLO opciones on-premise (Ollama, LM Studio local).


⚡ Dimensión 4: Velocidad

¿Qué evaluar?

Velocidad NO es solo "qué tan rápido responde". Incluye:

  1. Latency (tiempo de respuesta)

    • Time to first token (TTFT): Cuánto tarda en empezar a responder
    • Tokens/segundo: Velocidad de generación
    • End-to-end: Tiempo total de request
  2. Throughput (volumen)

    • Requests simultáneos
    • Tokens/minuto totales del sistema
  3. Consistency

    • ¿Latency es predecible? (siempre 2s vs 1s-10s)
    • ¿Se degrada bajo carga?

Preguntas clave:

1. ¿Cuál es latency aceptable? (Chatbot: <2s. Análisis batch: <1min OK.)
2. ¿Cuántos requests simultáneos? (1 usuario: 1. App web: 100+.)
3. ¿Necesito streaming? (Ver respuesta generándose palabra por palabra)
4. ¿Tengo picos de tráfico? (Black Friday, virales, eventos)

Ejemplos por proveedor:

ProveedorLatency típicaThroughputStreamingEscalabilidad
OpenAI API1-3s (GPT-3.5)
3-5s (GPT-4)
Alto (rate limits: 3500 req/min tier 1)✅ SíAutomática
Ollama local3-10s (depende hardware)Bajo (1 request a la vez)✅ SíManual (más hardware)
Modal serverless2-4s (cold start)
1-2s (warm)
Alto (autoscaling)✅ SíAutomática
LM Studio5-15s (CPU)
2-5s (GPU)
Bajo (1-2 paralelos)✅ SíNo (desktop tool)

Cómo priorizar:

Velocidad es CRÍTICA si:

  • ✅ Real-time chat (usuarios esperando)
  • ✅ Customer support (cada segundo cuenta)
  • ✅ Interactive apps (IDE assistants, live demos)

Velocidad es SECUNDARIA si:

  • ⚠️ Batch processing (análisis nocturno de logs)
  • ⚠️ Background tasks (generar reportes)
  • ⚠️ Admin tools internos (no customer-facing)

Tip de evaluación:

Benchmark básico:

Prueba con prompt típico (200 tokens output):

OpenAI GPT-3.5: ~2s
Ollama Mistral 7B (local M1): ~6s
Modal (cold start): ~4s
Modal (warm): ~2s

¿Diferencia de 4s es aceptable? 
- Chatbot: NO
- Reporte diario: SÍ

Si necesitas <2s consistently, OpenAI API o Modal warm son mejores opciones.


🛠️ Dimensión 5: Simplicidad

¿Qué evaluar?

Simplicidad NO es solo "fácil de usar". Incluye:

  1. Tiempo de setup

    • ¿Cuánto tarda en estar funcionando?
    • ¿Necesito infraestructura especial?
  2. Complejidad técnica

    • ¿Necesito skills específicos? (DevOps, GPU tuning)
    • ¿Puedo hacerlo con mi equipo actual?
  3. Mantenimiento

    • ¿Necesito actualizar/parchar?
    • ¿Necesito monitorear 24/7?
    • ¿Qué pasa si algo se rompe?

Preguntas clave:

1. ¿Cuánto tiempo tengo para implementar? (1 día, 1 semana, 1 mes)
2. ¿Qué skills tiene mi equipo? (Solo Python, DevOps avanzado, ML engineers)
3. ¿Quién mantiene esto después? (¿Tengo tiempo/equipo para operations?)
4. ¿Necesito documentación en español? (OpenAI docs: excelentes. Ollama: menores.)

Ejemplos por proveedor:

ProveedorSetup timeSkills necesariosMantenimientoDocs
OpenAI API<1 horaPython básicoCero (managed)Excelentes
Ollama local2-4 horasLinux, CLI, networkingMedio (updates, monitoring)Buenas
Modal serverless1-2 horasPython + decoratorsBajo (casi managed)Buenas
LM Studio<30 minClic & playBajo (auto-update)GUI intuitiva
OpenRouter<1 horaPython básicoCero (managed)Buenas

Cómo priorizar:

Simplicidad es CRÍTICA si:

  • ✅ Equipo junior (sin DevOps)
  • ✅ Deadline apretado (MVP en días)
  • ✅ Sin tiempo para operations (startup pequeño)
  • ✅ Quieres enfocarte en producto (no infraestructura)

Simplicidad es SECUNDARIA si:

  • ⚠️ Equipo senior (DevOps in-house)
  • ⚠️ Tiempo disponible (puedes invertir semanas)
  • ⚠️ Requisitos que obligan complejidad (privacidad on-premise)

Tip de evaluación:

Test de simplicidad:

Tiempo estimado de "cero a hello world":

OpenAI API:
- Crear cuenta: 5 min
- pip install openai: 1 min
- Código hello world: 5 min
- Total: ~15 min ✅

Ollama local:
- Instalar Ollama: 10 min
- Descargar modelo (7GB): 20 min
- Setup networking: 15 min
- Código hello world: 10 min
- Total: ~55 min ⚠️

¿Vale la pena 40 min extra para tener local?
- Si privacidad es crítica: SÍ
- Si solo quieres prototipar: NO

🎯 Aplicando las 5 Dimensiones: Scorecard

Template de evaluación:

Usa este scorecard para cualquier proyecto:

## Proyecto: [Nombre]

### 1. Costo
- Presupuesto mensual: $____
- Volumen esperado: ____ requests/día
- ¿Tengo hardware?: SÍ / NO
- Prioridad: CRÍTICA / IMPORTANTE / SECUNDARIA

### 2. Calidad
- Accuracy necesario: ____%
- ¿Necesito reasoning complejo?: SÍ / NO
- Context window: ____ tokens
- Prioridad: CRÍTICA / IMPORTANTE / SECUNDARIA

### 3. Privacidad
- Tipo de datos: SENSIBLES / NORMALES / PÚBLICOS
- Compliance: GDPR / HIPAA / NINGUNO
- ¿Puede ir a cloud?: SÍ / NO
- Prioridad: CRÍTICA / IMPORTANTE / SECUNDARIA

### 4. Velocidad
- Latency aceptable: ____ segundos
- Requests simultáneos: ____
- ¿Necesito streaming?: SÍ / NO
- Prioridad: CRÍTICA / IMPORTANTE / SECUNDARIA

### 5. Simplicidad
- Tiempo disponible: ____ días
- Skills del equipo: JUNIOR / MID / SENIOR
- ¿Quién mantiene?: NADIE / EQUIPO PEQUEÑO / EQUIPO DEDICADO
- Prioridad: CRÍTICA / IMPORTANTE / SECUNDARIA

Ejemplo resuelto:

## Proyecto: E-commerce Chatbot

### 1. Costo
- Presupuesto mensual: $500
- Volumen esperado: 10,000 requests/día
- ¿Tengo hardware?: NO
- Prioridad: IMPORTANTE (no crítica, pero $500 es límite)

### 2. Calidad
- Accuracy necesario: 90%
- ¿Necesito reasoning complejo?: NO (soporte básico)
- Context window: 4k tokens (conversaciones cortas)
- Prioridad: IMPORTANTE (90% es suficiente, no necesito GPT-4)

### 3. Privacidad
- Tipo de datos: NORMALES (soporte público, no tarjetas)
- Compliance: NINGUNO
- ¿Puede ir a cloud?: SÍ
- Prioridad: SECUNDARIA

### 4. Velocidad
- Latency aceptable: 2 segundos
- Requests simultáneos: 50
- ¿Necesito streaming?: SÍ (mejor UX)
- Prioridad: CRÍTICA (usuarios no esperan >2s)

### 5. Simplicidad
- Tiempo disponible: 3 días (MVP rápido)
- Skills del equipo: JUNIOR (2 devs Python básico)
- ¿Quién mantiene?: NADIE (no hay DevOps)
- Prioridad: CRÍTICA (equipo junior, deadline apretado)

---

RESUMEN:
Dimensiones CRÍTICAS: Velocidad, Simplicidad
Dimensiones IMPORTANTES: Costo, Calidad
Dimensiones SECUNDARIAS: Privacidad

RECOMENDACIÓN PRELIMINAR: OpenAI API (GPT-3.5)
- ✅ Cumple velocidad (<2s)
- ✅ Cumple simplicidad (setup en 1 día)
- ✅ Cumple costo ($300/mes < $500 límite)
- ✅ Cumple calidad (90%+ con GPT-3.5)
- ✅ Privacidad OK (datos públicos)

🔄 Priorizando Trade-offs

Regla de oro:

Optimiza para las 2-3 dimensiones CRÍTICAS. Acepta trade-offs en las demás.

No puedes tener las 5 dimensiones en máximo:

  • OpenAI API: Alta calidad, alta simplicidad → Costo medio, privacidad media
  • Ollama local: Costo cero, privacidad máxima → Calidad media, complejidad alta
  • Modal serverless: Escalabilidad alta, simplicidad media → Costo variable

Matriz de decisión rápida:

Si tus 2 dimensiones CRÍTICAS son:

1. COSTO + PRIVACIDAD → Ollama local
2. CALIDAD + VELOCIDAD → OpenAI API
3. SIMPLICIDAD + VELOCIDAD → OpenAI API o OpenRouter
4. COSTO + SIMPLICIDAD → OpenRouter (modelos baratos)
5. PRIVACIDAD + CALIDAD → Local con Llama 2 70B (hardware caro)

Próxima cápsula (03) verás panorama completo de opciones con comparación específica.


📝 Ejercicio de aplicación

Ejercicio: Evalúa estos 3 proyectos

Para cada proyecto, identifica:

  1. Qué 2-3 dimensiones son CRÍTICAS
  2. Qué proveedor preliminarmente recomendarías

Proyecto A: Análisis de contratos legales

  • 1000 contratos/mes
  • Cada contrato: 10k tokens promedio
  • Bufete de abogados, datos confidenciales
  • Necesita accuracy 99%+
  • Equipo de 1 dev senior

Proyecto B: Chatbot de ideas creativas

  • Side project personal
  • 100 usuarios/mes
  • No hay presupuesto ($0)
  • Accuracy 70% OK (solo ideas, no crítico)
  • Solo tú (dev junior Python)

Proyecto C: Soporte técnico enterprise

  • 100k requests/día
  • Necesita <1s latency
  • Datos no sensibles
  • Budget: $5000/mes
  • Equipo DevOps disponible
Ver respuestas recomendadas

Proyecto A: Análisis legal

Dimensiones CRÍTICAS:

  1. PRIVACIDAD (datos confidenciales, privilegio abogado-cliente)
  2. CALIDAD (99%+ accuracy, decisiones legales)

Dimensiones IMPORTANTES: 3. Costo (1000 × 10k tokens = 10M tokens/mes = $200-600 según modelo)

Recomendación: Ollama local con Llama 2 70B o LM Studio

  • ✅ Privacidad máxima (on-premise, datos nunca salen)
  • ✅ Calidad alta (Llama 2 70B es casi GPT-3.5)
  • ✅ Costo: Solo hardware (~$3k upfront, luego gratis)
  • ⚠️ Trade-off: Complejidad (dev senior puede manejarlo)

Proyecto B: Chatbot creativo

Dimensiones CRÍTICAS:

  1. COSTO (presupuesto $0)
  2. SIMPLICIDAD (dev junior solo)

Dimensiones SECUNDARIAS:

  • Calidad (70% OK)
  • Velocidad (side project, no crítico)
  • Privacidad (ideas no sensibles)

Recomendación: Ollama local con Mistral 7B

  • ✅ Costo: $0 (gratis siempre)
  • ✅ Simplicidad: Media (pero aceptable para aprender)
  • ✅ Calidad: 70-80% (suficiente para ideas)
  • ⚠️ Trade-off: Setup inicial (2-4 horas primera vez)

Alternativa si tienes laptop débil: OpenRouter con modelos gratuitos (algunos disponibles)


Proyecto C: Soporte enterprise

Dimensiones CRÍTICAS:

  1. VELOCIDAD (<1s latency, 100k req/día)
  2. ESCALABILIDAD (picos de tráfico)

Dimensiones IMPORTANTES: 3. Costo ($5k/mes disponible)

Recomendación: OpenAI API (GPT-3.5-turbo) con OpenRouter fallback

  • ✅ Velocidad: ~1-2s (cumple <1s en percentil 90)
  • ✅ Escalabilidad: Automática (OpenAI maneja tráfico)
  • ✅ Costo: 100k × 500 tokens × $0.002/1k × 30 = $3000/mes (dentro presupuesto)
  • ✅ Fallback: OpenRouter si OpenAI cae
  • ⚠️ Trade-off: Vendor lock-in (mitigado con fallback)

Alternativa si <1s es estricto: Modal serverless (warm instances <1s)


📊 Resumen

Conceptos clave:

  1. 5 Dimensiones de evaluación:

    • Costo ($/mes, upfront, ocultos)
    • Calidad (reasoning, accuracy, context)
    • Privacidad (retention, compliance, ubicación)
    • Velocidad (latency, throughput, consistency)
    • Simplicidad (setup, skills, mantenimiento)
  2. No existe "el mejor" proveedor:

    • Solo existe "el mejor PARA tu proyecto"
    • Identifica 2-3 dimensiones CRÍTICAS
    • Acepta trade-offs en las demás
  3. Usa scorecard estructurado:

    • Evalúa todas las dimensiones
    • Prioriza (CRÍTICA / IMPORTANTE / SECUNDARIA)
    • Recomendación preliminar emerge naturalmente
  4. Trade-offs son inevitables:

    • OpenAI: Calidad + Simplicidad → Costo medio
    • Ollama: Costo cero + Privacidad → Complejidad alta
    • Modal: Escalabilidad → Costo variable

🔗 Recursos adicionales

  1. OpenAI Pricing Calculator - Calcula costos estimados
  2. LLM Comparison Leaderboard - Compara calidad de modelos
  3. GDPR Compliance Guide - Requisitos de privacidad Europa
  4. LLM Latency Benchmarks - Comparación de velocidad
  5. AWS vs Local Cost Analysis - Trade-offs económicos

➡️ Próximo paso

Siguiente cápsula: 03-panorama-opciones-2024-2026.md

Ahora que sabes CÓMO evaluar (5 dimensiones), aprenderás QUÉ opciones existen:

  • OpenAI API (cloud estándar)
  • LM Studio (local GUI)
  • Ollama (local CLI)
  • OpenRouter (agregador)
  • Modal (serverless)

Verás características principales, trade-offs, y cuándo usar cada una.


Tiempo de lectura: 10-12 minutos
Siguiente: 03-panorama-opciones-2024-2026.md