Módulo 1: Decision Framework para Acceso a LLMs
Panorama de Opciones 2024-2026: Proveedores de Acceso a LLMs
Descripción de la cápsula
Antes de elegir, necesitas conocer QUÉ opciones existen en el mercado actual (2024-2026).
Esta cápsula te da un panorama completo de las 5 opciones principales para acceder a LLMs: OpenAI API, LM Studio, Ollama, OpenRouter y Modal. No entrarás en profundidad técnica (eso es módulos 2-6), pero entenderás características principales, cuándo usar cada una, y trade-offs básicos.
Al finalizar, podrás responder: "¿Qué opciones tengo disponibles y cuál es el mejor fit inicial para mi proyecto?"
🎯 Las 5 Opciones Principales
Opción 1: OpenAI API (Cloud Estándar)
¿Qué es? API REST en la nube que da acceso a modelos GPT (GPT-3.5, GPT-4, GPT-4-turbo).
Características:
- Managed service (infraestructura gestionada por OpenAI)
- Modelos state-of-the-art (máxima calidad)
- SDK oficial en Python, Node.js, etc.
- Pay-per-use ($/token)
Trade-offs:
- ✅ Calidad máxima (GPT-4 es líder en benchmarks)
- ✅ Simplicidad máxima (setup <1 hora)
- ✅ Velocidad buena (1-3s latency)
- ⚠️ Costo medio ($0.002-0.03/1k tokens según modelo)
- ⚠️ Privacidad media (datos van a cloud, 30 días retention)
Cuándo usar:
- Necesitas máxima calidad (GPT-4)
- Equipo sin skills DevOps
- Timeline apretado (<1 semana para MVP)
- Datos NO críticos en privacidad
Cuándo NO usar:
- Datos sensibles (médicos, financieros, legales)
- Costo prohibitivo a escala (millones queries/día)
- Requisitos on-premise obligatorios
Módulo completo: Módulo 2 cubre setup, pricing, best practices, primer chatbot.
Opción 2: LM Studio (Local GUI)
¿Qué es? Aplicación desktop (Mac/Windows/Linux) para ejecutar modelos LLM localmente con interfaz gráfica.
Características:
- GUI intuitiva (point & click)
- Descarga modelos con 1 clic (Mistral 7B, Llama 2, etc.)
- API compatible con OpenAI (drop-in replacement)
- 100% local (datos NUNCA salen de tu máquina)
- Gratis (open source)
Trade-offs:
- ✅ Privacidad máxima (on-premise)
- ✅ Costo cero (solo hardware)
- ✅ Simplicidad alta (GUI amigable)
- ⚠️ Calidad media (Mistral 7B ~80% de GPT-3.5)
- ⚠️ Velocidad variable (depende de tu hardware)
- ⚠️ Escalabilidad baja (tu laptop tiene límites)
Cuándo usar:
- Desarrollo local (antes de producción)
- Side projects sin presupuesto
- Aprender sobre LLMs sin API keys
- Prototipos con datos sensibles
Cuándo NO usar:
- Producción con múltiples usuarios
- Necesitas máxima calidad (GPT-4 level)
- No tienes hardware decente (min 16GB RAM)
Módulo completo: Módulo 3 cubre instalación, descarga de modelos, API local, primer chatbot.
Opción 3: Ollama (Local CLI)
¿Qué es? Herramienta de línea de comandos para ejecutar modelos LLM localmente, optimizada para producción.
Características:
- CLI profesional (no GUI)
- Model management (pull, list, run, remove)
- API REST compatible con OpenAI
- Docker support (containerización)
- Optimizado para servidores (no solo laptops)
- Gratis (open source)
Trade-offs:
- ✅ Privacidad máxima (100% local)
- ✅ Costo cero (operativo)
- ✅ Production-ready (Docker, APIs, scaling)
- ⚠️ Complejidad media-alta (CLI, Linux, networking)
- ⚠️ Calidad media (modelos 7B-70B)
- ⚠️ Requiere hardware (GPU para velocidad)
Cuándo usar:
- Producción on-premise (privacidad crítica)
- Escalabilidad con cluster (múltiples nodos)
- Equipo con skills DevOps
- Volumen alto (millones queries/mes) donde costo OpenAI es prohibitivo
Cuándo NO usar:
- Equipo junior sin CLI/Docker
- Timeline apretado (<2 semanas)
- No tienes hardware servidor
Diferencia vs LM Studio:
- LM Studio: GUI, laptop, desarrollo
- Ollama: CLI, servidor, producción
Módulo completo: Módulo 4 cubre instalación, model management, API REST, Docker deployment.
Opción 4: OpenRouter (Multi-Provider Agregador)
¿Qué es? API agregadora que da acceso a 100+ modelos de múltiples proveedores (OpenAI, Anthropic, Google, Meta, Mistral, etc.) con una sola API key.
Características:
- Unified API (compatible OpenAI SDK)
- 100+ modelos (GPT-4, Claude 3, Gemini, Llama, Mixtral)
- Cost optimization (elige modelo más barato)
- Fallback automático (si modelo falla, prueba otro)
- Pay-per-use (variable según modelo)
Trade-offs:
- ✅ Flexibilidad máxima (cambias modelo sin código)
- ✅ Costo optimizable ($0.001-0.03 según modelo)
- ✅ Fallback built-in (alta reliability)
- ⚠️ Intermediario (OpenRouter entre tú y modelo)
- ⚠️ Latency +100-200ms (vs proveedor directo)
- ⚠️ Privacidad variable (depende del modelo)
Cuándo usar:
- Necesitas flexibility (experimentar con múltiples modelos)
- Quieres cost optimization (usar GPT-4 solo cuando necesario, else Mixtral)
- Quieres high availability (fallback automático)
- Evitar vendor lock-in
Cuándo NO usar:
- Latency crítica (<1s estricto) - intermediario añade delay
- Privacidad crítica (datos pasan por OpenRouter en algunos modelos)
- Solo necesitas 1 modelo siempre (OpenAI directo es más simple)
Módulo completo: Módulo 5 cubre setup, switching de modelos, cost comparison, fallback strategies.
Opción 5: Modal (Serverless Deployment)
¿Qué es? Plataforma serverless para ejecutar código Python en la nube con GPUs, especializada en ML/AI workloads.
Características:
- Serverless (no gestionas servidores)
- Autoscaling (0 → 1000 instancias en segundos)
- GPU on-demand (provisioning automático)
- Pay-per-use (solo pagas cuando ejecuta)
- Python decorators (código familiar)
Trade-offs:
- ✅ Escalabilidad automática (tráfico variable)
- ✅ Costo optimizado (no pagas idle time)
- ✅ Sin gestión infra (Modal maneja todo)
- ⚠️ Complejidad media (decorators, async)
- ⚠️ Cold starts (primera request ~3-5s)
- ⚠️ Costo variable (difícil de predecir con picos)
Cuándo usar:
- Tráfico variable (picos impredecibles)
- No quieres gestionar servidores
- Equipo mid con Python pero sin DevOps
- Necesitas GPUs pero no quieres comprarlas
Cuándo NO usar:
- Budget ultra-limitado (pay-per-use puede sorprender)
- Latency crítica estricta (cold starts ~3-5s)
- Equipo junior (curva de aprendizaje Modal)
Módulo completo: Módulo 6 cubre setup Modal, deploy función, autoscaling, cost model.
📊 Comparación Rápida
Tabla comparativa:
| Característica | OpenAI API | LM Studio | Ollama | OpenRouter | Modal |
|---|---|---|---|---|---|
| Tipo | Cloud API | Local GUI | Local CLI | Agregador | Serverless |
| Setup | <1 hr | <30 min | 2-4 hrs | <1 hr | 1-2 hrs |
| Costo | $0.002-0.03/1k | $0 | $0 | Variable | $0.000185/s GPU |
| Calidad | Alta (GPT-4) | Media | Media | Variable | Media-Alta |
| Privacidad | Media | Máxima | Máxima | Variable | Media |
| Velocidad | 1-3s | 5-15s | 5-10s | 2-4s | 1-2s (warm) |
| Escalabilidad | Auto | No | Manual | Auto | Auto |
| Skills | Python básico | Ninguno | DevOps | Python básico | Python mid |
🎯 Mapa de Decisión Rápido
Pregunta 1: ¿Datos sensibles (on-premise obligatorio)?
SÍ → Ollama o LM Studio
- Ollama si: Producción, equipo senior
- LM Studio si: Desarrollo, prototipo
NO → Continúa a pregunta 2
Pregunta 2: ¿Necesitas máxima calidad (GPT-4 level)?
SÍ → OpenAI API o OpenRouter
- OpenAI directo si: Solo GPT-4, sin flexibility
- OpenRouter si: Quieres poder cambiar después
NO → Continúa a pregunta 3
Pregunta 3: ¿Budget es $0-100/mes?
SÍ → Ollama local o OpenRouter (modelos baratos)
- Ollama si: Tienes hardware y skills
- OpenRouter si: Quieres simplicidad
NO → Continúa a pregunta 4
Pregunta 4: ¿Tráfico variable con picos grandes?
SÍ → Modal serverless o OpenAI API
- Modal si: Equipo mid-senior, cost optimization importante
- OpenAI si: Equipo junior, simplicidad crítica
NO → Cualquier opción funciona, usa criterios de desempate
📝 Ejercicio: Identifica la Mejor Opción
Para cada escenario, identifica qué opción es mejor:
Escenario 1:
- Side project personal
- 50 usuarios/mes
- Datos públicos (memes generator)
- Budget: $0
Respuesta: _________ porque _________
Ver respuesta
Respuesta: LM Studio (o Ollama)
Por qué:
- Budget $0 → Solo opciones locales gratuitas
- 50 usuarios → Volumen bajísimo, laptop puede manejarlo
- Side project → GUI de LM Studio es más amigable
- Datos públicos → Privacidad no es factor
Ollama también funciona, pero LM Studio es más simple para side project.
Escenario 2:
- Enterprise con 500k usuarios/día
- Análisis de sentimiento en reviews
- Budget: $50k/mes
- Equipo DevOps senior (20 personas)
Respuesta: _________ porque _________
Ver respuesta
Respuesta: Ollama local (con GPU cluster)
Por qué:
- 500k usuarios/día × 2 queries × 200 tokens = 6B tokens/mes
- OpenAI cost: 6B × $0.002/1k = $12k/mes ✅ (dentro de budget)
- PERO Ollama es mejor porque:
- Costo a 12 meses: Ollama ($50k hardware, luego $0) vs OpenAI ($144k/año)
- Equipo senior puede mantener cluster
- Análisis sentimiento NO necesita GPT-4 (Mixtral 8x7B es suficiente)
OpenAI API también es válido si quieren simplicidad > ahorro.
Escenario 3:
- Startup validando idea
- 100 usuarios beta
- Timeline: 2 semanas para demo
- Budget: $200/mes
Respuesta: _________ porque _________
Ver respuesta
Respuesta: OpenAI API
Por qué:
- Timeline crítico (2 semanas) → Simplicidad es #1
- 100 usuarios: ~$5-10/mes (muy dentro de budget)
- Demo stage: Calidad importa (GPT-3.5 es suficiente)
- Equipo puede enfocarse en producto, no en infraestructura
Después de validar idea, pueden migrar a Ollama si escalan.
🔄 Evolución del Ecosistema
2020-2021: Era OpenAI exclusiva
- Solo OpenAI API disponible comercialmente
- GPT-3 era prácticamente única opción
- Costo: $0.02/1k tokens (20x más caro que hoy)
2022-2023: Explosión de alternativas
- Anthropic lanza Claude
- Meta libera Llama 2 (open source)
- Hugging Face Inference API
- Replicate para modelos open source
2024-2026: Madurez y consolidación
- Agregadores: OpenRouter, Together AI (unified access)
- Local tools: Ollama, LM Studio (UX mejorada)
- Serverless: Modal, Replicate (deploy sin DevOps)
- Price wars: GPT-3.5 bajó 10x ($0.02 → $0.002)
Tendencia clave: Democratización (opciones gratis, locales, serverless accesibles)
📊 Resumen
Conceptos clave:
-
5 opciones principales en 2024-2026:
- OpenAI API (cloud estándar, máxima calidad)
- LM Studio (local GUI, desarrollo)
- Ollama (local CLI, producción)
- OpenRouter (agregador, flexibility)
- Modal (serverless, autoscaling)
-
No hay "la mejor" universal:
- OpenAI: Mejor para calidad + simplicidad
- Ollama: Mejor para privacidad + costo cero
- OpenRouter: Mejor para flexibility
- Modal: Mejor para escalabilidad variable
-
Ecosistema evolucionó rápido:
- 2020: Solo OpenAI ($$$)
- 2026: 5+ opciones (incluyendo gratis)
-
Próximos módulos cubren implementación:
- Módulo 2: OpenAI API (cloud)
- Módulo 3: LM Studio (local GUI)
- Módulo 4: Ollama (local CLI)
- Módulo 5: OpenRouter (agregador)
- Módulo 6: Modal (serverless)
🔗 Recursos adicionales
- OpenAI Platform - Docs oficial
- LM Studio Download - Aplicación GUI
- Ollama - CLI tool oficial
- OpenRouter - Agregador multi-provider
- Modal - Serverless platform
- LLM Landscape 2024 - Report Andreessen Horowitz
➡️ Próximo paso
Siguiente cápsula: 04-matriz-decision.md
Ahora que conoces las 5 opciones principales, aprenderás a aplicar la matriz de decisión que mapea requisitos específicos a proveedores recomendados.
Verás 7 casos comunes (Privacidad+Costo, Calidad+Velocidad, etc.) con recomendación justificada para cada uno.
Tiempo de lectura: 8-10 minutos
Siguiente: 04-matriz-decision.md