Módulo 1: Decision Framework para Acceso a LLMs

Panorama de Opciones 2024-2026: Proveedores de Acceso a LLMs

Descripción de la cápsula

Antes de elegir, necesitas conocer QUÉ opciones existen en el mercado actual (2024-2026).

Esta cápsula te da un panorama completo de las 5 opciones principales para acceder a LLMs: OpenAI API, LM Studio, Ollama, OpenRouter y Modal. No entrarás en profundidad técnica (eso es módulos 2-6), pero entenderás características principales, cuándo usar cada una, y trade-offs básicos.

Al finalizar, podrás responder: "¿Qué opciones tengo disponibles y cuál es el mejor fit inicial para mi proyecto?"


🎯 Las 5 Opciones Principales

Opción 1: OpenAI API (Cloud Estándar)

¿Qué es? API REST en la nube que da acceso a modelos GPT (GPT-3.5, GPT-4, GPT-4-turbo).

Características:

  • Managed service (infraestructura gestionada por OpenAI)
  • Modelos state-of-the-art (máxima calidad)
  • SDK oficial en Python, Node.js, etc.
  • Pay-per-use ($/token)

Trade-offs:

  • ✅ Calidad máxima (GPT-4 es líder en benchmarks)
  • ✅ Simplicidad máxima (setup <1 hora)
  • ✅ Velocidad buena (1-3s latency)
  • ⚠️ Costo medio ($0.002-0.03/1k tokens según modelo)
  • ⚠️ Privacidad media (datos van a cloud, 30 días retention)

Cuándo usar:

  • Necesitas máxima calidad (GPT-4)
  • Equipo sin skills DevOps
  • Timeline apretado (<1 semana para MVP)
  • Datos NO críticos en privacidad

Cuándo NO usar:

  • Datos sensibles (médicos, financieros, legales)
  • Costo prohibitivo a escala (millones queries/día)
  • Requisitos on-premise obligatorios

Módulo completo: Módulo 2 cubre setup, pricing, best practices, primer chatbot.


Opción 2: LM Studio (Local GUI)

¿Qué es? Aplicación desktop (Mac/Windows/Linux) para ejecutar modelos LLM localmente con interfaz gráfica.

Características:

  • GUI intuitiva (point & click)
  • Descarga modelos con 1 clic (Mistral 7B, Llama 2, etc.)
  • API compatible con OpenAI (drop-in replacement)
  • 100% local (datos NUNCA salen de tu máquina)
  • Gratis (open source)

Trade-offs:

  • ✅ Privacidad máxima (on-premise)
  • ✅ Costo cero (solo hardware)
  • ✅ Simplicidad alta (GUI amigable)
  • ⚠️ Calidad media (Mistral 7B ~80% de GPT-3.5)
  • ⚠️ Velocidad variable (depende de tu hardware)
  • ⚠️ Escalabilidad baja (tu laptop tiene límites)

Cuándo usar:

  • Desarrollo local (antes de producción)
  • Side projects sin presupuesto
  • Aprender sobre LLMs sin API keys
  • Prototipos con datos sensibles

Cuándo NO usar:

  • Producción con múltiples usuarios
  • Necesitas máxima calidad (GPT-4 level)
  • No tienes hardware decente (min 16GB RAM)

Módulo completo: Módulo 3 cubre instalación, descarga de modelos, API local, primer chatbot.


Opción 3: Ollama (Local CLI)

¿Qué es? Herramienta de línea de comandos para ejecutar modelos LLM localmente, optimizada para producción.

Características:

  • CLI profesional (no GUI)
  • Model management (pull, list, run, remove)
  • API REST compatible con OpenAI
  • Docker support (containerización)
  • Optimizado para servidores (no solo laptops)
  • Gratis (open source)

Trade-offs:

  • ✅ Privacidad máxima (100% local)
  • ✅ Costo cero (operativo)
  • ✅ Production-ready (Docker, APIs, scaling)
  • ⚠️ Complejidad media-alta (CLI, Linux, networking)
  • ⚠️ Calidad media (modelos 7B-70B)
  • ⚠️ Requiere hardware (GPU para velocidad)

Cuándo usar:

  • Producción on-premise (privacidad crítica)
  • Escalabilidad con cluster (múltiples nodos)
  • Equipo con skills DevOps
  • Volumen alto (millones queries/mes) donde costo OpenAI es prohibitivo

Cuándo NO usar:

  • Equipo junior sin CLI/Docker
  • Timeline apretado (<2 semanas)
  • No tienes hardware servidor

Diferencia vs LM Studio:

  • LM Studio: GUI, laptop, desarrollo
  • Ollama: CLI, servidor, producción

Módulo completo: Módulo 4 cubre instalación, model management, API REST, Docker deployment.


Opción 4: OpenRouter (Multi-Provider Agregador)

¿Qué es? API agregadora que da acceso a 100+ modelos de múltiples proveedores (OpenAI, Anthropic, Google, Meta, Mistral, etc.) con una sola API key.

Características:

  • Unified API (compatible OpenAI SDK)
  • 100+ modelos (GPT-4, Claude 3, Gemini, Llama, Mixtral)
  • Cost optimization (elige modelo más barato)
  • Fallback automático (si modelo falla, prueba otro)
  • Pay-per-use (variable según modelo)

Trade-offs:

  • ✅ Flexibilidad máxima (cambias modelo sin código)
  • ✅ Costo optimizable ($0.001-0.03 según modelo)
  • ✅ Fallback built-in (alta reliability)
  • ⚠️ Intermediario (OpenRouter entre tú y modelo)
  • ⚠️ Latency +100-200ms (vs proveedor directo)
  • ⚠️ Privacidad variable (depende del modelo)

Cuándo usar:

  • Necesitas flexibility (experimentar con múltiples modelos)
  • Quieres cost optimization (usar GPT-4 solo cuando necesario, else Mixtral)
  • Quieres high availability (fallback automático)
  • Evitar vendor lock-in

Cuándo NO usar:

  • Latency crítica (<1s estricto) - intermediario añade delay
  • Privacidad crítica (datos pasan por OpenRouter en algunos modelos)
  • Solo necesitas 1 modelo siempre (OpenAI directo es más simple)

Módulo completo: Módulo 5 cubre setup, switching de modelos, cost comparison, fallback strategies.


Opción 5: Modal (Serverless Deployment)

¿Qué es? Plataforma serverless para ejecutar código Python en la nube con GPUs, especializada en ML/AI workloads.

Características:

  • Serverless (no gestionas servidores)
  • Autoscaling (0 → 1000 instancias en segundos)
  • GPU on-demand (provisioning automático)
  • Pay-per-use (solo pagas cuando ejecuta)
  • Python decorators (código familiar)

Trade-offs:

  • ✅ Escalabilidad automática (tráfico variable)
  • ✅ Costo optimizado (no pagas idle time)
  • ✅ Sin gestión infra (Modal maneja todo)
  • ⚠️ Complejidad media (decorators, async)
  • ⚠️ Cold starts (primera request ~3-5s)
  • ⚠️ Costo variable (difícil de predecir con picos)

Cuándo usar:

  • Tráfico variable (picos impredecibles)
  • No quieres gestionar servidores
  • Equipo mid con Python pero sin DevOps
  • Necesitas GPUs pero no quieres comprarlas

Cuándo NO usar:

  • Budget ultra-limitado (pay-per-use puede sorprender)
  • Latency crítica estricta (cold starts ~3-5s)
  • Equipo junior (curva de aprendizaje Modal)

Módulo completo: Módulo 6 cubre setup Modal, deploy función, autoscaling, cost model.


📊 Comparación Rápida

Tabla comparativa:

CaracterísticaOpenAI APILM StudioOllamaOpenRouterModal
TipoCloud APILocal GUILocal CLIAgregadorServerless
Setup<1 hr<30 min2-4 hrs<1 hr1-2 hrs
Costo$0.002-0.03/1k$0$0Variable$0.000185/s GPU
CalidadAlta (GPT-4)MediaMediaVariableMedia-Alta
PrivacidadMediaMáximaMáximaVariableMedia
Velocidad1-3s5-15s5-10s2-4s1-2s (warm)
EscalabilidadAutoNoManualAutoAuto
SkillsPython básicoNingunoDevOpsPython básicoPython mid

🎯 Mapa de Decisión Rápido

Pregunta 1: ¿Datos sensibles (on-premise obligatorio)?

SÍ → Ollama o LM Studio

  • Ollama si: Producción, equipo senior
  • LM Studio si: Desarrollo, prototipo

NO → Continúa a pregunta 2


Pregunta 2: ¿Necesitas máxima calidad (GPT-4 level)?

SÍ → OpenAI API o OpenRouter

  • OpenAI directo si: Solo GPT-4, sin flexibility
  • OpenRouter si: Quieres poder cambiar después

NO → Continúa a pregunta 3


Pregunta 3: ¿Budget es $0-100/mes?

SÍ → Ollama local o OpenRouter (modelos baratos)

  • Ollama si: Tienes hardware y skills
  • OpenRouter si: Quieres simplicidad

NO → Continúa a pregunta 4


Pregunta 4: ¿Tráfico variable con picos grandes?

SÍ → Modal serverless o OpenAI API

  • Modal si: Equipo mid-senior, cost optimization importante
  • OpenAI si: Equipo junior, simplicidad crítica

NO → Cualquier opción funciona, usa criterios de desempate


📝 Ejercicio: Identifica la Mejor Opción

Para cada escenario, identifica qué opción es mejor:

Escenario 1:

  • Side project personal
  • 50 usuarios/mes
  • Datos públicos (memes generator)
  • Budget: $0

Respuesta: _________ porque _________

Ver respuesta

Respuesta: LM Studio (o Ollama)

Por qué:

  • Budget $0 → Solo opciones locales gratuitas
  • 50 usuarios → Volumen bajísimo, laptop puede manejarlo
  • Side project → GUI de LM Studio es más amigable
  • Datos públicos → Privacidad no es factor

Ollama también funciona, pero LM Studio es más simple para side project.


Escenario 2:

  • Enterprise con 500k usuarios/día
  • Análisis de sentimiento en reviews
  • Budget: $50k/mes
  • Equipo DevOps senior (20 personas)

Respuesta: _________ porque _________

Ver respuesta

Respuesta: Ollama local (con GPU cluster)

Por qué:

  • 500k usuarios/día × 2 queries × 200 tokens = 6B tokens/mes
  • OpenAI cost: 6B × $0.002/1k = $12k/mes ✅ (dentro de budget)
  • PERO Ollama es mejor porque:
    • Costo a 12 meses: Ollama ($50k hardware, luego $0) vs OpenAI ($144k/año)
    • Equipo senior puede mantener cluster
    • Análisis sentimiento NO necesita GPT-4 (Mixtral 8x7B es suficiente)

OpenAI API también es válido si quieren simplicidad > ahorro.


Escenario 3:

  • Startup validando idea
  • 100 usuarios beta
  • Timeline: 2 semanas para demo
  • Budget: $200/mes

Respuesta: _________ porque _________

Ver respuesta

Respuesta: OpenAI API

Por qué:

  • Timeline crítico (2 semanas) → Simplicidad es #1
  • 100 usuarios: ~$5-10/mes (muy dentro de budget)
  • Demo stage: Calidad importa (GPT-3.5 es suficiente)
  • Equipo puede enfocarse en producto, no en infraestructura

Después de validar idea, pueden migrar a Ollama si escalan.


🔄 Evolución del Ecosistema

2020-2021: Era OpenAI exclusiva

  • Solo OpenAI API disponible comercialmente
  • GPT-3 era prácticamente única opción
  • Costo: $0.02/1k tokens (20x más caro que hoy)

2022-2023: Explosión de alternativas

  • Anthropic lanza Claude
  • Meta libera Llama 2 (open source)
  • Hugging Face Inference API
  • Replicate para modelos open source

2024-2026: Madurez y consolidación

  • Agregadores: OpenRouter, Together AI (unified access)
  • Local tools: Ollama, LM Studio (UX mejorada)
  • Serverless: Modal, Replicate (deploy sin DevOps)
  • Price wars: GPT-3.5 bajó 10x ($0.02 → $0.002)

Tendencia clave: Democratización (opciones gratis, locales, serverless accesibles)


📊 Resumen

Conceptos clave:

  1. 5 opciones principales en 2024-2026:

    • OpenAI API (cloud estándar, máxima calidad)
    • LM Studio (local GUI, desarrollo)
    • Ollama (local CLI, producción)
    • OpenRouter (agregador, flexibility)
    • Modal (serverless, autoscaling)
  2. No hay "la mejor" universal:

    • OpenAI: Mejor para calidad + simplicidad
    • Ollama: Mejor para privacidad + costo cero
    • OpenRouter: Mejor para flexibility
    • Modal: Mejor para escalabilidad variable
  3. Ecosistema evolucionó rápido:

    • 2020: Solo OpenAI ($$$)
    • 2026: 5+ opciones (incluyendo gratis)
  4. Próximos módulos cubren implementación:

    • Módulo 2: OpenAI API (cloud)
    • Módulo 3: LM Studio (local GUI)
    • Módulo 4: Ollama (local CLI)
    • Módulo 5: OpenRouter (agregador)
    • Módulo 6: Modal (serverless)

🔗 Recursos adicionales

  1. OpenAI Platform - Docs oficial
  2. LM Studio Download - Aplicación GUI
  3. Ollama - CLI tool oficial
  4. OpenRouter - Agregador multi-provider
  5. Modal - Serverless platform
  6. LLM Landscape 2024 - Report Andreessen Horowitz

➡️ Próximo paso

Siguiente cápsula: 04-matriz-decision.md

Ahora que conoces las 5 opciones principales, aprenderás a aplicar la matriz de decisión que mapea requisitos específicos a proveedores recomendados.

Verás 7 casos comunes (Privacidad+Costo, Calidad+Velocidad, etc.) con recomendación justificada para cada uno.


Tiempo de lectura: 8-10 minutos
Siguiente: 04-matriz-decision.md