Módulo 6: El Ecosistema de AI APIs

3. Open-Source vs Propietario: Trade-Offs y Cuándo Usar Cada Uno

Descripción

Una de las decisiones más importantes como AI Engineer: ¿Usar modelos propietarios (GPT-4, Claude via API) o open-source (Llama 3, Mistral self-hosted)?

Qué aprenderás:

  • Diferencias entre propietario y open-source.
  • Trade-offs (control vs conveniencia, costo vs capacidad).
  • Cuándo usar cada uno.

Propietario (GPT-4, Claude, Gemini)

Características:

  • Acceso vía API: Pagas por uso (por token).
  • Pesos NO públicos: No puedes descargar modelo.
  • Controlado por provider: OpenAI, Anthropic, Google.

Ventajas:

  • State-of-the-art: Modelos más capaces (GPT-4 > Llama 3 en reasoning).
  • Sin infraestructura: No necesitas GPUs.
  • Actualizaciones: Modelo mejora sin que hagas nada.
  • Escala automática: 1 request o 1M requests → API maneja scaling.

Desventajas:

  • Costo por uso: Alto volumen → costoso.
  • Dependencia: Si API cae, tu app cae.
  • Privacidad: Envías datos a servidores externos.
  • Sin control: No puedes modificar modelo, fine-tuning limitado.

Open-Source (Llama 3, Mistral)

Características:

  • Pesos públicos: Puedes descargar modelo.
  • Self-hosted: Corres en tus servidores/GPUs.
  • Licencia permisiva: Uso comercial permitido.

Ventajas:

  • Gratis por request: Solo pagas hosting (costo fijo).
  • Privacidad: Datos no salen de tu infraestructura.
  • Control total: Puedes fine-tunar sin restricciones.
  • Sin dependencia: Si quieres cambiar provider, solo cambias modelo (no API).

Desventajas:

  • Requiere infraestructura: GPUs caras (A100: $1-3/hora, H100: $3-5/hora).
  • Mantenimiento: Tú manejas updates, scaling, monitoring.
  • Menos capaz: Llama 3 (70B) < GPT-4 en reasoning (pero 400B es competitivo).

Comparación: Cloud API vs Self-Hosted

AspectoCloud API (GPT-4)Self-Hosted (Llama 3)
Costo (bajo volumen)Bajo ($10-100/mes)Alto ($500-2,000/mes GPU)
Costo (alto volumen)Alto ($5K-50K/mes)Medio ($500-2,000/mes GPU fijo)
Setup5 minutos1-3 días
MantenimientoNingunoAlto (updates, monitoring)
PrivacidadBaja (datos a provider)Alta (datos en tu infra)
CapacidadMuy alta (GPT-4)Alta (Llama 400B)
LatenciaMedia (API call)Baja (local) o alta (si GPU saturada)

Cuándo Usar Cada Uno

Usa Cloud API (OpenAI, Anthropic) si:

  1. Bajo volumen: <100K requests/mes → APIs son más baratas.
  2. Prototipo/MVP: Necesitas lanzar rápido.
  3. Sin equipo de infra: No tienes DevOps para mantener GPUs.
  4. Necesitas state-of-the-art: GPT-4 es mejor que Llama 3 (70B).

Usa Open-Source (Llama 3, Mistral self-hosted) si:

  1. Alto volumen: >1M requests/mes → self-hosted es más barato.
  2. Privacidad crítica: Datos sensibles (HIPAA, GDPR) no pueden salir de tu infra.
  3. Control total: Quieres fine-tunar sin restricciones.
  4. Costo predecible: Prefieres costo fijo (GPU hosting) vs variable (API por token).

Casos de Uso Reales

Startup (MVP)

Contexto: Startup con $1K/mes de presupuesto, chatbot de soporte.

Decisión: Cloud API (GPT-3.5 o Claude Haiku).

Por qué:

  • Bajo volumen al inicio → APIs más baratas que hosting GPU.
  • Setup rápido → lanza en días, no semanas.

Empresa (Producción, Alto Volumen)

Contexto: Empresa con 10M requests/mes, chatbot interno.

Decisión: Self-hosted (Llama 3 70B).

Por qué:

  • Alto volumen → APIs cuestan $50K-150K/mes. Self-hosted: $2K-5K/mes (GPU hosting) → ahorro masivo.
  • Datos internos → privacidad.

Startup de Salud (HIPAA Compliance)

Contexto: Startup de salud con datos de pacientes.

Decisión: Self-hosted (Llama 3).

Por qué:

  • HIPAA compliance → datos no pueden enviarse a APIs externas.
  • Self-hosted → control total, privacidad.

Hybrid Strategy (Mejor de Ambos Mundos)

Muchas empresas usan ambos:

  • Cloud API (GPT-4): Tareas complejas, bajo volumen.
  • Self-hosted (Llama 3): Tareas simples, alto volumen, datos sensibles.

Ejemplo:

  • Chatbot de soporte: Llama 3 (self-hosted) para FAQ simples.
  • Escalamiento a experto: GPT-4 (API) para casos complejos.

Ventaja: Optimizar costo (90% de requests usan Llama 3, solo 10% usan GPT-4).


Licencias de Modelos Open-Source

Llama 3

Licencia: Llama 3 Community License.

Permite:

  • ✅ Uso comercial.
  • ✅ Fine-tuning.
  • ✅ Redistribución (con restricciones).

Restricción: Si tu app tiene >700M usuarios/mes, necesitas licencia especial de Meta.


Mistral

Licencia: Apache 2.0.

Permite:

  • ✅ Uso comercial sin restricciones.
  • ✅ Modificación.
  • ✅ Redistribución.

Por Qué Importa para un AI Engineer

1. Evaluación de costos a escala

Low volume (startup): APIs son mejores.

High volume (empresa): Self-hosted es mejor (ahorro de 10-50×).


2. Compliance

HIPAA, GDPR, datos sensibles: Self-hosted es única opción viable.


Resumen

Propietario (GPT-4, Claude):

  • Más capaz, sin infraestructura, pero costoso a escala y sin privacidad.

Open-source (Llama 3, Mistral):

  • Gratis por request, privacidad, control, pero requiere infraestructura.

Cuándo usar cada uno:

  • API: Bajo volumen, MVP, necesitas state-of-the-art.
  • Self-hosted: Alto volumen, privacidad, control total.

Hybrid strategy: Mejor de ambos (API para complejo, self-hosted para simple).

Próximo paso: Cápsula 04: Pricing y Token Economics — Cómo se cobra, optimización de costos.