Módulo 6: El Ecosistema de AI APIs
3. Open-Source vs Propietario: Trade-Offs y Cuándo Usar Cada Uno
Descripción
Una de las decisiones más importantes como AI Engineer: ¿Usar modelos propietarios (GPT-4, Claude via API) o open-source (Llama 3, Mistral self-hosted)?
Qué aprenderás:
- Diferencias entre propietario y open-source.
- Trade-offs (control vs conveniencia, costo vs capacidad).
- Cuándo usar cada uno.
Propietario (GPT-4, Claude, Gemini)
Características:
- Acceso vía API: Pagas por uso (por token).
- Pesos NO públicos: No puedes descargar modelo.
- Controlado por provider: OpenAI, Anthropic, Google.
Ventajas:
- ✅ State-of-the-art: Modelos más capaces (GPT-4 > Llama 3 en reasoning).
- ✅ Sin infraestructura: No necesitas GPUs.
- ✅ Actualizaciones: Modelo mejora sin que hagas nada.
- ✅ Escala automática: 1 request o 1M requests → API maneja scaling.
Desventajas:
- ❌ Costo por uso: Alto volumen → costoso.
- ❌ Dependencia: Si API cae, tu app cae.
- ❌ Privacidad: Envías datos a servidores externos.
- ❌ Sin control: No puedes modificar modelo, fine-tuning limitado.
Open-Source (Llama 3, Mistral)
Características:
- Pesos públicos: Puedes descargar modelo.
- Self-hosted: Corres en tus servidores/GPUs.
- Licencia permisiva: Uso comercial permitido.
Ventajas:
- ✅ Gratis por request: Solo pagas hosting (costo fijo).
- ✅ Privacidad: Datos no salen de tu infraestructura.
- ✅ Control total: Puedes fine-tunar sin restricciones.
- ✅ Sin dependencia: Si quieres cambiar provider, solo cambias modelo (no API).
Desventajas:
- ❌ Requiere infraestructura: GPUs caras (A100: $1-3/hora, H100: $3-5/hora).
- ❌ Mantenimiento: Tú manejas updates, scaling, monitoring.
- ❌ Menos capaz: Llama 3 (70B) < GPT-4 en reasoning (pero 400B es competitivo).
Comparación: Cloud API vs Self-Hosted
| Aspecto | Cloud API (GPT-4) | Self-Hosted (Llama 3) |
|---|---|---|
| Costo (bajo volumen) | Bajo ($10-100/mes) | Alto ($500-2,000/mes GPU) |
| Costo (alto volumen) | Alto ($5K-50K/mes) | Medio ($500-2,000/mes GPU fijo) |
| Setup | 5 minutos | 1-3 días |
| Mantenimiento | Ninguno | Alto (updates, monitoring) |
| Privacidad | Baja (datos a provider) | Alta (datos en tu infra) |
| Capacidad | Muy alta (GPT-4) | Alta (Llama 400B) |
| Latencia | Media (API call) | Baja (local) o alta (si GPU saturada) |
Cuándo Usar Cada Uno
Usa Cloud API (OpenAI, Anthropic) si:
- Bajo volumen: <100K requests/mes → APIs son más baratas.
- Prototipo/MVP: Necesitas lanzar rápido.
- Sin equipo de infra: No tienes DevOps para mantener GPUs.
- Necesitas state-of-the-art: GPT-4 es mejor que Llama 3 (70B).
Usa Open-Source (Llama 3, Mistral self-hosted) si:
- Alto volumen: >1M requests/mes → self-hosted es más barato.
- Privacidad crítica: Datos sensibles (HIPAA, GDPR) no pueden salir de tu infra.
- Control total: Quieres fine-tunar sin restricciones.
- Costo predecible: Prefieres costo fijo (GPU hosting) vs variable (API por token).
Casos de Uso Reales
Startup (MVP)
Contexto: Startup con $1K/mes de presupuesto, chatbot de soporte.
Decisión: Cloud API (GPT-3.5 o Claude Haiku).
Por qué:
- Bajo volumen al inicio → APIs más baratas que hosting GPU.
- Setup rápido → lanza en días, no semanas.
Empresa (Producción, Alto Volumen)
Contexto: Empresa con 10M requests/mes, chatbot interno.
Decisión: Self-hosted (Llama 3 70B).
Por qué:
- Alto volumen → APIs cuestan $50K-150K/mes. Self-hosted: $2K-5K/mes (GPU hosting) → ahorro masivo.
- Datos internos → privacidad.
Startup de Salud (HIPAA Compliance)
Contexto: Startup de salud con datos de pacientes.
Decisión: Self-hosted (Llama 3).
Por qué:
- HIPAA compliance → datos no pueden enviarse a APIs externas.
- Self-hosted → control total, privacidad.
Hybrid Strategy (Mejor de Ambos Mundos)
Muchas empresas usan ambos:
- Cloud API (GPT-4): Tareas complejas, bajo volumen.
- Self-hosted (Llama 3): Tareas simples, alto volumen, datos sensibles.
Ejemplo:
- Chatbot de soporte: Llama 3 (self-hosted) para FAQ simples.
- Escalamiento a experto: GPT-4 (API) para casos complejos.
Ventaja: Optimizar costo (90% de requests usan Llama 3, solo 10% usan GPT-4).
Licencias de Modelos Open-Source
Llama 3
Licencia: Llama 3 Community License.
Permite:
- ✅ Uso comercial.
- ✅ Fine-tuning.
- ✅ Redistribución (con restricciones).
Restricción: Si tu app tiene >700M usuarios/mes, necesitas licencia especial de Meta.
Mistral
Licencia: Apache 2.0.
Permite:
- ✅ Uso comercial sin restricciones.
- ✅ Modificación.
- ✅ Redistribución.
Por Qué Importa para un AI Engineer
1. Evaluación de costos a escala
Low volume (startup): APIs son mejores.
High volume (empresa): Self-hosted es mejor (ahorro de 10-50×).
2. Compliance
HIPAA, GDPR, datos sensibles: Self-hosted es única opción viable.
Resumen
Propietario (GPT-4, Claude):
- Más capaz, sin infraestructura, pero costoso a escala y sin privacidad.
Open-source (Llama 3, Mistral):
- Gratis por request, privacidad, control, pero requiere infraestructura.
Cuándo usar cada uno:
- API: Bajo volumen, MVP, necesitas state-of-the-art.
- Self-hosted: Alto volumen, privacidad, control total.
Hybrid strategy: Mejor de ambos (API para complejo, self-hosted para simple).
Próximo paso: Cápsula 04: Pricing y Token Economics — Cómo se cobra, optimización de costos.