Módulo 3: LM Studio - Introducción
Comparación de Performance: Local vs Cloud
Descripción
Análisis objetivo de performance entre LM Studio (local) y OpenAI API (cloud) basado en benchmarks reales.
Tiempo: 15 minutos
Dificultad: Baja
🎯 Objetivos
- ✅ Comparar latency (velocidad)
- ✅ Comparar calidad (accuracy)
- ✅ Comparar costos
- ✅ Decidir cuándo usar cada opción
⚡ Latency (Velocidad)
Benchmark (prompt 200 tokens → output 200 tokens):
| Provider | Hardware | Time to First Token | Total Latency | Consistency |
|---|---|---|---|---|
| OpenAI GPT-3.5 | Cloud | 300ms | 1.5s | Alta (±200ms) |
| LM Studio Mistral 7B | MacBook Pro M2 | 800ms | 4.2s | Media (±800ms) |
| LM Studio Mistral 7B | Dell XPS (i7, 16GB) | 1500ms | 8.5s | Media (±1.5s) |
| LM Studio Mistral 7B | NVIDIA RTX 4090 | 400ms | 2.1s | Alta (±300ms) |
Conclusión:
- OpenAI: 1.5-3s (consistente)
- LM Studio: 2-15s (varía mucho por hardware)
- GPU potente: Comparable a OpenAI
- CPU only: 5-10x más lento
🏆 Calidad (Accuracy)
MMLU Benchmark:
| Modelo | MMLU Score | Español | Código | Chat |
|---|---|---|---|---|
| GPT-3.5-turbo | 70.0% | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ |
| Mistral 7B | 62.5% | ⭐⭐⭐⭐ | ⭐⭐⭐ | ⭐⭐⭐⭐ |
| Llama 2 7B | 54.8% | ⭐⭐⭐ | ⭐⭐⭐ | ⭐⭐⭐ |
Diferencia: GPT-3.5 es 10-15% más preciso que Mistral 7B
Práctico:
- FAQ simple: Ambos suficientes
- Análisis complejo: GPT-3.5 mejor
- Razonamiento: GPT-4 necesario (86%)
💰 Costo (Total Cost of Ownership)
Escenario: 100k queries/mes (500 tokens avg)
OpenAI API (GPT-3.5):
Monthly: 100k × 500 tokens × $0.002/1k = $100/mes
Year 1: $1200
Year 3: $3600
LM Studio Local:
Hardware:
- MacBook Pro M2 (ya lo tienes): $0
- O PC upgrade RAM (16GB → 32GB): $100 one-time
Operativo:
- Electricity: ~$5/mes (negligible)
- Mantenimiento: $0
Year 1: $105 total
Year 3: $180 total ($5/mes × 36)
Ahorro en 3 años: $3420
Break-even: Mes 1 (si ya tienes hardware)
📊 Cuadro Comparativo Completo
| Dimensión | OpenAI API | LM Studio Local | Ganador |
|---|---|---|---|
| Latency | 1.5s | 4-15s | OpenAI |
| Calidad | 70% MMLU | 62% MMLU | OpenAI |
| Costo mes 1 | $100 | $0-100 | LM Studio |
| Costo año 3 | $3600 | $180 | LM Studio |
| Privacidad | Cloud (30d retention) | 100% local | LM Studio |
| Simplicidad | 5 min setup | 30 min setup | OpenAI |
| Escalabilidad | Automática | Manual (tu hardware) | OpenAI |
| Offline | ❌ Requiere internet | ✅ Funciona sin internet | LM Studio |
🎯 Matriz de Decisión
Usa OpenAI API si:
- ✅ Necesitas máxima calidad (GPT-4)
- ✅ Latency crítica (<2s)
- ✅ Simplicidad es prioridad
- ✅ Volumen bajo (<50k queries/mes)
Usa LM Studio si:
- ✅ Privacidad crítica (HIPAA, datos sensibles)
- ✅ Budget $0 (side projects)
- ✅ Volumen alto (>100k queries/mes)
- ✅ Tienes hardware decente (16GB+ RAM, GPU opcional)
Usa estrategia híbrida si:
- ✅ Dev local (LM Studio) → Prod cloud (OpenAI)
- ✅ Queries simples (LM Studio) + complejas (GPT-4)
📈 Performance por Hardware
Mistral 7B (Q4) Benchmarks:
| Hardware | RAM Used | Latency | Cost |
|---|---|---|---|
| MacBook Air M1 (8GB) | 6GB | 12s | $1000 |
| MacBook Pro M2 (16GB) | 5.2GB | 4.2s | $2000 |
| PC i7 + RTX 3060 (16GB) | 6GB | 3.5s | $1200 |
| PC i9 + RTX 4090 (32GB) | 5.5GB | 2.1s | $3000 |
Conclusión:
- 16GB RAM: Suficiente para 7B models
- GPU: Mejora 2-3x velocidad
- Apple Silicon: Muy eficiente (Metal acceleration)
✅ Resumen
Performance:
- OpenAI: Más rápido, más preciso
- LM Studio: 2-5x más lento, 10% menos preciso
Costo:
- OpenAI: $100/mes constante
- LM Studio: $0-5/mes (después de hardware)
Use case:
- MVP rápido: OpenAI
- Producción high-volume: LM Studio
- Privacidad crítica: LM Studio only
Siguiente: 08-proyecto-chatbot-local.md