Módulo 5: Procesamiento de Audio
1. Introducción: Audio en IA
Descripción
Esta es la primera cápsula del Módulo 5 de la Guía de IA Multimodal. Aquí vas a entender cómo la IA procesa audio: transcripción (Speech-to-Text) con Whisper y alternativas, síntesis de voz (Text-to-Speech) con OpenAI y ElevenLabs, y cómo construir pipelines completos que combinan audio, texto y LLMs.
Por qué importa: El audio es la otra gran modalidad de input/output. Reuniones que se transcriben automáticamente. Podcasts que generan resúmenes escritos. Chatbots que responden con voz. Sistemas de accesibilidad que convierten texto a audio. Cada uno de estos casos depende de las mismas dos capacidades: convertir audio en texto (STT) y convertir texto en audio (TTS). Este módulo te da ambas, más los pipelines para integrarlas con LLMs.
Sin este módulo, sabes procesar texto e imágenes pero no puedes hacer nada con la tercera modalidad más usada en producción. Con él, tu toolkit multimodal queda completo: texto, imagen y audio. El Audio Pipeline que construirás al final es un componente directo del Document Analyzer del Módulo 8.
¿Dónde Estamos en la Guía?
Contexto
Esta guía tiene 8 módulos organizados en 3 fases:
Phase 1: Fundamentos Multimodales (Módulos 1-3)
├── Módulo 1: Introducción a IA Multimodal
├── Módulo 2: Vision + LLMs
└── Módulo 3: Comprensión de Documentos
Phase 2: Generación y Audio (Módulos 4-5)
├── Módulo 4: Generación de Imágenes
└── Módulo 5: Procesamiento de Audio ← ESTÁS AQUÍ
Phase 3: RAG, Casos de Uso y Proyecto (Módulos 6-8)
├── Módulo 6: RAG Multimodal
├── Módulo 7: Casos de Uso
└── Módulo 8: Proyecto Final — Document Analyzer Multimodal
Duración total estimada de la guía: 6-7 horas (self-paced).
¿De dónde venimos?
En los módulos anteriores construiste una base sólida:
| Módulo | Qué aprendiste | Cómo conecta con audio |
|---|---|---|
| M1: Intro Multimodal | Landscape de modalidades, proveedores, formatos | Entiendes dónde encaja el audio en el ecosistema |
| M2: Vision + LLMs | GPT-4V, Claude 3, análisis de imágenes | Conoces el patrón: input → modelo → output |
| M3: Documentos | PDFs, OCR, extracción de datos | Procesaste archivos complejos, ahora harás lo mismo con audio |
| M4: Generación de Imágenes | DALL-E, Stable Diffusion, texto → imagen | Dominaste la generación, ahora pasas a texto → audio |
¿Hacia dónde vamos?
Después de este módulo:
- Módulo 6 (RAG Multimodal) — Búsqueda sobre texto, imágenes y transcripciones de audio
- Módulo 7 (Casos de Uso) — Patrones de producción que combinan todo
- Módulo 8 (Document Analyzer) — Proyecto final que integra vision + audio + RAG
Tu Audio Pipeline de este módulo alimenta directamente al Document Analyzer: cuando el sistema reciba un archivo de audio, usará exactamente el pipeline que construyes aquí.
Qué es Procesamiento de Audio en IA
Las dos direcciones del audio
El procesamiento de audio en IA se divide en dos direcciones fundamentales:
Dirección 1: Audio → Texto (Speech-to-Text / STT)
Input: archivo de audio (reunión, podcast, nota de voz)
Output: texto transcrito
Uso: transcripción, subtítulos, búsqueda en audio
Dirección 2: Texto → Audio (Text-to-Speech / TTS)
Input: texto escrito
Output: archivo de audio con voz sintetizada
Uso: asistentes de voz, accesibilidad, narración
Speech-to-Text (STT): Proveedores principales
| Proveedor | Modelo | Idiomas | Precisión | Costo | Característica destacada |
|---|---|---|---|---|---|
| OpenAI | Whisper | 50+ | Alta | $0.006/min | Detección automática de idioma |
| Speech-to-Text | 125+ | Alta | Variable | Integración GCP, streaming | |
| AssemblyAI | Universal | 100+ | Muy alta | $0.0065/min | Diarización, detección de PII |
| Deepgram | Nova-2 | 30+ | Alta | $0.0043/min | Baja latencia, streaming |
Text-to-Speech (TTS): Proveedores principales
| Proveedor | Voces | Calidad | Costo | Característica destacada |
|---|---|---|---|---|
| OpenAI TTS | 6 | Alta | $15/1M chars | Integrado con ecosistema OpenAI |
| ElevenLabs | 100+ | Muy alta | Variable | Clonación de voz, emociones |
| Google TTS | 200+ | Alta | $4/1M chars | Mayor variedad de idiomas |
| Amazon Polly | 60+ | Alta | $4/1M chars | Integración AWS |
El flujo completo: Audio Pipelines
Lo más poderoso no es STT o TTS por separado, sino combinarlos con LLMs:
Pipeline completo:
Audio de reunión
→ Whisper (transcripción)
→ GPT-4o-mini (resumen + action items)
→ OpenAI TTS (resumen hablado)
→ Archivo de audio con el resumen
Cada paso es una API call. El pipeline completo toma ~10 segundos.
Por Qué Importa el Audio en IA
La transición: de texto-only a multimodal con audio
Antes (manual):
1. Escuchar reunión de 1 hora
2. Tomar notas manualmente
3. Escribir resumen
4. Enviar por email
Tiempo: 1.5 horas de trabajo humano
Ahora (con audio AI):
1. Grabar reunión
2. Pipeline: transcribir → resumir → generar audio
3. Recibir resumen en texto y audio
Tiempo: 30 segundos de proceso + 0 minutos de trabajo humano
Casos de uso reales en producción
-
Transcripción de reuniones: Audio → transcripción → resumen con puntos clave → action items. Herramientas como Otter.ai, Fireflies y Grain procesan millones de reuniones diarias. La versión que construirás aquí replica la lógica central.
-
Podcasts y contenido: Transcribir episodios para SEO, generar show notes automáticos, crear clips con subtítulos. Empresas de media usan pipelines similares a los que implementarás.
-
Atención al cliente: Transcribir llamadas de soporte → analizar sentimiento → extraer temas recurrentes → generar reportes. Contact centers procesan miles de horas de audio diariamente.
-
Accesibilidad: Convertir texto a voz para usuarios con discapacidad visual. Generar descripciones de audio para contenido. Subtitular en tiempo real para usuarios con discapacidad auditiva.
-
Educación: Transcribir clases → generar resúmenes → crear flashcards. Estudiantes que prefieren escuchar pueden convertir material escrito a audio.
-
Asistentes de voz: Chatbots que escuchan preguntas en audio, procesan con LLM, y responden con voz sintetizada. El loop completo audio → texto → LLM → audio.
-
Legal y compliance: Transcribir deposiciones, audiencias, llamadas reguladas. Buscar menciones de términos específicos en horas de grabación.
-
Medicina: Transcribir consultas médico-paciente → generar notas clínicas estructuradas. Reducir carga administrativa de profesionales de salud.
Datos del mercado
- Whisper procesa audio en 50+ idiomas con precisión comparable a humanos
- El mercado de STT crece ~20% anual y se proyecta a $30B para 2028
- OpenAI TTS genera voz casi indistinguible de humana a $0.015/1K caracteres
- ElevenLabs permite clonación de voz con solo 30 segundos de muestra
- 73% de empresas que usan IA planean integrar capacidades de audio en 2025-2026
Objetivo del Módulo
Al terminar este módulo serás capaz de:
- ✅ Transcribir audio con Whisper: formatos, idiomas, timestamps, word-level, y manejar archivos >25MB
- ✅ Comparar proveedores de STT (Whisper, Google, AssemblyAI, Deepgram) con criterios de costo, precisión, features
- ✅ Generar voz con OpenAI TTS: voces, modelos, formatos, velocidad, streaming
- ✅ Usar ElevenLabs para TTS premium y comparar con OpenAI
- ✅ Construir pipelines completos: audio → transcripción → LLM → resumen → TTS
- ✅ Diagnosticar y resolver problemas comunes: formatos, tamaños, calidad, costos
- ✅ Implementar un Audio Pipeline funcional como proyecto del módulo
Objetivo profesional
Cuando alguien te diga "necesitamos transcribir las llamadas de soporte y generar resúmenes automáticos", tú sabrás: qué proveedor de STT elegir según volumen y presupuesto, cómo manejar audio largo, qué modelo de LLM usar para el resumen, cómo generar el output en audio si se requiere, y cuánto costará todo. Ese es el nivel de criterio que este módulo te da.
Roadmap del Módulo
Mapa de cápsulas
| # | Cápsula | Qué aprenderás | Tipo |
|---|---|---|---|
| 01 | Introducción (esta) | Audio en IA, landscape STT/TTS, roadmap, setup | Intro |
| 02 | Whisper (OpenAI) | API, formatos, idiomas, timestamps, archivos largos, costos | Técnica |
| 03 | Alternativas a Whisper | Google STT, AssemblyAI, Deepgram, comparación, decisión | Técnica |
| 04 | TTS: OpenAI | Voces, modelos, formatos, velocidad, streaming, costos | Técnica |
| 05 | TTS: ElevenLabs y otros | ElevenLabs, Google TTS, Amazon Polly, comparación | Técnica |
| 06 | Pipelines audio → texto → LLM | 4 pipelines completos, tracking de costos, integración | Técnica |
| 07 | Troubleshooting audio | 8+ problemas, diagnóstico, preprocesamiento, referencia | Técnica |
| 08 | Proyecto: Audio Pipeline | Pipeline completo: transcribir → procesar → generar audio | Proyecto |
Flujo de aprendizaje
Primero dominas la transcripción con Whisper (cápsula 02) y conoces las alternativas (cápsula 03). Luego aprendes síntesis de voz con OpenAI TTS (cápsula 04) y ElevenLabs (cápsula 05). Con ambas direcciones dominadas, construyes pipelines completos que combinan STT + LLM + TTS (cápsula 06). Sabes resolver problemas cuando algo falle (cápsula 07). Y finalmente integras todo en un Audio Pipeline funcional (cápsula 08).
La progresión es: STT → alternativas STT → TTS → alternativas TTS → pipelines → troubleshooting → proyecto.
Duración estimada del módulo: 50-60 minutos.
Conexión con el Proyecto
Proyecto de este módulo: Audio Pipeline
El Audio Pipeline recibe un archivo de audio y ejecuta un pipeline completo:
Input: "reunion_equipo.mp3"
Output: {
"transcript": "Texto completo de la reunión...",
"summary": "1. Se decidió lanzar v2.0 en marzo\n2. ...",
"action_items": ["Preparar demo", "Revisar presupuesto"],
"audio_summary_path": "reunion_resumen.mp3"
}
Conexión con el proyecto final: Document Analyzer Multimodal
El Document Analyzer del módulo 8 necesita procesar archivos de audio. Cuando recibe un .mp3 o .wav, usa exactamente el pipeline de este módulo:
Módulo 5: Audio Pipeline → transcribe + resume + genera audio
↓
Módulo 8: Document Analyzer → detecta tipo de archivo
→ Si es audio: usa Audio Pipeline del M5
→ Si es imagen: usa Vision del M2
→ Si es PDF: usa Document Processing del M3
Prerrequisitos
Conocimientos de módulos anteriores
| Módulo previo | Qué necesitas de él |
|---|---|
| M1: Intro | Entender modalidades, proveedores, concepto de pipeline multimodal |
| M2: Vision | Patrón de uso de APIs: client → request → response |
| M3: Documentos | Manejo de archivos binarios, procesamiento en chunks |
| M4: Imágenes | Experiencia con generación: input → modelo → output |
Conocimientos técnicos
- Python intermedio: Funciones, clases, manejo de archivos binarios, context managers (
with open) - APIs de OpenAI: Has usado
client.chat.completions.create()cómodamente - Manejo de archivos: Sabes leer, escribir y manipular archivos en Python
- Terminal: Puedes instalar paquetes con pip y configurar variables de entorno
Si no tienes estos prerrequisitos
| Te falta | Recurso recomendado |
|---|---|
| Python | Python Essentials Guide (NIEVA) |
| APIs de LLMs | AI Engineering Bootcamp Phase 1 (NIEVA) |
| Módulos 1-4 | Completa los módulos anteriores de esta guía |
Setup Técnico
Python y dependencias
python --version # 3.11+ requerido
pip install openai>=1.0.0 python-dotenv
pip install pydub
pip install elevenlabs
FFmpeg (requerido para pydub)
pydub necesita FFmpeg para convertir formatos de audio. Sin FFmpeg, solo podrás trabajar con WAV.
# macOS
brew install ffmpeg
# Ubuntu/Debian
sudo apt-get install ffmpeg
# Windows (con chocolatey)
choco install ffmpeg
Verifica la instalación:
ffmpeg -version
Variables de entorno
Crea un archivo .env en tu directorio de trabajo:
# .env
OPENAI_API_KEY=sk-...
# Opcionales
ELEVENLABS_API_KEY=...
GOOGLE_APPLICATION_CREDENTIALS=path/to/service-account.json
ASSEMBLYAI_API_KEY=...
Carga las variables en tu código:
from dotenv import load_dotenv
import os
load_dotenv()
openai_key = os.getenv("OPENAI_API_KEY")
assert openai_key, "Falta OPENAI_API_KEY en .env"
Verificación rápida
Ejecuta este script para verificar que tu setup funciona:
from openai import OpenAI
from dotenv import load_dotenv
load_dotenv()
client = OpenAI()
response = client.chat.completions.create(
model="gpt-4o-mini",
messages=[{"role": "user", "content": "Responde solo 'OK' si me recibes."}],
max_tokens=10
)
print(f"OpenAI API: {response.choices[0].message.content}")
Verifica también pydub:
from pydub import AudioSegment
audio = AudioSegment.silent(duration=1000)
audio.export("/tmp/test_audio.mp3", format="mp3")
print(f"pydub + ffmpeg: OK (archivo de prueba creado)")
Si ambos imprimen OK, tu setup está listo.
Costos estimados del módulo
| API | Operación | Costo | Estimado para el módulo |
|---|---|---|---|
| Whisper | Transcripción | $0.006/min | ~$0.10-0.30 |
| GPT-4o-mini | Procesamiento de texto | $0.15/1M input tokens | ~$0.05-0.15 |
| OpenAI TTS (tts-1) | Síntesis de voz | $15/1M caracteres | ~$0.05-0.15 |
| OpenAI TTS (tts-1-hd) | Síntesis HD | $30/1M caracteres | ~$0.10-0.30 |
| ElevenLabs | Síntesis premium | Variable (tier gratuito disponible) | ~$0.00 (free tier) |
Total estimado para este módulo: $0.30-0.90 USD.
Consejo: ElevenLabs tiene un tier gratuito con ~10,000 caracteres/mes. Suficiente para todos los ejercicios de este módulo.
Estructura de archivos recomendada
module_05/
├── transcribe.py # Funciones de transcripción
├── tts.py # Funciones de síntesis de voz
├── pipeline.py # Pipeline completo (proyecto)
├── troubleshoot.py # Funciones de diagnóstico
├── audio_samples/
│ ├── test_short.mp3 # Audio corto de prueba (<1 min)
│ ├── test_long.mp3 # Audio largo de prueba (>10 min)
│ └── test_multilang.mp3 # Audio con múltiples idiomas
└── outputs/
├── transcripts/ # Transcripciones generadas
└── tts/ # Audio sintetizado
Límites: Qué NO Cubre Este Módulo
- ❌ Generación de música — Modelos como MusicGen, Suno, Udio. Este módulo se enfoca en voz hablada (speech), no en música.
- ❌ Streaming en tiempo real — No implementamos transcripción en tiempo real (real-time STT). Trabajamos con archivos de audio pregrabados.
- ❌ Clonación de voz avanzada — Mencionamos que ElevenLabs soporta voice cloning, pero no profundizamos en el proceso de clonación.
- ❌ Modelos open-source locales — No deployamos Whisper localmente ni otros modelos STT/TTS locales. Usamos APIs cloud.
- ❌ Procesamiento de señales (DSP) — No cubrimos análisis de espectrogramas, filtrado de ruido avanzado, ni procesamiento digital de señales.
- ❌ Reconocimiento de emociones en voz — No analizamos tono, emoción o sentimiento directamente del audio.
- ❌ Multilenguaje simultáneo — No cubrimos transcripción de audio con code-switching (cambio de idioma dentro del mismo audio).
Evidencia de Éxito
Al terminar este módulo, sabrás que tuviste éxito si:
- ✅ Puedes transcribir un archivo de audio con Whisper y elegir el formato de respuesta correcto (text, json, srt, verbose_json)
- ✅ Sabes manejar archivos de audio mayores a 25MB dividiéndolos en chunks
- ✅ Puedes comparar Whisper, Google STT, AssemblyAI y Deepgram con criterios de costo, precisión y features
- ✅ Generas voz con OpenAI TTS eligiendo la voz y modelo adecuados
- ✅ Conoces ElevenLabs y cuándo elegirlo sobre OpenAI TTS
- ✅ Tu Audio Pipeline funciona: recibe audio → transcribe → resume con LLM → genera audio del resumen
- ✅ Puedes diagnosticar y resolver problemas comunes (formato, tamaño, calidad, costos)
Test rápido de autoevaluación
Si puedes responder estas preguntas, vas por buen camino:
- ¿Qué formato de respuesta de Whisper usarías para generar subtítulos?
- ¿Cómo manejarías un archivo de audio de 50MB que excede el límite de Whisper?
- ¿Cuál es la diferencia entre
tts-1ytts-1-hden OpenAI? - ¿Cuándo elegirías ElevenLabs sobre OpenAI TTS?
- ¿Qué pipeline usarías para convertir una reunión grabada en un resumen de audio?
- ¿Cuánto costaría transcribir 1 hora de audio con Whisper?
Resumen
- Procesamiento de audio en IA tiene dos direcciones: STT (audio → texto) y TTS (texto → audio).
- Los proveedores principales de STT son: Whisper (OpenAI), Google Speech-to-Text, AssemblyAI, Deepgram.
- Los proveedores principales de TTS son: OpenAI TTS, ElevenLabs, Google Cloud TTS, Amazon Polly.
- Los pipelines combinan STT + LLM + TTS para crear flujos completos: transcribir → procesar → generar audio.
- Los casos de uso reales incluyen: transcripción de reuniones, procesamiento de podcasts, atención al cliente, accesibilidad, educación.
- El proyecto del módulo es un Audio Pipeline que transcribe, resume y genera audio.
- Este módulo es prerrequisito para el Document Analyzer del Módulo 8.
Recursos Adicionales
- Whisper API — OpenAI — Documentación oficial de transcripción
- OpenAI TTS Guide — Documentación oficial de síntesis de voz
- ElevenLabs — TTS premium con clonación de voz
- AssemblyAI Docs — API de transcripción con diarización
- Deepgram — STT de baja latencia
- Google Speech-to-Text — STT de Google Cloud
- pydub Documentation — Manipulación de audio en Python
- FFmpeg — Herramienta de conversión de audio/video