Módulo 5: Procesamiento de Audio

1. Introducción: Audio en IA

Descripción

Esta es la primera cápsula del Módulo 5 de la Guía de IA Multimodal. Aquí vas a entender cómo la IA procesa audio: transcripción (Speech-to-Text) con Whisper y alternativas, síntesis de voz (Text-to-Speech) con OpenAI y ElevenLabs, y cómo construir pipelines completos que combinan audio, texto y LLMs.

Por qué importa: El audio es la otra gran modalidad de input/output. Reuniones que se transcriben automáticamente. Podcasts que generan resúmenes escritos. Chatbots que responden con voz. Sistemas de accesibilidad que convierten texto a audio. Cada uno de estos casos depende de las mismas dos capacidades: convertir audio en texto (STT) y convertir texto en audio (TTS). Este módulo te da ambas, más los pipelines para integrarlas con LLMs.

Sin este módulo, sabes procesar texto e imágenes pero no puedes hacer nada con la tercera modalidad más usada en producción. Con él, tu toolkit multimodal queda completo: texto, imagen y audio. El Audio Pipeline que construirás al final es un componente directo del Document Analyzer del Módulo 8.


¿Dónde Estamos en la Guía?

Contexto

Esta guía tiene 8 módulos organizados en 3 fases:

Phase 1: Fundamentos Multimodales (Módulos 1-3)
├── Módulo 1: Introducción a IA Multimodal
├── Módulo 2: Vision + LLMs
└── Módulo 3: Comprensión de Documentos

Phase 2: Generación y Audio (Módulos 4-5)
├── Módulo 4: Generación de Imágenes
└── Módulo 5: Procesamiento de Audio    ← ESTÁS AQUÍ

Phase 3: RAG, Casos de Uso y Proyecto (Módulos 6-8)
├── Módulo 6: RAG Multimodal
├── Módulo 7: Casos de Uso
└── Módulo 8: Proyecto Final — Document Analyzer Multimodal

Duración total estimada de la guía: 6-7 horas (self-paced).

¿De dónde venimos?

En los módulos anteriores construiste una base sólida:

MóduloQué aprendisteCómo conecta con audio
M1: Intro MultimodalLandscape de modalidades, proveedores, formatosEntiendes dónde encaja el audio en el ecosistema
M2: Vision + LLMsGPT-4V, Claude 3, análisis de imágenesConoces el patrón: input → modelo → output
M3: DocumentosPDFs, OCR, extracción de datosProcesaste archivos complejos, ahora harás lo mismo con audio
M4: Generación de ImágenesDALL-E, Stable Diffusion, texto → imagenDominaste la generación, ahora pasas a texto → audio

¿Hacia dónde vamos?

Después de este módulo:

  1. Módulo 6 (RAG Multimodal) — Búsqueda sobre texto, imágenes y transcripciones de audio
  2. Módulo 7 (Casos de Uso) — Patrones de producción que combinan todo
  3. Módulo 8 (Document Analyzer) — Proyecto final que integra vision + audio + RAG

Tu Audio Pipeline de este módulo alimenta directamente al Document Analyzer: cuando el sistema reciba un archivo de audio, usará exactamente el pipeline que construyes aquí.


Qué es Procesamiento de Audio en IA

Las dos direcciones del audio

El procesamiento de audio en IA se divide en dos direcciones fundamentales:

Dirección 1: Audio → Texto (Speech-to-Text / STT)
  Input:  archivo de audio (reunión, podcast, nota de voz)
  Output: texto transcrito
  Uso:    transcripción, subtítulos, búsqueda en audio

Dirección 2: Texto → Audio (Text-to-Speech / TTS)
  Input:  texto escrito
  Output: archivo de audio con voz sintetizada
  Uso:    asistentes de voz, accesibilidad, narración

Speech-to-Text (STT): Proveedores principales

ProveedorModeloIdiomasPrecisiónCostoCaracterística destacada
OpenAIWhisper50+Alta$0.006/minDetección automática de idioma
GoogleSpeech-to-Text125+AltaVariableIntegración GCP, streaming
AssemblyAIUniversal100+Muy alta$0.0065/minDiarización, detección de PII
DeepgramNova-230+Alta$0.0043/minBaja latencia, streaming

Text-to-Speech (TTS): Proveedores principales

ProveedorVocesCalidadCostoCaracterística destacada
OpenAI TTS6Alta$15/1M charsIntegrado con ecosistema OpenAI
ElevenLabs100+Muy altaVariableClonación de voz, emociones
Google TTS200+Alta$4/1M charsMayor variedad de idiomas
Amazon Polly60+Alta$4/1M charsIntegración AWS

El flujo completo: Audio Pipelines

Lo más poderoso no es STT o TTS por separado, sino combinarlos con LLMs:

Pipeline completo:
  Audio de reunión
    → Whisper (transcripción)
    → GPT-4o-mini (resumen + action items)
    → OpenAI TTS (resumen hablado)
    → Archivo de audio con el resumen

Cada paso es una API call. El pipeline completo toma ~10 segundos.

Por Qué Importa el Audio en IA

La transición: de texto-only a multimodal con audio

Antes (manual):
  1. Escuchar reunión de 1 hora
  2. Tomar notas manualmente
  3. Escribir resumen
  4. Enviar por email
  Tiempo: 1.5 horas de trabajo humano

Ahora (con audio AI):
  1. Grabar reunión
  2. Pipeline: transcribir → resumir → generar audio
  3. Recibir resumen en texto y audio
  Tiempo: 30 segundos de proceso + 0 minutos de trabajo humano

Casos de uso reales en producción

  1. Transcripción de reuniones: Audio → transcripción → resumen con puntos clave → action items. Herramientas como Otter.ai, Fireflies y Grain procesan millones de reuniones diarias. La versión que construirás aquí replica la lógica central.

  2. Podcasts y contenido: Transcribir episodios para SEO, generar show notes automáticos, crear clips con subtítulos. Empresas de media usan pipelines similares a los que implementarás.

  3. Atención al cliente: Transcribir llamadas de soporte → analizar sentimiento → extraer temas recurrentes → generar reportes. Contact centers procesan miles de horas de audio diariamente.

  4. Accesibilidad: Convertir texto a voz para usuarios con discapacidad visual. Generar descripciones de audio para contenido. Subtitular en tiempo real para usuarios con discapacidad auditiva.

  5. Educación: Transcribir clases → generar resúmenes → crear flashcards. Estudiantes que prefieren escuchar pueden convertir material escrito a audio.

  6. Asistentes de voz: Chatbots que escuchan preguntas en audio, procesan con LLM, y responden con voz sintetizada. El loop completo audio → texto → LLM → audio.

  7. Legal y compliance: Transcribir deposiciones, audiencias, llamadas reguladas. Buscar menciones de términos específicos en horas de grabación.

  8. Medicina: Transcribir consultas médico-paciente → generar notas clínicas estructuradas. Reducir carga administrativa de profesionales de salud.

Datos del mercado

  • Whisper procesa audio en 50+ idiomas con precisión comparable a humanos
  • El mercado de STT crece ~20% anual y se proyecta a $30B para 2028
  • OpenAI TTS genera voz casi indistinguible de humana a $0.015/1K caracteres
  • ElevenLabs permite clonación de voz con solo 30 segundos de muestra
  • 73% de empresas que usan IA planean integrar capacidades de audio en 2025-2026

Objetivo del Módulo

Al terminar este módulo serás capaz de:

  • ✅ Transcribir audio con Whisper: formatos, idiomas, timestamps, word-level, y manejar archivos >25MB
  • ✅ Comparar proveedores de STT (Whisper, Google, AssemblyAI, Deepgram) con criterios de costo, precisión, features
  • ✅ Generar voz con OpenAI TTS: voces, modelos, formatos, velocidad, streaming
  • ✅ Usar ElevenLabs para TTS premium y comparar con OpenAI
  • ✅ Construir pipelines completos: audio → transcripción → LLM → resumen → TTS
  • ✅ Diagnosticar y resolver problemas comunes: formatos, tamaños, calidad, costos
  • ✅ Implementar un Audio Pipeline funcional como proyecto del módulo

Objetivo profesional

Cuando alguien te diga "necesitamos transcribir las llamadas de soporte y generar resúmenes automáticos", tú sabrás: qué proveedor de STT elegir según volumen y presupuesto, cómo manejar audio largo, qué modelo de LLM usar para el resumen, cómo generar el output en audio si se requiere, y cuánto costará todo. Ese es el nivel de criterio que este módulo te da.


Roadmap del Módulo

Mapa de cápsulas

#CápsulaQué aprenderásTipo
01Introducción (esta)Audio en IA, landscape STT/TTS, roadmap, setupIntro
02Whisper (OpenAI)API, formatos, idiomas, timestamps, archivos largos, costosTécnica
03Alternativas a WhisperGoogle STT, AssemblyAI, Deepgram, comparación, decisiónTécnica
04TTS: OpenAIVoces, modelos, formatos, velocidad, streaming, costosTécnica
05TTS: ElevenLabs y otrosElevenLabs, Google TTS, Amazon Polly, comparaciónTécnica
06Pipelines audio → texto → LLM4 pipelines completos, tracking de costos, integraciónTécnica
07Troubleshooting audio8+ problemas, diagnóstico, preprocesamiento, referenciaTécnica
08Proyecto: Audio PipelinePipeline completo: transcribir → procesar → generar audioProyecto

Flujo de aprendizaje

Primero dominas la transcripción con Whisper (cápsula 02) y conoces las alternativas (cápsula 03). Luego aprendes síntesis de voz con OpenAI TTS (cápsula 04) y ElevenLabs (cápsula 05). Con ambas direcciones dominadas, construyes pipelines completos que combinan STT + LLM + TTS (cápsula 06). Sabes resolver problemas cuando algo falle (cápsula 07). Y finalmente integras todo en un Audio Pipeline funcional (cápsula 08).

La progresión es: STT → alternativas STT → TTS → alternativas TTS → pipelines → troubleshooting → proyecto.

Duración estimada del módulo: 50-60 minutos.


Conexión con el Proyecto

Proyecto de este módulo: Audio Pipeline

El Audio Pipeline recibe un archivo de audio y ejecuta un pipeline completo:

Input: "reunion_equipo.mp3"
Output: {
  "transcript": "Texto completo de la reunión...",
  "summary": "1. Se decidió lanzar v2.0 en marzo\n2. ...",
  "action_items": ["Preparar demo", "Revisar presupuesto"],
  "audio_summary_path": "reunion_resumen.mp3"
}

Conexión con el proyecto final: Document Analyzer Multimodal

El Document Analyzer del módulo 8 necesita procesar archivos de audio. Cuando recibe un .mp3 o .wav, usa exactamente el pipeline de este módulo:

Módulo 5: Audio Pipeline → transcribe + resume + genera audio
    ↓
Módulo 8: Document Analyzer → detecta tipo de archivo
    → Si es audio: usa Audio Pipeline del M5
    → Si es imagen: usa Vision del M2
    → Si es PDF: usa Document Processing del M3

Prerrequisitos

Conocimientos de módulos anteriores

Módulo previoQué necesitas de él
M1: IntroEntender modalidades, proveedores, concepto de pipeline multimodal
M2: VisionPatrón de uso de APIs: client → request → response
M3: DocumentosManejo de archivos binarios, procesamiento en chunks
M4: ImágenesExperiencia con generación: input → modelo → output

Conocimientos técnicos

  • Python intermedio: Funciones, clases, manejo de archivos binarios, context managers (with open)
  • APIs de OpenAI: Has usado client.chat.completions.create() cómodamente
  • Manejo de archivos: Sabes leer, escribir y manipular archivos en Python
  • Terminal: Puedes instalar paquetes con pip y configurar variables de entorno

Si no tienes estos prerrequisitos

Te faltaRecurso recomendado
PythonPython Essentials Guide (NIEVA)
APIs de LLMsAI Engineering Bootcamp Phase 1 (NIEVA)
Módulos 1-4Completa los módulos anteriores de esta guía

Setup Técnico

Python y dependencias

python --version  # 3.11+ requerido

pip install openai>=1.0.0 python-dotenv

pip install pydub

pip install elevenlabs

FFmpeg (requerido para pydub)

pydub necesita FFmpeg para convertir formatos de audio. Sin FFmpeg, solo podrás trabajar con WAV.

# macOS
brew install ffmpeg

# Ubuntu/Debian
sudo apt-get install ffmpeg

# Windows (con chocolatey)
choco install ffmpeg

Verifica la instalación:

ffmpeg -version

Variables de entorno

Crea un archivo .env en tu directorio de trabajo:

# .env
OPENAI_API_KEY=sk-...

# Opcionales
ELEVENLABS_API_KEY=...
GOOGLE_APPLICATION_CREDENTIALS=path/to/service-account.json
ASSEMBLYAI_API_KEY=...

Carga las variables en tu código:

from dotenv import load_dotenv
import os

load_dotenv()

openai_key = os.getenv("OPENAI_API_KEY")
assert openai_key, "Falta OPENAI_API_KEY en .env"

Verificación rápida

Ejecuta este script para verificar que tu setup funciona:

from openai import OpenAI
from dotenv import load_dotenv

load_dotenv()
client = OpenAI()

response = client.chat.completions.create(
    model="gpt-4o-mini",
    messages=[{"role": "user", "content": "Responde solo 'OK' si me recibes."}],
    max_tokens=10
)
print(f"OpenAI API: {response.choices[0].message.content}")

Verifica también pydub:

from pydub import AudioSegment

audio = AudioSegment.silent(duration=1000)
audio.export("/tmp/test_audio.mp3", format="mp3")
print(f"pydub + ffmpeg: OK (archivo de prueba creado)")

Si ambos imprimen OK, tu setup está listo.

Costos estimados del módulo

APIOperaciónCostoEstimado para el módulo
WhisperTranscripción$0.006/min~$0.10-0.30
GPT-4o-miniProcesamiento de texto$0.15/1M input tokens~$0.05-0.15
OpenAI TTS (tts-1)Síntesis de voz$15/1M caracteres~$0.05-0.15
OpenAI TTS (tts-1-hd)Síntesis HD$30/1M caracteres~$0.10-0.30
ElevenLabsSíntesis premiumVariable (tier gratuito disponible)~$0.00 (free tier)

Total estimado para este módulo: $0.30-0.90 USD.

Consejo: ElevenLabs tiene un tier gratuito con ~10,000 caracteres/mes. Suficiente para todos los ejercicios de este módulo.

Estructura de archivos recomendada

module_05/
├── transcribe.py          # Funciones de transcripción
├── tts.py                 # Funciones de síntesis de voz
├── pipeline.py            # Pipeline completo (proyecto)
├── troubleshoot.py        # Funciones de diagnóstico
├── audio_samples/
│   ├── test_short.mp3     # Audio corto de prueba (<1 min)
│   ├── test_long.mp3      # Audio largo de prueba (>10 min)
│   └── test_multilang.mp3 # Audio con múltiples idiomas
└── outputs/
    ├── transcripts/       # Transcripciones generadas
    └── tts/               # Audio sintetizado

Límites: Qué NO Cubre Este Módulo

  • Generación de música — Modelos como MusicGen, Suno, Udio. Este módulo se enfoca en voz hablada (speech), no en música.
  • Streaming en tiempo real — No implementamos transcripción en tiempo real (real-time STT). Trabajamos con archivos de audio pregrabados.
  • Clonación de voz avanzada — Mencionamos que ElevenLabs soporta voice cloning, pero no profundizamos en el proceso de clonación.
  • Modelos open-source locales — No deployamos Whisper localmente ni otros modelos STT/TTS locales. Usamos APIs cloud.
  • Procesamiento de señales (DSP) — No cubrimos análisis de espectrogramas, filtrado de ruido avanzado, ni procesamiento digital de señales.
  • Reconocimiento de emociones en voz — No analizamos tono, emoción o sentimiento directamente del audio.
  • Multilenguaje simultáneo — No cubrimos transcripción de audio con code-switching (cambio de idioma dentro del mismo audio).

Evidencia de Éxito

Al terminar este módulo, sabrás que tuviste éxito si:

  • ✅ Puedes transcribir un archivo de audio con Whisper y elegir el formato de respuesta correcto (text, json, srt, verbose_json)
  • ✅ Sabes manejar archivos de audio mayores a 25MB dividiéndolos en chunks
  • ✅ Puedes comparar Whisper, Google STT, AssemblyAI y Deepgram con criterios de costo, precisión y features
  • ✅ Generas voz con OpenAI TTS eligiendo la voz y modelo adecuados
  • ✅ Conoces ElevenLabs y cuándo elegirlo sobre OpenAI TTS
  • ✅ Tu Audio Pipeline funciona: recibe audio → transcribe → resume con LLM → genera audio del resumen
  • ✅ Puedes diagnosticar y resolver problemas comunes (formato, tamaño, calidad, costos)

Test rápido de autoevaluación

Si puedes responder estas preguntas, vas por buen camino:

  1. ¿Qué formato de respuesta de Whisper usarías para generar subtítulos?
  2. ¿Cómo manejarías un archivo de audio de 50MB que excede el límite de Whisper?
  3. ¿Cuál es la diferencia entre tts-1 y tts-1-hd en OpenAI?
  4. ¿Cuándo elegirías ElevenLabs sobre OpenAI TTS?
  5. ¿Qué pipeline usarías para convertir una reunión grabada en un resumen de audio?
  6. ¿Cuánto costaría transcribir 1 hora de audio con Whisper?

Resumen

  • Procesamiento de audio en IA tiene dos direcciones: STT (audio → texto) y TTS (texto → audio).
  • Los proveedores principales de STT son: Whisper (OpenAI), Google Speech-to-Text, AssemblyAI, Deepgram.
  • Los proveedores principales de TTS son: OpenAI TTS, ElevenLabs, Google Cloud TTS, Amazon Polly.
  • Los pipelines combinan STT + LLM + TTS para crear flujos completos: transcribir → procesar → generar audio.
  • Los casos de uso reales incluyen: transcripción de reuniones, procesamiento de podcasts, atención al cliente, accesibilidad, educación.
  • El proyecto del módulo es un Audio Pipeline que transcribe, resume y genera audio.
  • Este módulo es prerrequisito para el Document Analyzer del Módulo 8.

Recursos Adicionales

  1. Whisper API — OpenAI — Documentación oficial de transcripción
  2. OpenAI TTS Guide — Documentación oficial de síntesis de voz
  3. ElevenLabs — TTS premium con clonación de voz
  4. AssemblyAI Docs — API de transcripción con diarización
  5. Deepgram — STT de baja latencia
  6. Google Speech-to-Text — STT de Google Cloud
  7. pydub Documentation — Manipulación de audio en Python
  8. FFmpeg — Herramienta de conversión de audio/video