Guía de Frameworks de Evaluación
``` EN: Master the evaluation of AI systems — from metrics for chat, RAG, and agents to LLM-as-judge, RAGAS, TruLens, and production evaluation pipelines. Learn to build golden datasets, implement domain-specific evaluation for chatbots, RAG pipelines, and AI agents, automate evaluation with calibrated LLM judges, and deploy continuous monitoring with CI/CD integration and regression detection. ES: Domina la evaluación de sistemas de AI — desde métricas para chat, RAG y agents hasta LLM-as-judge, RAGAS, TruLens y pipelines de evaluación en producción. Esta guía te enseña a construir golden datasets, implementar evaluación específica por dominio para chatbots, pipelines RAG y agentes de AI, automatizar la evaluación con LLM judges calibrados, y deployar monitoring continuo con integración CI/CD y detección de regresiones. Para AI Engineers que ya construyen sistemas y necesitan saber si realmente funcionan bien. ```
64
Lecciones
8
Módulos
🎓
Acceso por bootcamp
Lo que aprenderás
¿Para quién es?
- •AI Engineers que construyen sistemas de chat, RAG o agents y necesitan medir su calidad de forma rigurosa
- •Developers que deployean sistemas de AI a producción sin saber si realmente funcionan bien
- •Ingenieros que necesitan implementar evaluación en el pipeline CI/CD de su empresa
- •Equipos en transición de "evaluación por vibes" a métricas de calidad automatizadas y data-driven
- •Profesionales que quieren entender LLM-as-judge, RAGAS y TruLens para uso en producción
Requisitos
- •Completar la Guía de Advanced RAG Techniques (#8) o experiencia construyendo pipelines RAG
- •Completar la Guía de LangChain & LangGraph (#9) o experiencia equivalente con el framework
- •Completar la Guía de Building AI Agents (#11) o experiencia construyendo agentes con tool use
- •Python intermedio (funciones, clases, async, Pydantic básico)
- •Experiencia con al menos un sistema de AI en desarrollo o producción
- •Al menos una API key de proveedor LLM (OpenAI recomendado)
- •Python 3.11+ instalado
Contenido del curso
1Módulo 1: ¿Por Qué Evaluar Sistemas de AI? — Guía para el Creador8 lecciones
2Módulo 2: Taxonomía de Métricas — Guía para el Creador8 lecciones
3Módulo 3: Golden Datasets y Test Suites — Guía para el Creador8 lecciones
4Módulo 4: Evaluación de Chat y Conversaciones — Guía para el Creador8 lecciones
5Módulo 5: Evaluación de RAG con RAGAS — Guía para el Creador8 lecciones
6Módulo 6: Evaluación de Agents — Guía para el Creador8 lecciones
7Módulo 7: LLM-as-Judge y Evaluación Automatizada — Guía para el Creador8 lecciones
8Módulo 8: Pipelines de Evaluación en Producción — Guía para el Creador8 lecciones
Lo que dicen los estudiantes
Estas reseñas son de estudiantes inscritos que completaron al menos el 50% del curso. Moderamos las reseñas solo por motivos de contenido (spam, lenguaje ofensivo, datos personales), nunca por ser críticas o negativas.
Aún no hay reseñas aprobadas.
¡Sé el primero en compartir tu experiencia!