Propuesta de Charla
- Título de la charla: ¿Cómo sabes que tu RAG funciona? Métricas de evaluación desde cero
- Resumen/Descripción: Construir un RAG es la parte fácil; saber si responde bien es el
problema real. En esta charla implementamos desde cero, en Python puro, las métricas que
usan frameworks como RAGAS y DeepEval: faithfulness, contextual precision y
contextual recall. Primero el pseudocódigo y la intuición matemática, luego el mismo cálculo usando
las librerías, para que quede claro qué hace cada una por debajo. Cerramos con las
trampas prácticas: por qué un juez LLM da scores inconsistentes, cómo se calibran, y
cuánto cuesta evaluar a volumen real.
- Ponente(s):
- Nombre: Juan Manuel Carballo
- Bio: Ingeniero en Computación con maestría en IA Aplicada. Trabaja en Cognitactix
construyendo sistemas agénticos en producción para sectores de minería, transporte e
infraestructura, con foco en MLSecOps, gobernanza de IA y evaluación de pipelines RAG.
Imparte webinars y programas de formación sobre IA agéntica.
- Foto: [Enlace o por definir]
- Redes (opcional): Github (https://github.com/jmanuelc87) Linkedin (https://www.linkedin.com/in/jmanuelc87/)
- Temas (tags): Python, AI, LLM, RAG, Evaluación, MLOps
- Nivel de dificultad: Intermedio
(basta con saber qué es un embedding y haber tocado alguna API de LLM)
- Tech stack sugerido: Python 3.11+, RAGAS, DeepEval, OpenRouter (modelos juez),
Jupyter para la demo
- Duración estimada: 40 minutos
- Motivación: Revisando el catálogo del canal y los issues de este repo, la comunidad
ya cubrió embeddings, grounding de LLMs, RAG con BigQuery/Gemini y agentes — pero no hay
ninguna charla sobre medir si eso funciona. Es el hueco natural del arco y es justo
donde más gente se atora al pasar de un demo a producción. Además conecta con las
charlas de pytest y de agentes que ya se dieron: es testing, pero para sistemas
no deterministas.
- ¿Tienes preferencia de mes o fecha? Flexible, Agosto o Septiembre funciona bien
- ¿Requiere algo especial? proyector y conexión a internet
para las llamadas al modelo juez (llevo resultados pre-cacheados como respaldo).
- Material adicional: Notebook y slides en preparación; el repo con el código de la
demo quedará público antes de la charla.
Nota: Algunos campos pueden quedar "por definir" y se completarán cuando la charla sea confirmada.
Propuesta de Charla
problema real. En esta charla implementamos desde cero, en Python puro, las métricas que
usan frameworks como RAGAS y DeepEval: faithfulness, contextual precision y
contextual recall. Primero el pseudocódigo y la intuición matemática, luego el mismo cálculo usando
las librerías, para que quede claro qué hace cada una por debajo. Cerramos con las
trampas prácticas: por qué un juez LLM da scores inconsistentes, cómo se calibran, y
cuánto cuesta evaluar a volumen real.
construyendo sistemas agénticos en producción para sectores de minería, transporte e
infraestructura, con foco en MLSecOps, gobernanza de IA y evaluación de pipelines RAG.
Imparte webinars y programas de formación sobre IA agéntica.
(basta con saber qué es un embedding y haber tocado alguna API de LLM)
Jupyter para la demo
ya cubrió embeddings, grounding de LLMs, RAG con BigQuery/Gemini y agentes — pero no hay
ninguna charla sobre medir si eso funciona. Es el hueco natural del arco y es justo
donde más gente se atora al pasar de un demo a producción. Además conecta con las
charlas de pytest y de agentes que ya se dieron: es testing, pero para sistemas
no deterministas.
para las llamadas al modelo juez (llevo resultados pre-cacheados como respaldo).
demo quedará público antes de la charla.