Skip to content

[PROPUESTA] ¿Cómo sabes que tu RAG funciona? Métricas de evaluación desde cero #64

Description

@jmanuelc87

Propuesta de Charla

  • Título de la charla: ¿Cómo sabes que tu RAG funciona? Métricas de evaluación desde cero
  • Resumen/Descripción: Construir un RAG es la parte fácil; saber si responde bien es el
    problema real. En esta charla implementamos desde cero, en Python puro, las métricas que
    usan frameworks como RAGAS y DeepEval: faithfulness, contextual precision y
    contextual recall. Primero el pseudocódigo y la intuición matemática, luego el mismo cálculo usando
    las librerías, para que quede claro qué hace cada una por debajo. Cerramos con las
    trampas prácticas: por qué un juez LLM da scores inconsistentes, cómo se calibran, y
    cuánto cuesta evaluar a volumen real.
  • Ponente(s):
    • Nombre: Juan Manuel Carballo
    • Bio: Ingeniero en Computación con maestría en IA Aplicada. Trabaja en Cognitactix
      construyendo sistemas agénticos en producción para sectores de minería, transporte e
      infraestructura, con foco en MLSecOps, gobernanza de IA y evaluación de pipelines RAG.
      Imparte webinars y programas de formación sobre IA agéntica.
    • Foto: [Enlace o por definir]
    • Redes (opcional): Github (https://github.com/jmanuelc87) Linkedin (https://www.linkedin.com/in/jmanuelc87/)
  • Temas (tags): Python, AI, LLM, RAG, Evaluación, MLOps
  • Nivel de dificultad: Intermedio
    (basta con saber qué es un embedding y haber tocado alguna API de LLM)
  • Tech stack sugerido: Python 3.11+, RAGAS, DeepEval, OpenRouter (modelos juez),
    Jupyter para la demo
  • Duración estimada: 40 minutos
  • Motivación: Revisando el catálogo del canal y los issues de este repo, la comunidad
    ya cubrió embeddings, grounding de LLMs, RAG con BigQuery/Gemini y agentes — pero no hay
    ninguna charla sobre medir si eso funciona. Es el hueco natural del arco y es justo
    donde más gente se atora al pasar de un demo a producción. Además conecta con las
    charlas de pytest y de agentes que ya se dieron: es testing, pero para sistemas
    no deterministas.
  • ¿Tienes preferencia de mes o fecha? Flexible, Agosto o Septiembre funciona bien
  • ¿Requiere algo especial? proyector y conexión a internet
    para las llamadas al modelo juez (llevo resultados pre-cacheados como respaldo).
  • Material adicional: Notebook y slides en preparación; el repo con el código de la
    demo quedará público antes de la charla.

Nota: Algunos campos pueden quedar "por definir" y se completarán cuando la charla sea confirmada.

Metadata

Metadata

Assignees

No one assigned

    Labels

    No labels
    No labels

    Type

    No type

    Fields

    No fields configured for issues without a type.

    Projects

    No projects

    Milestone

    No milestone

    Relationships

    None yet

    Development

    No branches or pull requests

    Issue actions