Skip to content

[PROPUESTA] ¿Cómo sabes que tu RAG funciona? Métricas de evaluación desde cero #64

Description

@jmanuelc87

Propuesta de Charla

  • Título de la charla: ¿Cómo sabes que tu RAG funciona? Métricas de evaluación desde cero
  • Resumen/Descripción: Construir un RAG es la parte fácil; saber si responde bien es el
    problema real. En esta charla implementamos desde cero, en Python puro, las métricas que
    usan frameworks como RAGAS y DeepEval: faithfulness, contextual precision y
    contextual recall. Primero el pseudocódigo y la intuición matemática, luego el mismo cálculo usando
    las librerías, para que quede claro qué hace cada una por debajo. Cerramos con las
    trampas prácticas: por qué un juez LLM da scores inconsistentes, cómo se calibran, y
    cuánto cuesta evaluar a volumen real.
  • Ponente(s):
    • Nombre: Juan Manuel Carballo
    • Bio: Ingeniero en Computación con maestría en IA Aplicada. Trabaja en Cognitactix
      construyendo sistemas agénticos en producción para sectores de minería, transporte e
      infraestructura, con foco en MLSecOps, gobernanza de IA y evaluación de pipelines RAG.
      Imparte webinars y programas de formación sobre IA agéntica.
    • Foto: [Enlace o por definir]
    • Redes (opcional): Github (https://github.com/jmanuelc87) Linkedin (https://www.linkedin.com/in/jmanuelc87/)
  • Temas (tags): Python, AI, LLM, RAG, Evaluación, MLOps
  • Nivel de dificultad: Intermedio
    (basta con saber qué es un embedding y haber tocado alguna API de LLM)
  • Tech stack sugerido: Python 3.11+, RAGAS, DeepEval, OpenRouter (modelos juez),
    Jupyter para la demo
  • Duración estimada: 40 minutos
  • Motivación: Revisando el catálogo del canal y los issues de este repo, la comunidad
    ya cubrió embeddings, grounding de LLMs, RAG con BigQuery/Gemini y agentes — pero no hay
    ninguna charla sobre medir si eso funciona. Es el hueco natural del arco y es justo
    donde más gente se atora al pasar de un demo a producción. Además conecta con las
    charlas de pytest y de agentes que ya se dieron: es testing, pero para sistemas
    no deterministas.
  • ¿Tienes preferencia de mes o fecha? Flexible, Agosto o Septiembre funciona bien
  • ¿Requiere algo especial? proyector y conexión a internet
    para las llamadas al modelo juez (llevo resultados pre-cacheados como respaldo).
  • Material adicional: Notebook y slides en preparación; el repo con el código de la
    demo quedará público antes de la charla.

Nota: Algunos campos pueden quedar "por definir" y se completarán cuando la charla sea confirmada.

Metadata

Metadata

Assignees

No one assigned

    Labels

    No labels
    No labels

    Type

    No type

    Projects

    No projects

    Milestone

    No milestone

    Relationships

    None yet

    Development

    No branches or pull requests

    Issue actions