Contacta con nosotros

Temario del curso

Introducción al aprendizaje por refuerzo a partir de retroalimentación humana (RLHF)

  • ¿Qué es el RLHF y por qué es importante?
  • Comparación con métodos de ajuste fino supervisado
  • Aplicaciones del RLHF en sistemas modernos de inteligencia artificial

Modelado de recompensas con retroalimentación humana

  • Recolección y estructuración de la retroalimentación humana
  • Construcción y entrenamiento de modelos de recompensa
  • Evaluación de la efectividad de los modelos de recompensa

Entrenamiento con Optimización Política Cercana (PPO, por sus siglas en inglés)

  • Visión general de los algoritmos PPO para RLHF
  • Implementación de PPO con modelos de recompensa
  • Ajuste iterativo y seguro de los modelos

Ajuste fino práctico de modelos de lenguaje

  • Preparación de conjuntos de datos para flujos de trabajo RLHF
  • Ajuste fino práctico de un modelo de lenguaje pequeño (LLM) mediante RLHF
  • Desafíos y estrategias de mitigación

Escalar el RLHF a sistemas productivos

  • Consideraciones sobre infraestructura y capacidad computacional
  • Aseguramiento de calidad e bucles continuos de retroalimentación
  • Mejores prácticas para implementación y mantenimiento

Consideraciones éticas y mitigación de sesgos

  • Abordaje de riesgos éticos en la retroalimentación humana
  • Estrategias de detección y corrección de sesgos
  • Aseguramiento de alineación y salidas seguras

Casos de estudio y ejemplos del mundo real

  • Caso de estudio: Ajuste fino de ChatGPT con RLHF
  • Otras implementaciones exitosas de RLHF
  • Lecciones aprendidas e industry insights (perspectivas de la industria)

Resumen y próximos pasos

Requerimientos

  • Conocimiento de los fundamentos del aprendizaje supervisado y el aprendizaje por refuerzo
  • Experiencia con ajuste fino de modelos y arquitecturas de redes neuronales
  • Familiaridad con la programación en Python y marcos de aprendizaje profundo (por ejemplo, TensorFlow, PyTorch)

Público objetivo

  • Ingenieros de aprendizaje automático
  • Investigadores de inteligencia artificial
 14 Horas

Número de participantes


Precio por participante

Próximos cursos

Categorías Relacionadas