Contacta con nosotros

Temario del curso

Introducción al Aprendizaje por Refuerzo a partir de Retroalimentación Humana (RLHF)

  • Concepto básico del RLHF y su importancia estratégica en la IA contemporánea
  • Diferencias con respecto a los métodos tradicionales de ajuste mediante aprendizaje supervisado
  • Contextos reales de empleo del RLHF dentro del desarrollo generalizado de sistemas inteligentes

Creación de Modelos de Recompensa mediante Datos Humanos

  • Obtención y ordenación sistemática de opiniones aportadas por las personas
  • Diseño e instrucción práctica de modelos capaces de cuantificar valor humano
  • Evaluación detallada de los resultados obtenidos por dichos modelos de recompensa

Entrenamiento mediante la Optimización Proximal de Políticas (PPO)

  • Conceptos generales sobre algoritmos PPO para aplicaciones derivadas del RLHF
  • Aplicación eficaz de métodos PPO junto con modelos de recompensa creados previamente
  • Técnica iterativa y segura a la hora de ir adaptando gradualmente los modelos originales

Prácticas específicas para el Ajuste Fino de Modelos Lingüísticos

  • Obtención y organización óptima del material requerido en flujos RLHF
  • Aprendizaje práctico al adaptar un modelo pequeño de lenguaje mediante dichas técnicas
  • Reconocimiento de obstáculos potenciales y estrategias recomendadas para evitarlos

Aumento progresivo del uso del RLHF en escenarios Empresariales o Productivos

  • Determinación estratégica de requerimientos técnicos y capacidad computacional necesaria
  • Sistema continuado de control cualitativo y recuperación constante de aportes humanos
  • Métodos reconocidos a nivel profesional para una puesta en marcha eficaz del entorno final.

Cuestiones Éticas e Iniciativas frente al Sesgo Cultural

  • Identificación y corrección de potenciales riesgos éticos ligados a la intervención humana en el proceso de aprendizaje
  • Procedimientos validados para localizar y corregir posibles distorsiones culturales o sociales generadas por modelos<\/li>
  • Método continuo para certificar que los resultados obtenidos mantengan armonía con valores éticos.

Análisis de Experiencias y Ejemplos Destacados del Mundo Real

  • Ejemplo práctico: modificación técnica de ChatGPT a través del RLHF
  • Recopilación de otros casos fructíferos donde se haya implementado esta técnica con éxito.
  • Observaciones cualitativas recibidas directamente por expertos del sector y lecciones importantes a extraer.

Recapitulación Final e Indicaciones sobre Próximos Pasos

Requerimientos

  • Conocimiento básico de los principios del aprendizaje supervisado y por refuerzo
  • Experiencia previa en el ajuste fino de modelos y conocimientos sobre arquitecturas de redes neuronales
  • Familiaridad con la programación en Python y marcos de trabajo para el aprendizaje profundo (como TensorFlow o PyTorch)

Público objetivo

  • Ingenieros en aprendizaje automático
  • Investigadores en inteligencia artificial
 14 Horas

Formación Corporativa a Medida

Soluciones de formación diseñadas exclusivamente para empresas.

  • Contenido personalizado: Adaptamos el temario y los ejercicios prácticos a los objetivos y necesidades reales del proyecto.
  • Calendario flexible: Fechas y horarios adaptados a la agenda de su equipo.
  • Modalidad: Online (en directo), In-company (en sus oficinas) o Híbrida.
Inversión

Precio por grupo privado (formación online) desde 2900 € + IVA*

Contáctenos para obtener un presupuesto exacto y conocer nuestras promociones actuales

Próximos cursos

Categorías Relacionadas