Temario del curso
Introducción al Aprendizaje por Refuerzo a partir de Retroalimentación Humana (RLHF)
- Concepto básico del RLHF y su importancia estratégica en la IA contemporánea
- Diferencias con respecto a los métodos tradicionales de ajuste mediante aprendizaje supervisado
- Contextos reales de empleo del RLHF dentro del desarrollo generalizado de sistemas inteligentes
Creación de Modelos de Recompensa mediante Datos Humanos
- Obtención y ordenación sistemática de opiniones aportadas por las personas
- Diseño e instrucción práctica de modelos capaces de cuantificar valor humano
- Evaluación detallada de los resultados obtenidos por dichos modelos de recompensa
Entrenamiento mediante la Optimización Proximal de Políticas (PPO)
- Conceptos generales sobre algoritmos PPO para aplicaciones derivadas del RLHF
- Aplicación eficaz de métodos PPO junto con modelos de recompensa creados previamente
- Técnica iterativa y segura a la hora de ir adaptando gradualmente los modelos originales
Prácticas específicas para el Ajuste Fino de Modelos Lingüísticos
- Obtención y organización óptima del material requerido en flujos RLHF
- Aprendizaje práctico al adaptar un modelo pequeño de lenguaje mediante dichas técnicas
- Reconocimiento de obstáculos potenciales y estrategias recomendadas para evitarlos
Aumento progresivo del uso del RLHF en escenarios Empresariales o Productivos
- Determinación estratégica de requerimientos técnicos y capacidad computacional necesaria
- Sistema continuado de control cualitativo y recuperación constante de aportes humanos
- Métodos reconocidos a nivel profesional para una puesta en marcha eficaz del entorno final.
Cuestiones Éticas e Iniciativas frente al Sesgo Cultural
- Identificación y corrección de potenciales riesgos éticos ligados a la intervención humana en el proceso de aprendizaje
- Procedimientos validados para localizar y corregir posibles distorsiones culturales o sociales generadas por modelos<\/li>
- Método continuo para certificar que los resultados obtenidos mantengan armonía con valores éticos.
Análisis de Experiencias y Ejemplos Destacados del Mundo Real
- Ejemplo práctico: modificación técnica de ChatGPT a través del RLHF
- Recopilación de otros casos fructíferos donde se haya implementado esta técnica con éxito.
- Observaciones cualitativas recibidas directamente por expertos del sector y lecciones importantes a extraer.
Recapitulación Final e Indicaciones sobre Próximos Pasos
Requerimientos
- Conocimiento básico de los principios del aprendizaje supervisado y por refuerzo
- Experiencia previa en el ajuste fino de modelos y conocimientos sobre arquitecturas de redes neuronales
- Familiaridad con la programación en Python y marcos de trabajo para el aprendizaje profundo (como TensorFlow o PyTorch)
Público objetivo
- Ingenieros en aprendizaje automático
- Investigadores en inteligencia artificial
Formación Corporativa a Medida
Soluciones de formación diseñadas exclusivamente para empresas.
- Contenido personalizado: Adaptamos el temario y los ejercicios prácticos a los objetivos y necesidades reales del proyecto.
- Calendario flexible: Fechas y horarios adaptados a la agenda de su equipo.
- Modalidad: Online (en directo), In-company (en sus oficinas) o Híbrida.
Precio por grupo privado (formación online) desde 2900 € + IVA*
Contáctenos para obtener un presupuesto exacto y conocer nuestras promociones actuales