O que é RLHF?
Método de treino em que pessoas comparam respostas do modelo e dizem quais preferem; o modelo então aprende a produzir o tipo de resposta preferido.
Também chamado de: reinforcement learning from human feedback, aprendizado por reforço com feedback humano.
Uma analogia
O Don avalia cada serviço do novato: aprovou, ganha respeito; reprovou, refaz. Com o tempo o soldato aprende sozinho o gosto do chefe.
Esta verbete ainda não tem exemplo prático revisado, e por isso não está publicado nos buscadores. A definição e a analogia acima vêm do glossário do curso.
Onde isso aparece no curso
- Fine-tuning (deep-learning)
- AI Safety (critica)
- Os três paradigmas de aprendizado (fundacao)