Machine Don

O que é RLHF?

Método de treino em que pessoas comparam respostas do modelo e dizem quais preferem; o modelo então aprende a produzir o tipo de resposta preferido.

Também chamado de: reinforcement learning from human feedback, aprendizado por reforço com feedback humano.

Uma analogia

O Don avalia cada serviço do novato: aprovou, ganha respeito; reprovou, refaz. Com o tempo o soldato aprende sozinho o gosto do chefe.

Esta verbete ainda não tem exemplo prático revisado, e por isso não está publicado nos buscadores. A definição e a analogia acima vêm do glossário do curso.

Onde isso aparece no curso

Termos relacionados