O que é DPO?
Atalho pra ensinar preferências ao modelo: mostra pares de respostas, uma boa e uma ruim, e ele aprende direto a favorecer a boa, sem etapas intermediárias.
Também chamado de: direct preference optimization, otimização direta de preferência, otimizacao direta de preferencia.
Uma analogia
Em vez de montar tribunal, o capo mostra ao novato duas execuções do mesmo serviço, aponta a certa e a errada, e segue o baile.
Esta verbete ainda não tem exemplo prático revisado, e por isso não está publicado nos buscadores. A definição e a analogia acima vêm do glossário do curso.
Onde isso aparece no curso
- Fine-tuning (deep-learning)
- AI Safety (critica)
- ML em 2026 (ia-moderna)