Devs & IA
Termo de IA

RLHF

Aprendizado com feedback humano: como modelos são afinados para serem úteis e seguros.

RLHF (Reinforcement Learning from Human Feedback, ou aprendizado por reforço com feedback humano) é uma etapa de treino em que pessoas avaliam respostas do modelo — dizendo quais são melhores — e essas preferências são usadas para afinar o comportamento. É boa parte do motivo pelo qual os modelos modernos soam úteis, seguem instruções e recusam pedidos problemáticos, em vez de só completar texto cru.

Por que importa: ajuda a entender por que um modelo "quer agradar" — o RLHF o recompensou por respostas que pessoas gostaram, o que também explica vícios como concordar demais ou soar confiante mesmo sem certeza. É um conceito de bastidor, mas útil: muito do "jeito" de um modelo vem menos do que ele leu e mais de como foi afinado por julgamento humano depois.

Termos relacionados