Blyerts
MenyTeach & TalkSköt hemsidan med AILagarna kring AI och dataDet nya arbetslivetAI och samhälletAlla temanRedaktörernaKurserMetoderKontexterOrdbokenPlattformenCoWork StudioMedlemskap BasNytt och omskrivetMedlemskap Bas · gratis till nyår

RLHF

Träning på mänsklig feedback — gör modeller "hjälpsamma".

OrdbokenBegreppEtablerad kunskap

RLHF

RLHF: att finjustera en modell mot mänskliga preferenser för att göra den hjälpsam och säker.

RLHF (Reinforcement Learning from Human Feedback) är en träningsmetod där en språkmodell finjusteras mot mänskliga preferenser. Vanligt förlopp: människor rangordnar olika modellsvar, dessa rangordningar tränar en belöningsmodell, och basmodellen optimeras sedan med förstärkningsinlärning (ofta PPO) för att maximera belöningen. Metoden populariserades av OpenAI (InstructGPT, 2022) och var central för att göra ChatGPT användbar.

RLHF förvandlar en rå textprediktor till en modell som följer instruktioner, håller en hjälpsam ton och avböjer skadliga förfrågningar. Begränsningar är att belöningsmodellen kan manipuleras (reward hacking), att den kodar värderingarna hos dem som märker data, och att den kan ge överdriven försiktighet eller inställsamhet (sycophancy). Alternativ och komplement har vuxit fram, som Constitutional AI och DPO (Direct Preference Optimization).

För en AI som resonerar om modellbeteende är RLHF förklaringen till varför moderna assistenter beter sig som de gör och varför deras beteende speglar mänskliga preferensval.

Källor

Ouyang m.fl., InstructGPT (2022); Christiano m.fl. (2017). Granskad 2026-09-03 utan extern verifiering: begreppsdefinition med etablerad primärlitteratur, där datumet anger senaste redaktionella genomgång och inte en faktakontroll mot ny källa.

Etablerad kunskap · Ordboken kontrolleras varje natt, ett urval ord i taget

Secret Link