Hoppa till innehållet

Modeller och tekniker

Reinforcement Learning

Reinforcement learning, på svenska förstärkningsinlärning, är en form av maskininlärning där en modell lär sig genom att pröva sig fram i en miljö och få belöning eller straff för sina val. Den tränas alltså inte mot färdiga facit utan mot konsekvenser. Metoden används i robotik, styrsystem och spel, och för att finjustera språkmodeller efter mänsklig återkoppling.

Vad reinforcement learning förväxlas med

Vanlig maskininlärning. I det vanliga fallet lär sig modellen av data där rätt svar är angivet. Här finns inget facit, bara utfall som är bättre eller sämre.

Att systemet lär sig av dig i drift. Träningen sker i en avgränsad miljö före leverans. Ett verktyg du använder tränar sällan om sig i realtid.

Förstärkning i psykologisk mening. Termen är lånad därifrån, men här handlar det om en algoritm som räknar på belöningar.

Var du möter reinforcement learning

I robotik, i styrning av processer och i beskrivningar av hur språkmodeller har justerats med mänsklig återkoppling. I ett vanligt upphandlingsunderlag är ordet ovanligt.

Vidare

Maskininlärning för de andra sätten att lära. Robotik för det klassiska användningsområdet. Algoritm för grundbegreppet.