Hoppa till innehållet

Data och infrastruktur

Dataförstärkning

Dataförstärkning är att skapa fler träningsexempel ur dem man redan har genom att variera dem: spegelvända en bild, byta ut ord i en mening, lägga till brus. Syftet är att modellen ska klara verkliga fall bättre, inte att det ska se ut som mer data.

Vad dataförstärkning förväxlas med

Syntetisk data. Där skapas helt nya exempel, ofta av en annan modell. Dataförstärkning utgår från befintliga.

Mer data. Varianter av samma underlag löser inte att underlaget saknar en hel grupp. Det är den vanligaste missuppfattningen och den som kostar mest, eftersom skevheten består.

Var du möter ordet dataförstärkning

I arbetet hos den som tränar modeller, framför allt på bild och ljud. Köper ni färdiga verktyg möter ni det inte.

Vidare

Maskininlärningens pipeline om var i kedjan steget ligger. Bias och fairness i AI om skevheten som består.