Etik, risk och säkerhet
Adversarial Attacks
Adversarial attacks är angrepp utformade för att lura en AI-modell: en bild med ett mönster ögat inte ser men som får modellen att klassificera fel, eller en text med instruktioner gömda i sig. Angreppet riktar sig mot modellens sätt att fungera, inte mot systemet runt omkring.
Vad adversarial attacks förväxlas med
Vanliga dataintrång. Där tar sig någon in där den inte får vara. Här används systemet precis som avsett, med indata som valts för att ge fel resultat.
Hallucination. Modellen har fel av sig själv. Här har någon fått den att ha fel med flit.
Promptinjektion. Den vanligaste formen i textverktyg, alltså instruktioner gömda i material verktyget läser. En underavdelning, och den som oftast berör ett kontor.
Var du möter adversarial attacks
I säkerhetsgranskningar och i forskning. Och alltmer i praktiken, i takt med att verktyg får läsa material som kommer utifrån: ett mejl, en webbsida, ett inskickat dokument. Text i det materialet kan påverka vad verktyget gör härnäst.
Angreppet kräver inte att någon är skicklig. Det räcker att någon skriver en instruktion på ett ställe verktyget kommer att läsa.
Vad du kan göra med det
Behandla allt inkommande material som något som kan innehålla instruktioner. Den praktiska följden är enkel: ju mer ett verktyg får göra utan att fråga, desto noggrannare måste ni vara med vad det får läsa.
Det är också ett argument för att låta en människa godkänna det sista steget när steget är svårt att ta tillbaka.
Vidare
AI-säkerhet om skyddet i stort. Robust AI om hur modeller beter sig utanför det kända. Prompt om vad en instruktion till ett verktyg faktiskt är. Se kurserna