Etik, risk och säkerhet
Promptinjektion
Promptinjektion är när någon gömmer instruktioner i ett dokument, ett mejl eller en webbsida som ett AI-verktyg läser, och verktyget följer dem som om de kom från användaren. Angreppet riktar sig inte mot systemet utan mot assistentens läsning.
Vad promptinjektion förväxlas med
Dataintrång. Ingen bryter sig in. Instruktionen kommer in genom den dörr som står öppen med flit, alltså det material assistenten är satt att läsa.
En dålig prompt. Det handlar inte om att användaren formulerat sig otydligt. Texten är skriven av någon annan, för att verktyget ska läsa den.
Ett problem för IT. Det blir en fråga för vanliga medarbetare i takt med att assistenterna får läsa inkorgen, kalendern och filerna. Den som skickar mejlet behöver inte ha åtkomst till något för att försöka.
Var du möter ordet promptinjektion
I säkerhetsgranskningar av AI-verktyg, och i leverantörers svar på frågan hur de skyddar mot det. Svaret är sällan att risken är borta, utan att den är begränsad.
Risken växer med vad assistenten får göra. Ett verktyg som bara sammanfattar text kan luras att sammanfatta fel. Ett verktyg som får skicka mejl eller ändra i ett system kan luras att göra det.
Vad du kan göra med det
Frågan att ställa är inte om verktyget kan luras, utan vad som händer när det gör det. Ju fler steg en assistent får ta utan att någon tittar, desto större blir följden av en instruktion den aldrig borde ha lytt.
Det är samma resonemang som ligger bakom kravet på en människa i beslutskedjan, och det är därför de två frågorna hör ihop.
Vidare
Mänsklig kontroll om vem som ska kunna stoppa ett svar innan det får verkan.
Adversarial Attacks om angrepp mot AI-system i stort.