Explainable AI: förklaringar som går att förstå och pröva
Explainable AI gör AI-resultat möjliga att förstå och pröva. Läs om NIST:s fyra principer, lokala och globala förklaringar samt praktisk utvärdering.

Nyckelpunkter
- NIST:s fyra principer är förklaring, meningsfullhet, förklaringens riktighet och kunskapsgränser.
- En förklaring behöver anpassas till mottagaren och den fråga personen behöver besvara.
- En attraktiv visualisering eller genererad motivering är inte bevis på orsak eller modellens verkliga process.
- Förklarbarhet garanterar inte korrekthet, säkerhet eller rättvisa.
- Källor, loggar, dokumentation och möjlighet till mänsklig prövning behövs tillsammans med förklaringen.
Vad är Explainable AI?
Explainable AI, ofta förkortat XAI, är metoder och arbetssätt som gör det möjligt att ge begripliga skäl eller underlag för ett AI-systems resultat och process.
En förklaring kan behövas av olika personer:
- utvecklaren vill hitta fel,
- verksamhetsägaren vill bedöma risk,
- användaren vill förstå rekommendationen,
- den berörda personen vill kunna ifrågasätta utfallet,
- granskaren vill se att systemet användes på rätt sätt.
Samma tekniska detaljnivå passar inte alla.
Förklarbarhet, transparens och tolkbarhet
Begreppen används ibland som synonymer men kan skiljas åt.
Transparens kan beskriva vad systemet består av, vilken data som används, vem som ansvarar och vad som hände.
Förklarbarhet kan beskriva hur systemet kom fram till ett visst resultat eller vilka skäl som följde med det.
Tolkbarhet handlar om vad resultatet betyder i sitt sammanhang för den som ska använda det.
NIST beskriver dessa egenskaper som närliggande men skilda delar av tillförlitlig AI.
Källa: NIST om risker och tillförlitlighet
NIST:s fyra principer
NIST:s rapport om förklarbar AI anger fyra principer.
1. Förklaring
Systemet levererar eller har tillhörande bevis eller skäl för resultat och process.
2. Meningsfullhet
Förklaringen är begriplig för den avsedda mottagaren. En dataforskare och en kund behöver olika språk och detaljnivå.
3. Förklaringens riktighet
Förklaringen ska korrekt återspegla skälet till resultatet eller systemets faktiska process. En lättbegriplig berättelse är inte värdefull om den beskriver något annat än det modellen gjorde.
4. Kunskapsgränser
Systemet verkar bara under de villkor det är utvecklat för och när det har tillräcklig säkerhet i resultatet. Det ska kunna avstå när underlaget ligger utanför det provade.
Källa: NIST, Four Principles of Explainable Artificial Intelligence
Principerna visar att en förklaring inte bara är en figur efter modellens svar. Den måste vara relevant, riktig och kopplad till systemets gränser.
Varför en förklaring behövs
Felsökning
Utvecklare kan upptäcka att modellen använder fel signal. En bildmodell kan till exempel reagera på bakgrunden i stället för objektet.
Kvalitetskontroll
En användare kan jämföra resultatet med källor och se om viktig information saknas.
Ansvar
Verksamheten kan dokumentera vem som använde systemet, vilket underlag som fanns och vem som godkände utfallet.
Möjlighet att invända
Den som påverkas kan behöva förstå vilka uppgifter eller regler som spelade roll för att kunna rätta ett fel.
Lärande
En ämnesexpert kan se återkommande svagheter och förbättra data, instruktion eller arbetsflöde.
En förklaring garanterar inte att systemet är korrekt eller rättvist. Den gör vissa frågor möjliga att ställa och prova.
Global och lokal förklaring
En global förklaring beskriver hur modellen fungerar över många fall: vilka typer av signaler som brukar spela roll, hur modellen tränats och vilka gränser som är kända.
En lokal förklaring gäller ett enskilt resultat: vilka indata som påverkade just denna rekommendation eller klassificering.
Båda behövs. En lokal markering kan visa vilka ord som påverkade ett svar, medan den globala dokumentationen visar att systemet inte har provats på ett visst språk eller en viss grupp.
Tolkbara modeller
Vissa modeller är enklare att läsa direkt. Ett beslutsträd eller en enkel regressionsmodell kan visa regler och vikter på ett sätt som en ämnesexpert kan följa.
En enkel modell är inte automatiskt korrekt eller rättvis. Den kan bygga på dålig data eller fel mål. Men den kan vara lättare att kontrollera och förvalta.
När två metoder ger tillräckligt likvärdig verksamhetsnytta kan den mer begripliga vara bättre, särskilt vid hög konsekvens.
Förklaringar efter modellens resultat
Komplexa modeller förklaras ofta med en separat metod som uppskattar vilka delar av indata som påverkade resultatet. Det kan vara markeringar i en bild, vikter för variabler eller exempel som liknar fallet.
Sådana metoder är användbara men kan vara instabila eller ge en förenklad bild. Kontrollera:
- om förklaringen förändras vid små ändringar,
- om den återger modellens verkliga beteende,
- om användaren tolkar den rätt,
- om flera metoder ger samma bild,
- om förklaringen hjälper till att upptäcka fel.
En attraktiv visualisering är inte ett bevis på orsak.
Förklaringar för generativ AI
En språkmodell kan producera en övertygande redogörelse för "hur den tänkte" utan att texten är en tillförlitlig beskrivning av den interna processen. Behandla därför modellens egen motivering som ett svar som behöver kontrolleras, inte som en revisionslogg.
Mer användbara underlag är:
- källor som faktiskt hämtades,
- utdrag som användes,
- verktygsanrop,
- instruktioner och inställningar,
- vilka kontroller som kördes,
- tidsstämpel och versionsinformation,
- den mänskliga granskningen.
För faktasvar är en öppningsbar källa ofta mer värdefull än en lång självmotivering.
Förklaring för olika roller
Slutanvändare
Behöver veta vad resultatet betyder, vilka uppgifter som användes och vad nästa steg är.
Berörd person
Behöver begriplig information, möjlighet att rätta indata och en väg till mänsklig prövning.
Ämnesexpert
Behöver originalunderlag, osäkerhet och kända begränsningar.
Utvecklare
Behöver tekniska mätetal, felanalys, dataversion och loggar.
Ledning och granskning
Behöver syfte, ansvar, riskbedömning, resultat över tid och dokumenterade beslut.
Designa inte en enda förklaring för alla.
Förklaring är inte samma sak som förtroende
En välformulerad förklaring kan öka förtroendet även när den är felaktig. Målet är därför inte största möjliga förtroende, utan välgrundad tillit.
Fråga:
- Kan mottagaren upptäcka när systemet har fel?
- Visas osäkerhet och kunskapsgränser?
- Går källan att kontrollera?
- Kan resultatet överklagas eller rättas?
- Vet användaren när en människa tar över?
En förklaring som bara får användaren att acceptera resultatet är otillräcklig.
Förklarbarhet och partiskhet
En förklaring kan visa att vissa signaler påverkar resultatet, men den visar inte automatiskt att behandlingen är rättvis. En till synes neutral variabel kan samvariera med en skyddad egenskap.
Prova resultat och fel för relevanta grupper. Jämför likvärdiga fall där en irrelevant personuppgift ändras. Bedöm både genomsnitt och allvarliga fel.
NIST:s AI Risk Management Framework lyfter förklarbarhet tillsammans med giltighet, säkerhet, robusthet, ansvar, transparens, integritet och hantering av skadlig partiskhet.
Källa: NIST AI Risk Management Framework
Förklarbarhet i vård
En vårdprofessionell kan behöva se vilket område i en bild eller vilka mätvärden som påverkade en rekommendation. Patienten kan behöva en annan förklaring av systemets roll och hur beslutet granskas.
En markering på en bild visar inte att modellen har hittat den medicinska orsaken. Resultatet måste bedömas mot avsedd användning, kliniskt underlag och det fulla arbetsflödet.
FDA:s lista över AI-aktiverade medicintekniska produkter visar exempel på produkter med bestämd avsedd användning och amerikansk marknadsgranskning. Listan är enligt FDA inte fullständig.
Källa: FDA:s lista över AI-aktiverade medicintekniska produkter
Förklarbarhet i kredit och andra beslut
En person som får ett negativt besked behöver användbar information om vilka uppgifter och regler som påverkade utfallet och hur ett fel kan rättas. En teknisk lista över hundratals modellvikter är sällan meningsfull.
Systemägaren behöver samtidigt kunna prova att förklaringen är riktig och att likvärdiga fall hanteras konsekvent. Separera kundens förklaring från utvecklarens felsökningsdata, men se till att de inte motsäger varandra.
AIUC:s allmänna artikel ska inte användas som juridisk bedömning av ett specifikt beslut.
Förklarbarhet i robotik och automation
En operatör behöver veta varför en maskin stannade, vilken sensor som gav larm och vad som krävs för säker återstart. Utvecklaren behöver mer detaljer om modell och tröskelvärden.
Vid fysisk risk ska säkerheten inte bero på att en människa hinner tolka en komplex förklaring. Systemet behöver gå till ett säkert läge när det når sin kunskapsgräns.
Dokumentation runt modellen
Förklarbar AI omfattar också dokumentation:
- syfte och avsedd användning,
- användare och berörda grupper,
- datakällor och begränsningar,
- valda mått,
- provresultat och feltyper,
- kända kunskapsgränser,
- behörighet och loggar,
- mänsklig kontroll,
- ändringshistorik,
- stopp- och reservrutiner.
Dokumentationen behöver uppdateras när data, modell, leverantör eller arbetsflöde ändras.
Så provar du en förklaring
1. Bestäm mottagaren
Skriv vilken fråga personen behöver få svar på.
2. Definiera riktighet
Bestäm hur ni provar att förklaringen återspeglar modellens beteende.
3. Använd verkliga och svåra fall
Ta med felaktiga, ofullständiga och oväntade indata.
4. Testa begriplighet
Låt den avsedda mottagaren förklara med egna ord vad resultatet betyder och vad nästa steg är.
5. Testa stabilitet
Gör små ändringar som inte borde påverka utfallet och se om förklaring och resultat beter sig rimligt.
6. Visa gränser
Prova att systemet avstår när det ligger utanför den avsedda användningen.
7. Följ efter start
Registrera vilka förklaringar som missförstås och vilka fel de hjälper eller inte hjälper att hitta.
Vanliga missförstånd
"Förklarbar AI är automatiskt rättvis."
Nej. Förklaringen kan hjälpa granskning men rättvisa behöver mätas separat.
"En modell som visar vikter är korrekt."
Nej. Den kan vara begriplig och ändå bygga på dålig data.
"Modellens egen motivering är en revisionslogg."
Nej. En genererad förklaring kan vara lika osäker som andra svar.
"Mer teknisk detalj är alltid bättre."
Nej. Förklaringen ska vara meningsfull för mottagaren.
"En förklaring skapar ansvar."
Nej. Organisationen behöver också namngivna ägare, beslut och möjlighet att stoppa.
Sammanfattning
Explainable AI handlar om förklaringar som finns, är meningsfulla, återspeglar systemets beteende och visar kunskapsgränser. Det är NIST:s fyra principer i praktisk form.
Välj förklaring efter mottagare och syfte. Prova riktighet, begriplighet och stabilitet. Kombinera förklaringen med källor, loggar, dokumentation och verklig mänsklig kontroll.
Vanliga frågor
Metoder och arbetssätt som ger begripliga skäl eller underlag för ett AI-systems resultat och process.
Systemet ska ge en förklaring, göra den meningsfull för mottagaren, låta den återspegla det verkliga beteendet och visa sina kunskapsgränser.
En global förklaring beskriver systemets allmänna beteende. En lokal förklaring gäller varför ett enskilt resultat blev som det blev.
Inte som revisionslogg. En genererad motivering kan vara felaktig. Källor, verktygsanrop, instruktioner, loggar och mänsklig kontroll är säkrare underlag.
Nej. Förklaringen kan stödja granskning, men resultat och fel behöver fortfarande mätas för relevanta grupper.
Vill ni att personalen ska kunna det här, hör av er.
Nyhetsbrevet
Nytt om AI, ungefär varje vecka.
Vi skriver när något faktiskt har hänt och när något visar sig fungera i praktiken. En text i taget, inga serier, och du kan gå ur från vilket nummer som helst.
Vi sparar din adress för att skicka nyhetsbrevet, och inget annat. Mer i integritetspolicyn.