Modeller och tekniker
Tokenisering
Tokenisering är när en text delas upp i de bitar som en språkmodell räknar med, kallade tokens. En token är ofta ett helt ord, men långa och ovanliga ord delas upp i flera delar. Antalet tokens avgör hur mycket text som får plats och vad användningen kostar.
Vad tokenisering förväxlas med
Ord. En token motsvarar inte ett ord. Svenska sammansatta ord blir ofta flera tokens, vilket gör svensk text dyrare att köra än engelsk.
Tokenisering inom betalningar. Där betyder ordet att ett kortnummer byts mot en ersättningskod. Det har inget med språkmodeller att göra.
Kontextfönstret. Tokens är enheten. Kontextfönstret är hur många av dem som ryms åt gången.
Var du möter tokenisering
I prislistor och tekniska villkor för verktyg som säljs per token, och i felmeddelanden om att ett underlag är för långt. Där är det värt att veta vad enheten faktiskt är.
Vidare
Kontextfönster (Context Window) för hur många tokens som ryms. LLM (Large Language Model) för modellerna som räknar i tokens. Prompt för texten som räknas.