Model językowy potrafi streścić długi dokument, przeanalizować kod i odpowiedzieć na złożone pytanie, a mimo to czasem potyka się na literach, numerach seryjnych czy niemal identycznych ciągach znaków. Różnica zaczyna się już na wejściu - tekst nie trafia do modelu w takiej postaci, w jakiej czyta go człowiek. Zanim zacznie się adekwatne przetwarzanie, trzeba go najpierw zakodować. Tu pojawiają się tokeny. Często tłumaczy się je jako słowa albo fragmenty słów. Na początek takie uproszczenie wystarcza, ale przy bliższym spojrzeniu gwałtownie okazuje się, iż sprawa jest bardziej złożona. W tym materiale pokażę, jak tokenizacja wygląda na przykładach z języka polskiego, co naprawdę dzieje się z tekstem po wpisaniu promptu i dlaczego ten zwykle niewidoczny etap ma bardzo konkretne konsekwencje.