Helping Hands
Was ist ein Token? KI-Grundlagen einfach erklärt
Was ist ein Token? Wie KI-Modelle Text, Bild und Ton in Token zerlegen, was das Kontextfenster ist und warum Verstehen nicht gleich Erzeugen ist.

ChatGPT, Claude und Co. wirken auf den ersten Blick wie echte Alleskönner. Sie beantworten Fragen, schreiben Texte, fassen Dokumente zusammen und bedienen nebenbei noch andere Programme einfach so im Hintergrund.
Aber wie genau macht ein Sprachmodell das eigentlich? Welches Grundprinzip steckt dahinter – und warum können KI-Modelle mittlerweile sogar Bilder erstellen oder Audio erzeugen?
In diesem Artikel erklären wir das Grundprinzip hinter KI-Modellen: Token. Was sie sind, wie ein Modell mit ihnen arbeitet und wieso es nicht nur Texte, sondern auch Bilder und gesprochene Sprache verarbeiten kann. Wer diese Grundlagen kennt, versteht auch viel besser, was KI im Kundenservice leisten kann und wo ihre Grenzen liegen.
Das hier ist Teil 1 unserer Grundlagen-Serie, die in Zusammenarbeit mit unserem Machine Learning Engineer Dr. Tae-Gil Noh entsteht.
Das Wichtigste in Kürze
- Ein Prinzip: Ein KI-Modell berechnet, welches Token als Nächstes kommt. Alle Fähigkeiten, die wir sehen, entstehen aus dieser einen Aufgabe.
- Tokens: Ein Modell liest weder ganze Wörter noch einzelne Buchstaben, sondern Wortbausteine. „Working” zerfällt zum Beispiel in „work” und „ing”.
- Kontextfenster: Ein Modell kann nur eine begrenzte Menge auf einmal verarbeiten. Deshalb muss das passende Wissen zu jeder Frage gezielt herausgesucht und mitgeliefert werden.
- Mehr als Text: Auch Bilder und Ton lassen sich in Token-Folgen umwandeln. So kann ein Modell „sehen” und „hören”, obwohl es eigentlich nur liest.
- Verstehen ist nicht Erzeugen: Was ein Modell aufnehmen kann und was es selbst produzieren kann, sind zwei verschiedene Dinge. Für Telefonate braucht es Modelle, die Sprache verstehen und sprechen können, in Echtzeit.
- 1Initialisierung: „Nimm ein Szenario und spinne es weiter"
- 2Warum diese Fortsetzung nicht nur plausibel, sondern auch nützlich ist
- 3Was ist ein Token?
- 4Am Anfang war das Wort
- 5Der Token als Element in einer geordneten Folge
- 6Lesen und Schreiben sind verschiedene Skills
- 7Fazit
- 8Häufig gestellte Fragen (FAQ)
Initialisierung: „Nimm ein Szenario und spinne es weiter”
Was genau macht man eigentlich, wenn man mit einem Sprachmodell kommuniziert? Man stellt eine Frage … oder nicht? Im Grunde genommen macht man etwas anderes: Man gibt dem Modell eine Situation bzw. ein Szenario und erwartet, dass es diese bzw. dieses „weiterspinnt”, also fortführt.
Noch bevor es antwortet, liest das Modell, was man ihm gegeben hat. Das können z. B. Anweisungen sein, eine Kundennachricht, jegliches Wissen in Form von angehängten Bildern oder PDFs – und das alles in ein und derselben Nachricht. Man kann das als eine Art Initialisierung sehen: Das Modell nimmt dieses Szenario und bringt es in einen einheitlichen Zustand, um die Frage „Was kommt danach?” beantworten zu können. Danach produziert das Modell die Weiterführung dieses Gedankens Stück für Stück. Ganz nach dem Motto: Atme tief ein und aus, Schritt für Schritt.
Text, Audio oder Bild – alles wird in dieselbe Folge von Tokens umgewandelt, bevor das Modell es auswertet.
Ein Modell kann jeweils nur eine begrenzte Menge an Informationen aufnehmen. Deshalb muss bei jeder Frage das richtige Wissen gefunden und weitergegeben werden – das ist RAG.
Warum diese Fortsetzung nicht nur plausibel, sondern auch nützlich ist
Das Modell hat gelernt, indem es eine riesige Menge an von Menschen verfassten Texten gelesen hat: große Teile des Internets, Bücher, Dokumente, Konversationen. Diese hat es sich nicht eingeprägt, sondern als Muster „aufgesaugt”. Und ein Muster dominiert menschliche Texte: Nach einer Frage kommt eine Antwort, nach einer Anfrage folgt die Ausführung, nach einem halben Satz kommt ein passender Schluss. Wenn das Modell also nach der natürlichsten Fortsetzung auf eine Kundenfrage hin sucht, ist das Natürlichste – ausgehend von allem, was es gelesen hat – eine gute Antwort. Der Nutzen ergibt sich aus dem Prinzip „einfach den Text fortsetzen”, denn in den Texten, aus denen es gelernt hat, folgte auf die Frage eine hilfreiche Fortsetzung.
Lesen allein reicht nicht aus. Es macht ein Modell zwar plausibel, aber nicht hilfreich, ehrlich oder sicher. Das erreicht erst eine zweite Trainingsphase: Menschen zeigen dem Modell, welche Fortsetzungen tatsächlich gut sind, und es lernt, diese zu bevorzugen. Ein Satz fasst das zusammen:
Erst alles lesen, dann lernen, was gut ist.Dr. Tae-Gil Noh, Machine Learning Engineer bei OMQ
Mit jeder Modellgeneration werden beide Aspekte besser.
Was ist ein Token?
Die „Teilchen” bzw. „Stückchen” nennen sich Token. In einem Text ist ein Token normalerweise ein Stück, das kleiner ist als ein Wort. Manche Wörter sind eigenständige Token, andere, längere Wörter werden geteilt. Das englische „working” wird dabei zum Beispiel zu „work” + „ing”. Leerzeichen und Satzzeichen sind auch Token.
Ein Token ist in der Regel kleiner als ein Wort: „confirmation“ wird in zwei Teile aufgeteilt, und die Leerzeichen sowie der Punkt sind jeweils eigene Token.
Aber warum müssen Wörter zerteilt werden, anstatt sie komplett zu nutzen?
Die Tokenisierung ermöglicht es dem Sprachmodell, alles zu bearbeiten: jede Sprache, Bedeutungen, Themen, Rechtschreibfehler und sogar neue Produktnamen, die das Modell aus schon bekannten Stückchen zusammenbaut.
Ein Sprachmodell beantwortet keine Fragen. Es berechnet Schritt für Schritt, welches Token als Nächstes am wahrscheinlichsten kommt.
Der Nachteil ist, dass das Modell Wörter und Buchstaben nicht so wahrnimmt, wie wir Menschen es tun. Sprachmodelle sehen gewissermaßen einen Fluss aus Token. Aus diesem Grund ist es für viele Sprachmodelle auch schwer, die Buchstaben in einem Wort zu zählen – sie sehen diese einfach nicht.
Sprachmodelle nehmen einen Strom von Tokens wahr, keine Buchstaben. Deshalb tun sie sich mit Fragen schwer, die wir als trivial empfinden.
Am Anfang war das Wort
Alle Sprachmodelle, die wir heute kennen und nutzen, haben mit Wörtern begonnen – und zwar mit riesigen Datenmengen an Texten. Und Text ist ein Medium, das aus mindestens zwei Gründen besonders interessant ist. Text beinhaltet Inhalt (Bedeutung: „Deine Bestellung wurde gestern versendet”), aber auch Anweisungen („Öffne Bestellung #12345”).
Ein Modell, das fließend „Sprache” spricht, kann sowohl Inhalt weitergeben als auch Anweisungen geben und somit Tools verwenden. Das Modell schreibt: „Gib mir die Versandinformationen zur Bestellung #12345”, diese Anweisung wird ausgeführt und das Ergebnis fließt als neue Aneinanderreihung von Tokens zurück in die Konversation. „Text” ist also sowohl die Bedeutung als auch das Kontrollsystem!
Der Token als Element in einer geordneten Folge
Wenn man den Token näher betrachtet, geht es dabei gar nicht wirklich um „Text”. Ein Token ist einfach nur ein Element in einer geordneten Folge, welche das Modell liest. Dabei stellt sich die Frage: Was kann man noch als Element in einer geordneten Folge nutzen?
- Ersetzt man „Text” durch „Ton”, dann kann das Modell „hören”.
- Ersetzt man ihn durch „Bild”, dann kann es „sehen”.
Schall ist eine Welle: Luftdruck, der sich über die Zeit auf und ab bewegt. Und „über die Zeit” ist hier das Stichwort – dadurch hat Schall von sich aus eine Reihenfolge, von Anfang bis Ende.
Wenn man einem KI-Modell „Ton” gibt, muss die Aufnahme in sehr kleine Segmente geteilt werden – wirklich kleine Segmente –, etwa rund hundert Segmente pro Sekunde. Jedes dieser Segmente wird dann in ein Token umgewandelt, welches erfasst, was der Ton in diesem Moment macht. Wenn man diese Token dann aneinanderreiht, ergibt sich der komplette Ausdruck (englisch: „Utterance”) als Reihe – und das ist genau die Form, die ein Modell lesen kann. Das Modell „hört” also, indem es den Ton als Satz liest.
Der Ton läuft bereits von Anfang bis Ende. Schneidet man ihn in etwa hundert Segmente pro Sekunde, entsteht eine Abfolge von Tokens – das Modell „hört“ also, indem es liest.
Bilder sind ein deutlich interessanterer Fall, denn sie funktionieren anders als „Text” und „Ton”. Ein Bild hat keine natürliche Reihenfolge und keine natürliche Ordnung. Wo fängt ein Bild an? Oben links? In der Mitte? Es gibt kein erstes Wort und keine Leserichtung, die das Bild selbst vorgibt.
Wie kann es sein, dass es trotzdem KI-generierte Bilder und andere KI-Tools für Bildbearbeitung gibt?
Das Modell denkt sich eine Reihenfolge aus! Es legt ein Raster über das Bild, schneidet es in ein Mosaik aus kleinen „Kacheln” und liest diese Stückchen in einer festen Reihenfolge, speichert dabei aber auch ab, wo genau jede dieser „Kacheln” vorher lag (oben links, in der Mitte, …). Jede dieser „Kacheln” wird gewissermaßen zu einem Token*; die Positionsangaben ermöglichen es, den räumlichen Zusammenhang wiederherzustellen. Ein Bild wird zu einer Abfolge, weil es vom Modell als solche festgelegt und die „Koordinaten” festgehalten wurden.
Ein Bild gibt keine Leserichtung vor. Das Modell legt ein Raster darüber, liest die Kacheln in einer festgelegten Reihenfolge und merkt sich, wo jede einzelne lag.
* Ein Bild-„Token” ist eine Ansammlung von Zahlen, die eine „Kachel” beschreiben. Diese werden, wie bereits beschrieben, zu einer einheitlichen Abfolge, die dann lesbar gemacht wird – hierbei handelt es sich aber nicht um einen „Token” im eigentlichen Sinne, lediglich der Mechanismus ist ähnlich. Hier dient der Begriff zur vereinfachten Veranschaulichung.
Lesen und Schreiben sind verschiedene Skills
Das Modell liest und schreibt eine Abfolge – aber die Eingabe ist nicht gleich die Ausgabe (in ≠ out). Ein Medium zu lesen und eines zu produzieren, sind verschiedene Fähigkeiten, die auch unterschiedlich erlernt werden.
Das bedeutet:
- Ein Modell kann zwar ein Bild einlesen, aber nur Text ausgeben. Genau das ist Claude derzeit: Zeigt man ihm einen Screenshot einer fehlerhaften Checkout-Seite, beschreibt es in Worten, was nicht stimmt – aber es gibt kein Bild zurück.
- Manche Modelle können Bilder erzeugen. Unterschiedliche Fähigkeiten, unterschiedliche Mechanismen.
- Auch bei Audio gibt es diese Unterscheidung: Manche Modelle können zuhören (Audioeingang), andere können auch sprechen (Audioausgang).
- Das Modell, das Audio ein- und ausgibt und dabei schnell genug ist, um mit einem Live-Gespräch Schritt zu halten, ist das Besondere – und genau das ist es, was ein Telefonat erfordert.
| Kombination | Was das bedeutet |
|---|---|
| Bild verstehen, Text erzeugen | Das Modell beschreibt einen Screenshot in Worten, kann aber selbst kein Bild liefern. |
| Text verstehen, Bild erzeugen | Bildgenerierung – eine eigene Fähigkeit mit eigener Technik. |
| Sprache verstehen, Text erzeugen | Das Modell hört zu, antwortet aber nur schriftlich. |
| Sprache verstehen und sprechen, in Echtzeit | Die anspruchsvollste Kombination und die Voraussetzung für ein Telefongespräch. |
Fazit
Ein KI-Modell ist eine riesige Wissensmaschine, die eine geordnete Folge von Tokens – Text, Ton oder Bild – aufnimmt und diese durch eine geordnete Folge von Tokens fortsetzt; wobei das, was es aufnehmen kann, und das, was es ausgeben kann, zwei unterschiedliche Listen sind.
Sobald man verstanden hat, dass Eingabemedium, Ausgabemedium und die Geschwindigkeit eines Modells verschiedene Regler sind, fragt man sich, wie genau die richtigen Informationen im Endeffekt zu den Nutzer*innen – im Falle des Kundenservice zu den Kund*innen – kommen. Das Wissen erreicht sie über Kanäle – per Telefon, per E-Mail, per Chat –, und dafür zu sorgen, dass die Antwort die Kund*innen tatsächlich in einer für sie nutzbaren Form erreicht, ist ein ganz anderes Problem, mit dem wir uns in unserem Folgeartikel befassen werden.



