Tool overview
Was ist LLM-Token-Zähler?
LLM-Token-Zähler ist ein Tool, mit dem Sie tokens mit farbcodierter Grenzkarte zählen.
Warum LLM-Token-Zähler verwenden?
Es verbessert die Lesbarkeit und beschleunigt Ihren Workflow, wenn Sie tokens mit farbcodierter Grenzkarte zählen—vollständig im Browser ohne Server-Uploads.
Hauptfunktionen
Clientseitige Privatsphäre, sofortige Ergebnisse und Ein-Klick-Kopie für lLM-Token-Zähler. Tokens mit farbcodierter Grenzkarte zählen
Anwendung
Befolgen Sie diese Schritte für genaue Ergebnisse mit dem Tool oben.
- Fügen Sie den exakten Text ein, den Sie an das Modell senden: System-Prompt, User-Nachricht, Tool-JSON oder einen verketteten RAG-Kontextblock.
- Vergleichen Sie die drei Encoding-Karten — o200k_base für GPT-4o, cl100k_base für GPT-4 / Claude-Näherung, p50k_base für Legacy-Codex.
- Öffnen Sie die Token-Boundary-Map und hovern Sie Spans für Token-IDs; wechseln Sie die Map-Kodierung bei Modellwechsel.
- Klicken Sie Minify JSON für Schemas und Tool-Payloads oder Strip Spaces für gepolsterte Prosa, dann erneut zählen.
- Geben Sie das geschätzte Monatsvolumen ein, um Input-Kosten für GPT-4o, GPT-4o mini und Claude 3.5 Sonnet zu projizieren.
- Kopieren Sie Multi-Encoding-Metriken in Design-Doc, Ticket oder PR, damit das Team eine Budgetzahl teilt.
- Iterieren: entfernen Sie zuerst den teuersten Few-Shot oder Schema-Abschnitt, zählen Sie neu und behalten Sie 10–20 % Sicherheitsmarge für Chat-Wrapper.
- Für Agent-Stacks wechseln Sie zum AI Agent Builder, um Tools + MCP + Prompt zu bauen und das kombinierte Budget zu prüfen.
LLM-Token-Zähler — vollständiger Leitfaden & Anwendungsfälle
Maßgebliche Anleitung: Kodierungen, schrittweises Budgetieren, echte Anwendungsfälle, Overflow-Fixes, Boundary-Map und Preisnotizen — direkt mit dem Cockpit oben nutzbar.
LLM-Token-Zähler-Leitfaden — hier starten
Diese Seite ist der kanonische Leitfaden zum Zählen von LLM-Tokens im Browser mit DevUtilities. Nutzen Sie das interaktive Prompt Budget Cockpit oben beim Lesen oder springen Sie zu einem Thema unten. Alles läuft clientseitig über js-tiktoken — Prompts verlassen nie Ihren Rechner.
Was das Prompt Budget Cockpit leistet
Der LLM Token Counter (Prompt Budget Cockpit) tokenisiert Text mit denselben BPE-Tabellen, die OpenAI in tiktoken liefert. Er vergleicht drei Kodierungen nebeneinander, visualisiert Token-Grenzen, schätzt Input-Kosten für GPT-4o, GPT-4o mini und Claude 3.5 Sonnet und hilft, Prompts zu verkleinern, bevor sie eine Produktions-API treffen.
Was Sie erhalten
- Parallele Zählungen für o200k_base (GPT-4o), cl100k_base (GPT-4-/Claude-Näherung) und p50k_base (Legacy-Codex)
- Farbkodierte Token Boundary Map mit hoverbaren Token IDs
- Aktionen Minify JSON und Strip Spaces zur Reduktion des Prompt-Gewichts
- Kostenextrapolationen pro Anfrage und monatlich aus statischen veröffentlichten Input-Tarifen
- Kopierbare Multi-Kodierungs-Metriken für Design-Docs und Budget-Reviews
Nutzen Sie dieses Tool, wenn
- Sie wissen müssen, ob System-Prompt + Tools + Nutzernachricht in ein Kontextfenster passen
- Sie GPT-4o- vs. Claude-ähnliche Token-Budgets vergleichen, bevor Sie ein Modell wählen
- Sie eine lokale, datenschutzsichere Zählung ohne OpenAI- oder Anthropic-APIs wollen
- Sie RAG-Chunks, Few-Shot-Beispiele oder JSON-Schemas kürzen, die Kosten aufblähen
Erwarten Sie nicht
- Byte-identische Claude-Abrechnung — Anthropic nutzt einen anderen Produktions-Tokenizer; cl100k_base ist eine nützliche englische Näherung
- Chat-Wrapper-Overhead (Rollen-Tags, Tool-Envelopes), den APIs um Rohtext legen
- Live-Marktpreise — das Kostenpanel nutzt statische veröffentlichte Tarife, die abweichen können
o200k vs cl100k vs p50k — richtige Kodierung wählen
Token IDs sind kodierungsspezifisch. Derselbe englische Satz kann unter o200k_base vs cl100k_base unterschiedliche Längen und IDs erzeugen. Budgetieren Sie immer mit der Kodierung, die Ihr Zielmodell tatsächlich nutzt.
In diesem Workspace verglichene Kodierungen
| Kodierung | Typische Modelle | Wann hier nutzen |
|---|---|---|
| o200k_base | GPT-4o, GPT-4o mini | Standard für modernes OpenAI-Chat und die Kostenkarten der GPT-4o-Familie |
| cl100k_base | GPT-4, GPT-4 Turbo, GPT-3.5 Turbo; Claude approximation | Legacy-OpenAI-Chat-Budgets und grobe Claude-Englisch-Schätzungen |
| p50k_base | Legacy Codex / older completion models | Historische Vergleiche und ältere Completion-Pipelines |
Wechseln Sie die Kodierung der Token Boundary Map unabhängig von den Vergleichskarten, wenn Sie Merges für eine bestimmte Modellfamilie prüfen müssen.
Schritt für Schritt: zählen, optimieren, Budget kopieren
Folgen Sie diesem Walkthrough beim ersten Öffnen des Cockpits. Danach sind die meisten Sitzungen Einfügen → Vergleichen → Optimieren → Kopieren.
- Fügen Sie den vollständigen Prompt-Payload ein, der Sie interessiert: Systemnachricht, User-Turn, Tool-JSON oder einen verketteten RAG-Kontextblock.
- Lesen Sie die drei Vergleichskarten. Notieren Sie, welche Kodierung am höchsten ist — das ist Ihr konservatives Budget, falls Sie noch ein Modell wählen müssen.
- Öffnen Sie die Token Boundary Map und hovern Sie über Spans, die überraschend lang wirken (URLs, Emoji, eingerücktes JSON), um konkrete Token IDs zu sehen.
- Bei JSON-lastigem Input klicken Sie Minify JSON. Bei Prosa mit Doppelspaces oder gepolsterten Newlines klicken Sie Strip Spaces.
- Geben Sie Ihr geschätztes monatliches Call-Volumen ein, um GPT-4o-, GPT-4o-mini- und Claude-3.5-Sonnet-Input-Ausgaben zu projizieren.
- Kopieren Sie die Metrik-Zusammenfassung in ein Design-Doc, Ticket oder eine PR-Beschreibung, damit das Team eine Zahl teilt.
So sieht „gut“ aus
- System + Tools + durchschnittlicher User-Turn lassen Spielraum für die Modellantwort im gewählten Kontextfenster
- JSON-Schemas werden in Produktions-Prompts minifiziert, auch wenn Menschen pretty-printed Kopien editieren
- Kostenextrapolationen nutzen die Kodierung, die zum abgerechneten Modell passt
Anwendungsfall: System-Prompt-Überlauf stoppen
Problem: Ein Support-Agent-Prompt wird mitten im Gespräch abgeschnitten, nachdem Sie Richtlinien, Tonregeln und drei Few-Shot-Beispiele hinzugefügt haben.
So löst dieses Tool es
- Fügen Sie den aktuellen System-Prompt allein ein und notieren Sie die o200k_base- (oder cl100k_base-) Zählung.
- Hängen Sie jedes Few-Shot-Beispiel einzeln an und notieren Sie das Delta — streichen Sie zuerst das am wenigsten wertvolle Beispiel.
- Fügen Sie eine repräsentative Nutzernachricht und das Tools-JSON ein, das Sie bei jedem Call senden; summieren Sie die Teile gegen das Kontextfenster Ihres Modells.
- Nutzen Sie Strip Spaces auf Prosa und Minify JSON auf Schemas, zählen Sie dann neu, um Einsparungen zu quantifizieren.
- Kopieren Sie das finale Budget in Ihr Agent-Runbook, damit künftige Prompt-Edits unter derselben Decke bleiben.
Ergebnis: Sie wissen genau, welcher Abschnitt das Budget gesprengt hat und wie viele Tokens jede Optimierung zurückgeholt hat — vor einer weiteren Produktions-Truncation.
Anwendungsfall: Token-Verschwendung in OpenAI-Tool-Schemas senken
Problem: OpenAI-Function-Calling-Schemas werden mit Einrückung für Lesbarkeit geschrieben und dann in Live-Requests eingefügt. Der Token-Verbrauch steigt, obwohl das logische Schema unverändert ist.
So löst dieses Tool es
- Fügen Sie das pretty-printed Tools-Array oder Parameters-Objekt in das Eingabefeld ein.
- Notieren Sie die Token-Zählung der Kodierung Ihres API-Modells (meist o200k_base für GPT-4o).
- Klicken Sie Minify JSON und vergleichen Sie die neue Zählung — die Differenz ist reine Whitespace-Steuer.
- Prüfen Sie die Boundary Map: wiederholte Keys und lange Enum-Listen dominieren oft; kürzen Sie Beschreibungen, bevor Sie Felder streichen.
- Liefern Sie das minifizierte Schema in API-Calls; behalten Sie die pretty-Kopie nur in Git oder im Agent-Builder-Editor.
Ergebnis: niedrigere Input-Kosten bei jedem Tool-Call ohne Änderung des Tool-Verhaltens.
Anwendungsfall: monatliche LLM-Input-Kosten prognostizieren
Problem: Finance verlangt eine monatliche LLM-Ausgabenschätzung, bevor Sie ein Feature launchen, das das Modell tausende Male aufruft.
So löst dieses Tool es
- Bauen Sie einen realistischen Durchschnitts-Payload (System + Tools + typischer User-Text) und fügen Sie ihn hier ein.
- Bestätigen Sie die Vergleichskarte für die Kodierung, die zu Ihrem Produktionsmodell passt.
- Setzen Sie Estimated monthly volume auf Ihre projizierte Call-Anzahl.
- Lesen Sie die monatlichen Spalten GPT-4o, GPT-4o mini und Claude 3.5 Sonnet, um Anbieter am gleichen Payload zu vergleichen.
- Dokumentieren Sie, dass Tarife statische veröffentlichte Input-Preise sind — aktualisieren Sie die Schätzung, wenn Anbieter Preis-Seiten ändern.
Ergebnis: eine belastbare, payload-spezifische Prognose statt einer vagen Vermutung „Tokens sind billig“.
Anwendungsfall: RAG-Chunks auf hartes Token-Budget dimensionieren
Problem: Eine RAG-Pipeline holt fünf Chunks pro Query. Manche Chunks sind hauptsächlich Whitespace oder Boilerplate-Header, und das Modell verfehlt die Antwort trotzdem, weil nützlicher Text trunciert wurde.
So löst dieses Tool es
- Fügen Sie jeden Kandidaten-Chunk separat ein und notieren Sie Token-Zählungen unter der Kodierung Ihres Retrieval-Modells.
- Bevorzugen Sie dichtere Chunks: Strip Spaces, entfernen Sie wiederholte Navigations-Header und streichen Sie nahezu doppelte Absätze.
- Verketten Sie das Top-k-Set, das Sie senden wollen, und prüfen Sie, dass die Summe noch Platz für Frage und Antwort lässt.
- Nutzen Sie die Boundary Map, um tokenizer-teure Sequenzen (lange URLs, Tabellen, Emoji) zu finden, die Menschen kurz erscheinen.
- Setzen Sie ein hartes Token-Budget pro Query in Ihrem Retriever anhand der mit diesem Tool gemessenen Totals.
Ergebnis: Retrieval packt mehr Signal pro Token und scheitert seltener an stiller Kontext-Truncation.
Fix: context_length_exceeded und stille Truncation
Symptome: API 400 context_length_exceeded, truncierte Completions oder Agenten, die frühe Anweisungen mitten in der Session „vergessen“.
Warum es passiert
Der kombinierte System-Prompt, Tools, History und User-Turn überschreiten das Kontextfenster des Modells. Pretty-printed JSON und lange Few-Shot-Bänke sind häufige stille Übeltäter.
Diagnose
Fügen Sie den exakten Payload ein, den Ihr Client sendet (oder rekonstruieren Sie ihn). Vergleichen Sie die Token-Summe mit dem für Ihr Modell gelisteten Kontextfenster. Identifizieren Sie die größten Abschnitte, indem Sie sie isoliert zählen.
Fixes
- Minify JSON Tool-Schemas und streichen Sie überschüssigen Whitespace aus Prosa.
- Verschieben Sie selten genutzte Richtlinien in On-Demand-Retrieval statt in den immer aktiven System-Prompt.
- Deckel Chat-History (zusammenfassen oder älteste Turns droppen) vor jedem Call.
- Wechseln Sie erst nach Messung zu einem Modell mit größerem Kontext — nicht raten.
Zählen Sie nach jeder Änderung neu. Ein 10%-Whitespace-Schnitt an einem 8k-Token-Tools-Blob holt oft mehr Spielraum zurück als das Löschen eines kurzen Policy-Absatzes.
Fix: lokale Zählungen weichen von API-Nutzung ab
Symptome: lokale Zählungen wirken in Ordnung, aber OpenAI-Usage-Dashboards widersprechen — oder Claude rechnet anders ab als Ihre Tabelle.
Warum es passiert
Sie haben mit der falschen Kodierung budgetiert oder Rohtext mit einer API verglichen, die Nachrichten mit Rollen- und Tool-Envelopes umschließt.
Diagnose
Bestätigen Sie den dokumentierten Tokenizer des Modells. Für die GPT-4o-Familie o200k_base; für GPT-4 / 3.5 cl100k_base. Behandeln Sie Claude-Zahlen hier nur als Näherungen.
Fixes
- Stellen Sie Vergleichsfokus und Boundary Map auf die passende Kodierung um.
- Zählen Sie die serialisierten Nachrichten, die Ihr SDK tatsächlich sendet, nicht nur den lesbaren Prompt-Entwurf.
- Addieren Sie einen kleinen Overhead-Puffer (oft einige Dutzend bis einige Hundert Tokens) für Chat-Formatierung bei harten Limits.
- Für Anthropic-Abrechnung kritische Prompts gegen Anthropics eigenen Counter validieren, bevor Sie SLAs festziehen.
Fix: Pretty-JSON und Leerzeilen blähen Tokens auf
Symptome: die Token-Zählung fällt nach Minify JSON oder Strip Spaces dramatisch, ohne semantische Prompt-Änderung.
Warum es passiert
BPE-Kodierungen berechnen Indentations-Newlines, Alignment-Spaces und wiederholte Leerzeilen. Menschen ignorieren sie; Tokenizer nicht.
Diagnose
Fügen Sie den pretty Payload ein, notieren Sie die Zählung, führen Sie Minify JSON / Strip Spaces aus und vergleichen Sie. Große Deltas bedeuten, dass Whitespace ein Haupttreiber der Kosten war.
Fixes
- Speichern Sie menscheneditierbares pretty JSON in Git; minifizieren Sie zur Request-Zeit.
- Vermeiden Sie gepolsterte ASCII-Diagramme oder riesige eingerückte Logs in System-Prompts.
- Kollabieren Sie Mehrfach-Leerzeilen-Abschnittsseparatoren in langen Policy-Docs.
Die Boundary Map macht Whitespace-Tokens als separate farbige Spans sichtbar — nützlich, um dem Team zu zeigen, warum Minify zählt.
Token-Boundary-Map lesen
Die Token Boundary Map malt jeden BPE-Merge als farbigen Span. Farben zyklieren nur zur visuellen Trennung — sie kodieren keine Token-Kategorien.
So lesen Sie sie
- Hovern Sie einen Span, um seine numerische Token ID für die gewählte Map-Kodierung zu sehen
- Lange ununterbrochene Spans auf URLs oder Base64 bedeuten oft teure Ein- oder Wenig-Token-Chunks, die sich lohnen zu kürzen
- Emoji und CJK-Text können mehr Tokens nutzen als lateinische Prosa gleicher visueller Länge
- Ändern Sie die Map-Kodierung, wenn Sie vergleichen, wie GPT-4o vs GPT-4 dieselbe Zeichenkette segmentieren würden
So funktioniert der Kosten-Extrapolator
Kostenkarten multiplizieren lokale Token-Zählungen mit statischen veröffentlichten Input-Tarifen: GPT-4o $5 / 1M, GPT-4o mini $0.15 / 1M, Claude 3.5 Sonnet $3 / 1M. Monatliches Volumen skaliert die Kosten pro Query.
Einschränkungen
- Output-Tokens sind nicht enthalten — addieren Sie Completion-Schätzungen separat für volles TCO
- Cached-Input- oder Batch-Rabatte sind nicht modelliert
- Vendor-Listenpreise ändern sich; behandeln Sie Zahlen als Planungshilfen, nicht als Rechnungen
Best Practices für Token-Budgets
- Budgetieren Sie mit der Kodierung, die zur Produktion passt, und halten Sie 10–20 % Sicherheitsmarge für Chat-Wrapper und Retries
- Zählen Sie die volle Request-Form (System + Tools + History + User), nicht nur den System-Prompt
- Minifizieren Sie maschinenverbrauchtes JSON; behalten Sie pretty-Kopien für Menschen
- Zählen Sie neu, sobald Sie Few-Shot-Beispiele, MCP-Configs oder lange Policy-Anhänge hinzufügen
- Nutzen Sie monatliche Volumenprojektionen in Design-Reviews, damit Kosten vor dem Launch sichtbar sind
- Bevorzugen Sie lokales Zählen für proprietäre Prompts — dieses Tool lädt Ihren Text nie hoch
Tokenizer- und Spezialtoken-Referenz
Boundary-Farben mappen auf tiktoken-Byte-Pair-Kodierungen. Spezialtokens wie <|endoftext|> werden gezählt, wenn sie als Literaltext vorliegen.
Tokenizer- & Spezialtoken-Referenz
| Feldtyp | Beispiel-Payload | Strukturelle Regel |
|---|---|---|
| cl100k_base | GPT-4, GPT-4 Turbo, Claude 3 | Standard-OpenAI-Chat-Kodierung; ~4 Zeichen pro Token für englische Prosa; merged Whitespace über Wortgrenzen. |
| o200k_base | GPT-4o, GPT-4o mini | Erweiterte Vokabular-Kodierung für Omni-Modelle; Token IDs unterscheiden sich von cl100k_base bei identischen Strings. |
| <|endoftext|> | <|endoftext|> | Reserviertes Control-Token für Dokumentgrenzen in GPT-Trainingskorpora; zählt als einzelnes Token, wenn literal. |
| Unicode emoji | 🚀 | Oft 1–3 Tokens je nach Kodierung; Multi-Codepoint-Grapheme können über mehrere BPE-Merges splitten. |
| JSON whitespace | {\n "key": "value"\n} | Indentations-Newlines und Spaces verbrauchen Tokens — minifizieren Sie JSON-Payloads vor der Kontextzählung. |
Häufig gestellte Fragen
Antworten zu typischen Fehlern und Datenschutzfragen.
Verwandte Tools
Entdecken Sie weitere verwandte Dienstprogramme, die dieses Tool ergänzen.
Offizielle Dokumentation & Referenzen
Autoritative Spezifikationen und Plattformdokumentation für dieses Tool.