Tool overview
Что такое Счётчик токенов LLM?
Счётчик токенов LLM — инструмент, который помогает подсчёт токенов с цветовой картой лимитов.
Зачем использовать Счётчик токенов LLM?
Повышает читаемость и скорость работы, когда нужно подсчёт токенов с цветовой картой лимитов, без отправки данных на сервер.
Ключевые возможности
Конфиденциальность на стороне клиента, мгновенный результат и копирование в один клик. Подсчёт токенов с цветовой картой лимитов
Как использовать
Следуйте этим шагам, чтобы получить точные результаты с инструментом выше.
- Вставьте точный текст, который уйдёт в модель: системный промпт, сообщение пользователя, JSON инструментов или склеенный RAG-контекст.
- Сравните три карточки кодировок — o200k_base для GPT-4o, cl100k_base для GPT-4 / приближения Claude, p50k_base для legacy Codex.
- Откройте карту границ токенов и наведите курсор, чтобы увидеть Token ID; меняйте кодировку карты при смене модели.
- Нажмите Minify JSON для схем и tool-payloads или Strip Spaces для прозы с лишними пробелами, затем пересчитайте.
- Введите ожидаемый месячный объём, чтобы спрогнозировать стоимость ввода GPT-4o, GPT-4o mini и Claude 3.5 Sonnet.
- Скопируйте метрики по кодировкам в дизайн-док, тикет или PR, чтобы у команды было одно число бюджета.
- Итерируйте: сначала уберите самый дорогой few-shot или участок схемы, пересчитайте и оставьте запас 10–20% на chat-обёртки.
- Для стеков агентов перейдите в AI Agent Builder, соберите tools + MCP + промпт и снова проверьте суммарный бюджет.
Счётчик токенов LLM — полное руководство и сценарии
Авторитетное руководство: кодировки, пошаговый бюджет, реальные сценарии, исправления переполнения, карта границ и заметки о ценах — всё применимо к кокпиту выше.
Руководство по счётчику токенов LLM — начните здесь
Эта страница — каноническое руководство по подсчёту токенов LLM в браузере с DevUtilities. Используйте интерактивный Prompt Budget Cockpit выше во время чтения или перейдите к теме ниже. Всё выполняется на клиенте через js-tiktoken — промпты не покидают ваш компьютер.
Что делает Prompt Budget Cockpit
LLM Token Counter (Prompt Budget Cockpit) токенизирует текст теми же таблицами BPE, что OpenAI поставляет в tiktoken. Он сравнивает три кодировки рядом, визуализирует границы токенов, оценивает стоимость ввода для GPT-4o, GPT-4o mini и Claude 3.5 Sonnet и помогает сжать промпты до попадания в production API.
Что вы получаете
- Параллельные подсчёты для o200k_base (GPT-4o), cl100k_base (приближение GPT-4 / Claude) и p50k_base (legacy Codex)
- Цветная Token Boundary Map с Token ID при наведении
- Действия Minify JSON и Strip Spaces для снижения веса промпта
- Экстраполяции стоимости на запрос и в месяц по статическим опубликованным тарифам ввода
- Копируемые мульти-кодировочные метрики для дизайн-доков и бюджетных ревью
Используйте этот инструмент, когда
- Нужно знать, влезает ли system prompt + tools + сообщение пользователя в окно контекста
- Сравниваете бюджеты токенов GPT-4o и в стиле Claude перед выбором модели
- Нужен локальный, приватный подсчёт без вызовов API OpenAI или Anthropic
- Обрезаете RAG-чанки, few-shot примеры или JSON-схемы, раздувающие стоимость
Не ожидайте
- Побитовой идентичности биллинга Claude — Anthropic использует другой production-токенизатор; cl100k_base — полезное английское приближение
- Накладных расходов chat-обёртки (теги ролей, envelope инструментов), которые API добавляют вокруг сырого текста
- Живых рыночных цен — панель стоимости использует статические опубликованные тарифы, которые могут устареть
o200k vs cl100k vs p50k — выберите нужную кодировку
Token ID зависят от кодировки. Одна и та же английская фраза может дать разную длину и разные ID под o200k_base и cl100k_base. Всегда бюджетируйте с кодировкой, которую реально использует целевая модель.
Кодировки, сравниваемые в этом workspace
| Кодировка | Типичные модели | Когда использовать здесь |
|---|---|---|
| o200k_base | GPT-4o, GPT-4o mini | По умолчанию для современного чата OpenAI и карточек стоимости семейства GPT-4o |
| cl100k_base | GPT-4, GPT-4 Turbo, GPT-3.5 Turbo; Claude approximation | Бюджеты legacy-чата OpenAI и грубые английские оценки Claude |
| p50k_base | Legacy Codex / older completion models | Исторические сравнения и старые completion-пайплайны |
Переключайте кодировку Token Boundary Map независимо от карточек сравнения, когда нужно проверить merges конкретной семьи моделей.
Пошагово: посчитать, оптимизировать и скопировать бюджет
Следуйте этому обзору при первом открытии cockpit. Затем большинство сессий — вставить → сравнить → оптимизировать → скопировать.
- Вставьте полный payload промпта: системное сообщение, ход пользователя, JSON инструментов или склеенный RAG-контекст.
- Прочитайте три карточки сравнения. Отметьте самую высокую кодировку — это консервативный бюджет, если модель ещё не выбрана.
- Откройте Token Boundary Map и наведите на неожиданно длинные spans (URL, emoji, indented JSON), чтобы увидеть конкретные Token ID.
- Если ввод JSON-тяжёлый, нажмите Minify JSON. Если проза с двойными пробелами или padded newlines — Strip Spaces.
- Введите оценочный месячный объём вызовов, чтобы спрогнозировать затраты на ввод GPT-4o, GPT-4o mini и Claude 3.5 Sonnet.
- Скопируйте сводку метрик в дизайн-док, тикет или описание PR, чтобы команда делила одно число.
Как выглядит «хорошо»
- System + tools + средний ход пользователя оставляют запас для ответа модели в выбранном окне контекста
- JSON-схемы minify в production-промптах, даже если люди правят pretty-копии
- Экстраполяции стоимости используют кодировку, совпадающую с биллируемой моделью
Сценарий: остановить переполнение системного промпта
Проблема: промпт агента поддержки обрезается mid-conversation после добавления политик, правил тона и трёх few-shot примеров.
Как это решает инструмент
- Вставьте текущий system prompt отдельно и запишите счёт o200k_base (или cl100k_base).
- Добавляйте каждый few-shot пример по одному и отмечайте дельту — сначала уберите наименее ценный.
- Вставьте типичное сообщение пользователя и tools JSON, отправляемый на каждый вызов; суммируйте части относительно окна контекста модели.
- Используйте Strip Spaces на прозе и Minify JSON на схемах, затем пересчитайте, чтобы измерить экономию.
- Скопируйте итоговый бюджет в runbook агента, чтобы будущие правки промпта оставались под тем же потолком.
Итог: вы точно знаете, какой раздел взорвал бюджет и сколько токенов вернула каждая оптимизация — до следующего production-усечения.
Сценарий: сократить токены в схемах инструментов OpenAI
Проблема: схемы function-calling OpenAI пишут с отступами для читаемости, затем вставляют в live-запросы. Расход токенов растёт, хотя логическая схема не менялась.
Как это решает инструмент
- Вставьте pretty-printed массив tools или объект parameters во входную панель.
- Запишите число токенов в кодировке вашей API-модели (обычно o200k_base для GPT-4o).
- Нажмите Minify JSON и сравните новый счёт — разница чистый налог на пробелы.
- Проверьте boundary map: повторяющиеся ключи и длинные enum часто доминируют; сокращайте описания до удаления полей.
- Отправляйте minify-схему в API-вызовах; pretty-копию держите только в git или редакторе Agent Builder.
Итог: ниже стоимость ввода на каждом вызове с tools без изменения поведения инструментов.
Сценарий: спрогнозировать месячные затраты на ввод LLM
Проблема: финансы просят месячную оценку расходов LLM до запуска фичи, которая вызовет модель тысячи раз.
Как это решает инструмент
- Соберите реалистичный средний payload (system + tools + типичный текст пользователя) и вставьте сюда.
- Подтвердите карточку сравнения для кодировки, совпадающей с production-моделью.
- Установите Estimated monthly volume на прогнозируемое число вызовов.
- Прочитайте месячные столбцы GPT-4o, GPT-4o mini и Claude 3.5 Sonnet, чтобы сравнить вендоров на одном payload.
- Задокументируйте, что тарифы — статические опубликованные цены ввода; обновляйте оценку при смене страниц цен.
Итог: защитимый, payload-специфичный прогноз вместо расплывчатого «токены дешёвые».
Сценарий: размер RAG-чанков под жёсткий бюджет токенов
Проблема: RAG-пайплайн достаёт пять чанков на запрос. Часть — в основном пробелы или boilerplate-заголовки, и модель всё равно пропускает ответ из-за усечения полезного текста.
Как это решает инструмент
- Вставляйте каждый кандидатный чанк отдельно и записывайте счёт в кодировке модели retrieval.
- Предпочитайте более плотные чанки: Strip Spaces, уберите повторяющиеся навигационные заголовки и почти-дубликаты абзацев.
- Склейте top-k набор, который планируете отправить, и проверьте, что сумма ещё оставляет место для вопроса и ответа.
- Используйте boundary map, чтобы найти дорогие для токенизатора последовательности (длинные URL, таблицы, emoji), кажущиеся короткими людям.
- Задайте жёсткий бюджет токенов на запрос в retriever по измеренным итогам этого инструмента.
Итог: retrieval упаковывает больше сигнала на токен и реже падает из-за тихого усечения контекста.
Исправление: context_length_exceeded и тихое усечение
Симптомы: API 400 context_length_exceeded, усечённые completion или агенты, которые «забывают» ранние инструкции mid-session.
Почему так происходит
Сумма system prompt, tools, истории и хода пользователя превышает окно контекста модели. Pretty JSON и длинные few-shot банки — частые тихие виновники.
Диагностика
Вставьте точный payload, который шлёт клиент (или восстановите его). Сравните сумму токенов с окном контекста модели. Найдите крупнейшие разделы, считая их по отдельности.
Исправления
- Minify JSON схем инструментов и уберите лишние пробелы из прозы.
- Перенесите редко используемые политики в on-demand retrieval вместо всегда-включённого system prompt.
- Ограничьте историю чата (суммируйте или отбрасывайте старые ходы) перед каждым вызовом.
- Переходите на модель с большим контекстом только после измерения — не гадайте.
Пересчитывайте после каждого изменения. Срез 10% пробелов на 8k-токенном tools-блобе часто даёт больше запаса, чем удаление короткого абзаца политики.
Исправление: локальный подсчёт не совпадает с API
Симптомы: локальные счёты выглядят нормально, но дашборды usage OpenAI расходятся — или Claude биллит иначе, чем таблица.
Почему так происходит
Вы бюджетировали с неверной кодировкой или сравнили сырой текст с API, который оборачивает сообщения role- и tool-envelope.
Диагностика
Подтвердите документированный токенизатор модели. Для семейства GPT-4o — o200k_base; для GPT-4 / 3.5 — cl100k_base. Цифры Claude здесь только приближения.
Исправления
- Переключите фокус сравнения и boundary map на совпадающую кодировку.
- Считайте сериализованные сообщения, которые SDK реально отправляет, а не только читаемый черновик промпта.
- Добавьте небольшой буфер накладных расходов (часто десятки–сотни токенов) на форматирование чата при жёстких лимитах.
- Для биллинга Anthropic проверяйте критические промпты собственным счётчиком Anthropic до фиксации SLA.
Исправление: pretty JSON и пустые строки раздувают токены
Симптомы: число токенов резко падает после Minify JSON или Strip Spaces без семантического изменения промпта.
Почему так происходит
BPE-кодировки тарифицируют отступы-newlines, пробелы выравнивания и повторяющиеся пустые строки. Люди их игнорируют; токенизаторы — нет.
Диагностика
Вставьте pretty payload, запишите счёт, запустите Minify JSON / Strip Spaces и сравните. Большие дельты значат, что пробелы были главным драйвером стоимости.
Исправления
- Храните человеко-редактируемый pretty JSON в git; minify во время запроса.
- Избегайте padded ASCII-диаграмм или огромных indented логов в system prompts.
- Схлопывайте многопустые разделители секций в длинных policy-доках.
Boundary map делает токены пробелов видимыми как отдельные цветные spans — полезно, когда учите команду, почему minify важен.
Как читать карту границ токенов
Token Boundary Map рисует каждый BPE-merge цветным span. Цвета циклируются только для визуального разделения — они не кодируют категории токенов.
Как читать
- Наведите на span, чтобы увидеть числовой Token ID для выбранной кодировки карты
- Длинные непрерывные spans на URL или base64 часто означают дорогие одно-/малотокенные куски, которые стоит укоротить
- Emoji и CJK-текст могут использовать больше токенов, чем латинская проза той же визуальной длины
- Меняйте кодировку карты, сравнивая, как GPT-4o и GPT-4 сегментируют одну строку
Как работает экстраполятор стоимости
Карточки стоимости умножают локальные счёты токенов на статические опубликованные тарифы ввода: GPT-4o $5 / 1M, GPT-4o mini $0.15 / 1M, Claude 3.5 Sonnet $3 / 1M. Месячный объём масштабирует стоимость за запрос.
Оговорки
- Токены вывода не включены — добавьте оценки completion отдельно для полного TCO
- Скидки cached-input или batch не моделируются
- Прайс-листы вендоров меняются; считайте цифры помощниками планирования, не счетами
Лучшие практики бюджета токенов
- Бюджетируйте с кодировкой production, затем держите запас 10–20% на chat-обёртки и retries
- Считайте полную форму запроса (system + tools + история + пользователь), не только system prompt
- Minify JSON для машин; pretty-копии оставляйте людям
- Пересчитывайте при добавлении few-shot, MCP-конфигов или длинных policy-приложений
- Используйте проекции месячного объёма на дизайн-ревью, чтобы стоимость была видна до запуска
- Предпочитайте локальный подсчёт для проприетарных промптов — инструмент никогда не загружает ваш текст
Справка по токенизатору и спецтокенам
Цвета границ соответствуют byte-pair кодировкам tiktoken. Спецтокены вроде <|endoftext|> считаются, когда присутствуют как литеральный текст.
Справка по токенизатору и спецтокенам
| Тип поля | Пример payload | Структурное правило |
|---|---|---|
| cl100k_base | GPT-4, GPT-4 Turbo, Claude 3 | Кодировка чата OpenAI по умолчанию; ~4 символа на токен для английской прозы; сливает пробелы через границы слов. |
| o200k_base | GPT-4o, GPT-4o mini | Кодировка с расширенным словарём для omni-моделей; Token ID отличаются от cl100k_base для одинаковых строк. |
| <|endoftext|> | <|endoftext|> | Зарезервированный control-токен границ документов в GPT-корпусах; считается одним токеном, если литеральный. |
| Unicode emoji | 🚀 | Часто 1–3 токена в зависимости от кодировки; multi-codepoint графемы могут делиться на несколько BPE-merge. |
| JSON whitespace | {\n "key": "value"\n} | Отступы-newlines и пробелы потребляют токены — minify JSON-payloads перед подсчётом использования контекста. |
Часто задаваемые вопросы
Развёрнутые ответы на типичные проблемы отладки и вопросы конфиденциальности данных.
Связанные инструменты
Ознакомьтесь с другими связанными утилитами, дополняющими этот инструмент.
Официальная документация и ссылки
Авторитетные спецификации и документация платформы для этой утилиты.