Tool overview
O que é Contador de Tokens LLM?
Contador de Tokens LLM é uma ferramenta que ajuda você a contar tokens com mapa de limites codificado por cores.
Por que usar Contador de Tokens LLM?
Melhora a legibilidade e acelera seu fluxo quando você precisa contar tokens com mapa de limites codificado por cores, sem enviar dados a um servidor.
Recursos principais
Privacidade no cliente, resultados instantâneos e cópia com um clique para contador de Tokens LLM. Contar tokens com mapa de limites codificado por cores
Como usar
Siga estes passos para obter resultados precisos com a ferramenta acima.
- Cole o texto exato que enviará ao modelo: prompt de sistema, mensagem do usuário, JSON de ferramentas ou um bloco RAG concatenado.
- Compare os três cartões de codificação — o200k_base para GPT-4o, cl100k_base para GPT-4 / aproximação Claude, p50k_base para Codex legado.
- Abra o mapa de limites de tokens e passe o mouse para ver Token IDs; mude a codificação do mapa ao trocar de modelo.
- Clique em Minify JSON para schemas e payloads de ferramentas, ou Strip Spaces para prosa com preenchimento, e reconte.
- Informe o volume mensal estimado para projetar o custo de entrada de GPT-4o, GPT-4o mini e Claude 3.5 Sonnet.
- Copie as métricas multi-codificação para o doc de design, ticket ou PR para compartilhar um único número de orçamento.
- Itere: remova primeiro o few-shot ou seção de schema mais cara, reconte e mantenha 10–20% de margem para wrappers de chat.
- Para stacks de agentes, vá ao AI Agent Builder para montar tools + MCP + prompt e rever o orçamento combinado.
Contador de tokens LLM — guia completo e casos de uso
Guia autoritativo: codificações, orçamento passo a passo, casos reais, correções de overflow, mapa de limites e notas de preço — aplicável ao cockpit acima.
Guia do contador de tokens LLM — comece aqui
Esta página é o guia canônico para contar tokens LLM no navegador com DevUtilities. Use o Prompt Budget Cockpit interativo acima enquanto lê, ou salte para um tópico abaixo. Tudo roda no cliente via js-tiktoken — prompts nunca saem da sua máquina.
O que o Prompt Budget Cockpit faz
O LLM Token Counter (Prompt Budget Cockpit) tokeniza texto com as mesmas tabelas BPE que a OpenAI inclui no tiktoken. Compara três codificações lado a lado, visualiza limites de tokens, estima o custo de entrada para GPT-4o, GPT-4o mini e Claude 3.5 Sonnet, e ajuda a reduzir prompts antes de chegarem a uma API de produção.
O que você obtém
- Contagens concorrentes para o200k_base (GPT-4o), cl100k_base (aproximação GPT-4 / Claude) e p50k_base (Codex legado)
- Token Boundary Map com código de cores e Token IDs ao passar o mouse
- Ações Minify JSON e Strip Spaces para reduzir o peso do prompt
- Extrapolações de custo por consulta e mensais a partir de tarifas de entrada publicadas estáticas
- Métricas multi-codificação copiáveis para docs de design e revisões de orçamento
Use esta ferramenta quando
- Precisar saber se um system prompt + tools + mensagem do usuário cabe numa janela de contexto
- Estiver comparando orçamentos de tokens GPT-4o vs estilo Claude antes de escolher um modelo
- Quiser uma contagem local e privada sem chamar APIs OpenAI ou Anthropic
- Estiver cortando chunks RAG, exemplos few-shot ou schemas JSON que inflacionam o custo
Não espere
- Faturamento Claude idêntico byte a byte — a Anthropic usa outro tokenizador de produção; cl100k_base é uma aproximação útil em inglês
- Overhead do wrapper de chat (tags de papel, envelopes de tools) que as APIs adicionam ao redor do texto bruto
- Preços de mercado ao vivo — o painel de custos usa tarifas publicadas estáticas que podem divergir
o200k vs cl100k vs p50k — escolha a codificação certa
Token IDs são específicos da codificação. A mesma frase em inglês pode produzir comprimentos e IDs diferentes sob o200k_base vs cl100k_base. Orce sempre com a codificação que seu modelo-alvo realmente usa.
Codificações comparadas neste workspace
| Codificação | Modelos típicos | Quando usar aqui |
|---|---|---|
| o200k_base | GPT-4o, GPT-4o mini | Padrão para chat OpenAI moderno e os cartões de custo da família GPT-4o |
| cl100k_base | GPT-4, GPT-4 Turbo, GPT-3.5 Turbo; Claude approximation | Orçamentos de chat OpenAI legado e estimativas aproximadas Claude em inglês |
| p50k_base | Legacy Codex / older completion models | Comparações históricas e pipelines de completion mais antigos |
Altere a codificação do Token Boundary Map independentemente dos cartões de comparação quando precisar inspecionar merges de uma família de modelos específica.
Passo a passo: contar, otimizar e copiar um orçamento
Siga este passo a passo na primeira vez que abrir o cockpit. Depois, a maioria das sessões é colar → comparar → otimizar → copiar.
- Cole o payload completo do prompt que importa: mensagem de sistema, turno do usuário, JSON de tools ou um bloco de contexto RAG concatenado.
- Leia os três cartões de comparação. Anote qual codificação é a mais alta — esse é seu orçamento conservador se ainda precisar escolher um modelo.
- Abra o Token Boundary Map e passe o mouse em spans que pareçam surpreendentemente longos (URLs, emoji, JSON indentado) para ver Token IDs concretos.
- Se a entrada for densa em JSON, clique Minify JSON. Se for prosa com espaços duplos ou quebras de linha preenchidas, clique Strip Spaces.
- Informe seu volume mensal estimado de chamadas para projetar o gasto de entrada de GPT-4o, GPT-4o mini e Claude 3.5 Sonnet.
- Copie o resumo de métricas para um doc de design, ticket ou descrição de PR para que a equipe compartilhe um único número.
Como é um resultado «bom»
- System + tools + turno médio do usuário deixam margem para a resposta do modelo dentro da janela de contexto escolhida
- Schemas JSON são minificados em prompts de produção mesmo se humanos editam cópias formatadas
- Extrapolações de custo usam a codificação que corresponde ao modelo faturado
Caso de uso: parar overflow do prompt de sistema
Problema: um prompt de agente de suporte trunca no meio da conversa depois que você adiciona políticas, regras de tom e três exemplos few-shot.
Como esta ferramenta resolve
- Cole o system prompt atual sozinho e registre a contagem o200k_base (ou cl100k_base).
- Anexe cada exemplo few-shot um de cada vez e anote o delta — remova primeiro o exemplo menos valioso.
- Cole uma mensagem de usuário representativa e o JSON de tools enviado em cada chamada; some as peças contra a janela de contexto do seu modelo.
- Use Strip Spaces na prosa e Minify JSON nos schemas, depois reconte para quantificar a economia.
- Copie o orçamento final para o runbook do agente para que edições futuras do prompt fiquem sob o mesmo teto.
Resultado: você sabe exatamente qual seção estourou o orçamento e quantos tokens cada otimização recuperou — antes de outro truncamento em produção.
Caso de uso: cortar desperdício de tokens em schemas OpenAI
Problema: schemas de function-calling da OpenAI são escritos com indentação para legibilidade e depois colados em requests ao vivo. O gasto de tokens sobe embora o schema lógico não tenha mudado.
Como esta ferramenta resolve
- Cole o array tools ou o objeto parameters formatado no painel de entrada.
- Anote a contagem de tokens na codificação do seu modelo de API (geralmente o200k_base para GPT-4o).
- Clique Minify JSON e compare a nova contagem — a diferença é puro imposto de espaços em branco.
- Inspecione o boundary map: chaves repetidas e listas enum longas costumam dominar; encurte descrições antes de cortar campos.
- Envie o schema minificado nas chamadas API; mantenha a cópia formatada só no controle de versão ou no editor do Agent Builder.
Resultado: menor custo de entrada em cada chamada com tools sem mudar o comportamento das ferramentas.
Caso de uso: projetar gasto mensal de entrada LLM
Problema: finanças pede uma estimativa mensal de gasto LLM antes de lançar um recurso que chamará o modelo milhares de vezes.
Como esta ferramenta resolve
- Monte um payload médio realista (system + tools + texto típico do usuário) e cole aqui.
- Confirme o cartão de comparação da codificação que corresponde ao seu modelo de produção.
- Defina Estimated monthly volume com a contagem de chamadas projetada.
- Leia as colunas mensais GPT-4o, GPT-4o mini e Claude 3.5 Sonnet para comparar fornecedores no mesmo payload.
- Documente que as tarifas são preços de entrada publicados estáticos — atualize a estimativa quando os fornecedores mudarem as páginas de preços.
Resultado: uma previsão defensável e específica do payload em vez de um chute vago de que «tokens são baratos».
Caso de uso: dimensionar chunks RAG com orçamento rígido
Problema: um pipeline RAG recupera cinco chunks por consulta. Alguns são sobretudo espaços ou cabeçalhos boilerplate, e o modelo ainda erra a resposta porque o texto útil foi truncado.
Como esta ferramenta resolve
- Cole cada chunk candidato separadamente e registre contagens sob a codificação do seu modelo de retrieval.
- Prefira chunks mais densos: Strip Spaces, remova cabeçalhos de navegação repetidos e elimine parágrafos quase duplicados.
- Concatene o conjunto top-k que planeja enviar e verifique se o total ainda deixa espaço para a pergunta e a resposta.
- Use o boundary map para detectar sequências caras para o tokenizador (URLs longas, tabelas, emoji) que parecem curtas aos humanos.
- Defina um orçamento rígido de tokens por consulta no seu retriever usando os totais medidos com esta ferramenta.
Resultado: a retrieval empacota mais sinal por token e falha menos por truncamento silencioso de contexto.
Correção: context_length_exceeded e truncamento silencioso
Sintomas: API 400 context_length_exceeded, completions truncadas ou agentes que «esquecem» instruções iniciais no meio da sessão.
Por que acontece
O system prompt, tools, histórico e turno do usuário combinados excedem a janela de contexto do modelo. JSON formatado e bancos few-shot longos são ofensores silenciosos comuns.
Diagnosticar
Cole o payload exato que seu cliente envia (ou reconstrua-o). Compare o total de tokens com a janela de contexto listada para seu modelo. Identifique as maiores seções contando-as isoladamente.
Correções
- Minify JSON schemas de tools e remova excesso de espaços em branco da prosa.
- Mova políticas raramente usadas para retrieval sob demanda em vez do system prompt sempre ativo.
- Limite o histórico de chat (resuma ou descarte os turnos mais antigos) antes de cada chamada.
- Mude para um modelo de contexto maior só depois de medir — não chute.
Reconte após cada mudança. Um corte de 10% de espaços em um blob de tools de 8k tokens costuma recuperar mais margem do que apagar um parágrafo curto de política.
Correção: contagens locais discordam do uso da API
Sintomas: contagens locais parecem ok, mas dashboards de uso da OpenAI discordam — ou Claude fatura diferente da sua planilha.
Por que acontece
Você orçou com a codificação errada, ou comparou texto bruto com uma API que envolve mensagens com envelopes de papel e tools.
Diagnosticar
Confirme o tokenizador documentado do modelo. Para a família GPT-4o use o200k_base; para GPT-4 / 3.5 use cl100k_base. Trate números Claude aqui apenas como aproximações.
Correções
- Mude o foco de comparação e o boundary map para a codificação correspondente.
- Conte as mensagens serializadas que seu SDK realmente envia, não só o rascunho legível do prompt.
- Adicione um pequeno buffer de overhead (muitas vezes de dezenas a algumas centenas de tokens) para formatação de chat ao planejar limites rígidos.
- Para faturamento Anthropic, valide prompts críticos no contador da própria Anthropic antes de travar SLAs.
Correção: JSON formatado e linhas em branco inflacionam tokens
Sintomas: a contagem de tokens cai drasticamente após Minify JSON ou Strip Spaces sem mudança semântica do prompt.
Por que acontece
Codificações BPE cobram por newlines de indentação, espaços de alinhamento e linhas em branco repetidas. Humanos ignoram; tokenizadores não.
Diagnosticar
Cole o payload formatado, anote a contagem, execute Minify JSON / Strip Spaces e compare. Deltas grandes significam que espaços em branco eram um motor principal de custo.
Correções
- Guarde JSON formatado editável por humanos no git; minify no momento da request.
- Evite diagramas ASCII preenchidos ou logs enormes indentados dentro de system prompts.
- Colapse separadores de seção com várias linhas em branco em docs de política longos.
O boundary map torna tokens de espaço visíveis como spans coloridos separados — útil ao ensinar a equipe por que minify importa.
Como ler o mapa de limites de tokens
O Token Boundary Map pinta cada merge BPE como um span colorido. As cores ciclam só para separação visual — não codificam categorias de token.
Como ler
- Passe o mouse em um span para revelar seu Token ID numérico da codificação do mapa selecionada
- Spans longos ininterruptos em URLs ou base64 costumam significar chunks caros de um ou poucos tokens que valem encurtar
- Emoji e texto CJK podem usar mais tokens que prosa latina do mesmo comprimento visual
- Mude a codificação do mapa ao comparar como GPT-4o vs GPT-4 segmentariam a mesma string
Como funciona o extrapolador de custos
Cartões de custo multiplicam contagens locais de tokens por tarifas de entrada publicadas estáticas: GPT-4o $5 / 1M, GPT-4o mini $0.15 / 1M, Claude 3.5 Sonnet $3 / 1M. O volume mensal escala o custo por consulta.
Ressalvas
- Tokens de saída não estão incluídos — adicione estimativas de completion separadamente para o TCO completo
- Descontos de input em cache ou em lote não são modelados
- Preços de lista dos fornecedores mudam; trate os números como ajudas de planejamento, não faturas
Boas práticas de orçamento de tokens
- Orce com a codificação que corresponde à produção e mantenha margem de segurança de 10–20% para wrappers de chat e retries
- Conte a forma completa da request (system + tools + histórico + usuário), não só o system prompt
- Minify JSON consumido por máquinas; mantenha cópias formatadas para humanos
- Reconte sempre que adicionar exemplos few-shot, configs MCP ou apêndices longos de política
- Use projeções de volume mensal em revisões de design para que o custo fique visível antes do lançamento
- Prefira contagem local para prompts proprietários — esta ferramenta nunca faz upload do seu texto
Referência de tokenizador e tokens especiais
Cores de limite mapeiam para codificações byte-pair do tiktoken. Tokens especiais como <|endoftext|> são contados quando presentes como texto literal.
Referência de tokenizador e tokens especiais
| Tipo de campo | Payload de exemplo | Regra estrutural |
|---|---|---|
| cl100k_base | GPT-4, GPT-4 Turbo, Claude 3 | Codificação de chat OpenAI padrão; ~4 caracteres por token em prosa inglesa; mescla espaços em branco além dos limites de palavra. |
| o200k_base | GPT-4o, GPT-4o mini | Codificação de vocabulário expandido para modelos omni; Token IDs diferem de cl100k_base para strings idênticas. |
| <|endoftext|> | <|endoftext|> | Token de controle reservado que marca limites de documento em corpora de treinamento GPT; conta como um único token quando literal. |
| Unicode emoji | 🚀 | Frequentemente 1–3 tokens conforme a codificação; grafemas multi-codepoint podem dividir-se em vários merges BPE. |
| JSON whitespace | {\n "key": "value"\n} | Newlines e espaços de indentação consomem tokens — minify payloads JSON antes de contar o uso de contexto. |
Perguntas frequentes
Respostas para problemas comuns e questões de privacidade de dados.
Ferramentas relacionadas
Explore outros utilitários relacionados que complementam esta ferramenta.
Documentação oficial e referências
Especificações e documentação da plataforma para esta utilidade.