Tool overview
什么是LLM 令牌计数器?
LLM 令牌计数器是一款帮助您使用彩色边界图统计令牌数的开发者工具。
为什么使用LLM 令牌计数器?
在需要使用彩色边界图统计令牌数时提升可读性与效率,且不会将数据上传到服务器。
核心功能
客户端隐私保护、即时结果与一键复制。使用彩色边界图统计令牌数
使用方法
按照以下步骤使用上方工具并获得准确结果。
- 粘贴将发送给模型的完整文本:系统提示、用户消息、工具 JSON 或拼接的 RAG 上下文块。
- 对比三张编码卡片 — GPT-4o 用 o200k_base,GPT-4 / Claude 近似用 cl100k_base,旧版 Codex 用 p50k_base。
- 打开 Token 边界图并悬停查看 Token ID;更换目标模型时切换地图编码。
- 对 Schema 与工具负载点击 Minify JSON,对多余空白的散文点击 Strip Spaces,然后重新计数。
- 输入预估月调用量,推算 GPT-4o、GPT-4o mini 与 Claude 3.5 Sonnet 的输入成本。
- 将多编码指标复制到设计文档、工单或 PR,让团队共用一个预算数字。
- 迭代:先删最贵的 few-shot 或 Schema 段,再计数,并为聊天包装预留 10–20% 余量。
- 智能体栈请到 AI 智能体构建器组装 tools + MCP + 提示,并复查合计预算。
LLM 令牌计数器 — 完整指南与用例
权威指南:编码、分步预算、真实用例、溢出修复、边界图与定价说明 — 均可对照上方驾驶舱操作。
LLM 令牌计数器指南 — 从这里开始
本页是使用 DevUtilities 在浏览器中统计 LLM Token 的权威指南。阅读时可使用上方交互式 Prompt Budget Cockpit,或跳转到下方主题。全部通过 js-tiktoken 在客户端运行 — 提示词不会离开您的设备。
Prompt Budget Cockpit 做什么
LLM Token Counter(Prompt Budget Cockpit)使用与 OpenAI 在 tiktoken 中提供的相同 BPE 表对文本分词。它并排比较三种编码、可视化 Token 边界、估算 GPT-4o、GPT-4o mini 与 Claude 3.5 Sonnet 的输入成本,并帮助您在提示词进入生产 API 之前压缩它们。
您将获得
- o200k_base(GPT-4o)、cl100k_base(GPT-4 / Claude 近似)与 p50k_base(旧版 Codex)的并发计数
- 带悬停 Token ID 的彩色 Token Boundary Map
- 用于减轻提示重量的 Minify JSON 与 Strip Spaces 操作
- 基于静态公开输入费率的单次查询与月度成本外推
- 可复制的多编码指标,用于设计文档与预算评审
在以下情况使用本工具
- 需要确认 system prompt + tools + 用户消息是否装得进上下文窗口
- 在选型前比较 GPT-4o 与 Claude 风格的 Token 预算
- 希望本地、隐私安全地计数,而不调用 OpenAI 或 Anthropic API
- 正在裁剪会抬高成本的 RAG 分块、few-shot 示例或 JSON Schema
请勿期望
- 与 Claude 计费逐字节一致 — Anthropic 使用不同的生产分词器;cl100k_base 是有用的英文近似
- API 在原始文本外附加的聊天包装开销(角色标签、工具信封)
- 实时市场价格 — 成本面板使用可能漂移的静态公开费率
o200k vs cl100k vs p50k — 选择正确编码
Token ID 因编码而异。同一英文句子在 o200k_base 与 cl100k_base 下可能产生不同长度与不同 ID。请始终按目标模型实际使用的编码做预算。
本工作区比较的编码
| 编码 | 典型模型 | 何时在此使用 |
|---|---|---|
| o200k_base | GPT-4o, GPT-4o mini | 现代 OpenAI 聊天与 GPT-4o 系列成本卡片的默认选择 |
| cl100k_base | GPT-4, GPT-4 Turbo, GPT-3.5 Turbo; Claude approximation | 旧版 OpenAI 聊天预算与粗略的 Claude 英文估算 |
| p50k_base | Legacy Codex / older completion models | 历史对比与较旧的 completion 流水线 |
需要检查特定模型系列的合并时,可独立于比较卡片切换 Token Boundary Map 的编码。
分步:计数、优化并复制预算
首次打开驾驶舱时请按此演练。之后多数会话是粘贴 → 比较 → 优化 → 复制。
- 粘贴您关心的完整提示载荷:系统消息、用户轮次、工具 JSON,或拼接的 RAG 上下文块。
- 阅读三张比较卡片。记下最高的编码 — 若仍需选型,这就是保守预算。
- 打开 Token Boundary Map,悬停看起来异常长的片段(URL、emoji、缩进 JSON)以查看具体 Token ID。
- 若输入偏 JSON,点击 Minify JSON;若是带双空格或填充换行的散文,点击 Strip Spaces。
- 输入预估月调用量,以推算 GPT-4o、GPT-4o mini 与 Claude 3.5 Sonnet 的输入支出。
- 将指标摘要复制到设计文档、工单或 PR 描述,让团队共享同一个数字。
「良好」状态的样子
- System + tools + 平均用户轮次在所选上下文窗口内为模型回复留出余量
- 即使人工编辑美化副本,生产提示中的 JSON Schema 也已 minify
- 成本外推使用与计费模型匹配的编码
用例:阻止系统提示上下文溢出
问题:加入政策、语气规则与三个 few-shot 示例后,客服智能体提示在对话中途被截断。
本工具如何解决
- 单独粘贴当前 system prompt,记录 o200k_base(或 cl100k_base)计数。
- 逐个追加 few-shot 示例并记录增量 — 先删价值最低的示例。
- 粘贴代表性用户消息与每次调用发送的 tools JSON;对照模型上下文窗口求和。
- 对散文用 Strip Spaces,对 Schema 用 Minify JSON,再重新计数以量化节省。
- 将最终预算复制到智能体运行手册,使后续提示编辑保持同一上限。
结果:您确切知道哪一段撑破预算、每次优化回收了多少 Token — 在下一次生产截断之前。
用例:削减 OpenAI 工具 Schema 的 Token 浪费
问题:OpenAI function-calling Schema 为可读性带缩进编写,再粘贴进线上请求。逻辑 Schema 未变,Token 支出却上升。
本工具如何解决
- 将美化后的 tools 数组或 parameters 对象粘贴到输入面板。
- 在 API 模型所用编码上记录 Token 数(GPT-4o 通常为 o200k_base)。
- 点击 Minify JSON 并比较新计数 — 差额即纯空白税。
- 检查 boundary map:重复键与长 enum 列表往往占主导;先缩短描述再删字段。
- 在 API 调用中发送 minify 后的 Schema;美化副本仅保留在版本控制或 Agent Builder 编辑器中。
结果:在不改变工具行为的前提下,降低每次启用工具调用的输入成本。
用例:预测每月 LLM 输入花费
问题:财务要求在上线将调用模型数千次的功能前,给出月度 LLM 支出估算。
本工具如何解决
- 构建现实的平均载荷(system + tools + 典型用户文本)并粘贴到此处。
- 确认与生产模型匹配的编码比较卡片。
- 将 Estimated monthly volume 设为预计调用次数。
- 阅读 GPT-4o、GPT-4o mini 与 Claude 3.5 Sonnet 月度列,在同一载荷上比较供应商。
- 注明费率为静态公开输入价 — 供应商改价页时刷新估算。
结果:得到可辩护、针对载荷的预测,而非「Token 很便宜」的模糊猜测。
用例:按硬 Token 预算划分 RAG 分块
问题:RAG 流水线每次查询检索五个分块。部分分块多为空白或样板页眉,有用文本被截断导致模型仍答错。
本工具如何解决
- 分别粘贴每个候选分块,在检索模型编码下记录 Token 数。
- 优先更密的分块:Strip Spaces、去掉重复导航页眉、删除近重复段落。
- 拼接计划发送的 top-k 集合,确认总量仍为问题与答案留出空间。
- 用 boundary map 找出对人眼显得短但对分词器昂贵的序列(长 URL、表格、emoji)。
- 用本工具测得的总量,在检索器中设置每查询硬 Token 预算。
结果:检索每 Token 装入更多信号,因静默上下文截断而失败更少。
修复:context_length_exceeded 与静默截断
症状:API 400 context_length_exceeded、截断的 completion,或会话中途「忘记」早期指令的智能体。
为何会发生
合并的 system prompt、tools、历史与用户轮次超过模型上下文窗口。美化 JSON 与长 few-shot 库是常见的静默元凶。
诊断
粘贴客户端实际发送的载荷(或重建它)。将 Token 总量与模型所列上下文窗口比较。通过单独计数找出最大段落。
修复
- 对工具 Schema 做 Minify JSON,并去掉散文中多余空白。
- 将少用政策移到按需检索,而非始终在线的 system prompt。
- 每次调用前限制聊天历史(摘要或丢弃最旧轮次)。
- 仅在测量后再换更大上下文模型 — 不要猜测。
每次更改后重新计数。对 8k Token 的 tools 块削减 10% 空白,往往比删除一小段政策更能腾出余量。
修复:本地计数与 API 用量不一致
症状:本地计数看起来正常,但 OpenAI 用量仪表盘不一致 — 或 Claude 账单与电子表格不符。
为何会发生
用了错误编码做预算,或把原始文本与用角色/工具信封包装消息的 API 做了比较。
诊断
确认模型文档中的分词器。GPT-4o 系列用 o200k_base;GPT-4 / 3.5 用 cl100k_base。此处 Claude 数字仅作近似。
修复
- 将比较焦点与 boundary map 切换到匹配编码。
- 统计 SDK 实际发送的序列化消息,而非仅可读提示草稿。
- 规划硬限制时为聊天格式加入小额开销缓冲(常为数十到数百 Token)。
- Anthropic 计费:在锁定 SLA 前,用 Anthropic 自有计数器验证关键提示。
修复:美化 JSON 与空行膨胀 Token
症状:提示语义未变,但 Minify JSON 或 Strip Spaces 后 Token 数大幅下降。
为何会发生
BPE 编码对缩进换行、对齐空格与重复空行计费。人眼忽略它们;分词器不会。
诊断
粘贴美化载荷,记下计数,运行 Minify JSON / Strip Spaces 并比较。大差额意味着空白是主要成本驱动。
修复
- 在 git 中保存人工可编辑的美化 JSON;在请求时 minify。
- 避免在 system prompt 中塞入填充 ASCII 图或巨大缩进日志。
- 折叠长政策文档中的多空行分节符。
boundary map 将空白 Token 显示为独立彩色片段 — 适合向团队说明为何 minify 重要。
如何阅读 Token 边界图
Token Boundary Map 将每个 BPE 合并绘成彩色片段。颜色仅循环用于视觉分隔 — 不编码 Token 类别。
如何阅读
- 悬停片段可显示所选地图编码的数字 Token ID
- URL 或 base64 上的长连续片段通常意味着值得缩短的昂贵单 Token 或少 Token 块
- Emoji 与 CJK 文本可能比相同视觉长度的拉丁散文使用更多 Token
- 比较 GPT-4o 与 GPT-4 如何切分同一字符串时更改地图编码
成本外推器如何工作
成本卡片将本地 Token 计数乘以静态公开输入费率:GPT-4o $5 / 1M、GPT-4o mini $0.15 / 1M、Claude 3.5 Sonnet $3 / 1M。月调用量会缩放单次查询成本。
注意事项
- 不含输出 Token — 完整 TCO 需另行加入 completion 估算
- 未建模缓存输入或批量折扣
- 供应商标价会变;将数字视为规划辅助而非发票
Token 预算最佳实践
- 按与生产匹配的编码做预算,并为聊天包装与重试保留 10–20% 安全余量
- 统计完整请求形态(system + tools + 历史 + 用户),而非仅 system prompt
- 机器消费的 JSON 要 minify;为人保留美化副本
- 每当添加 few-shot 示例、MCP 配置或长政策附录时重新计数
- 在设计评审中使用月调用量投影,使成本在上线前可见
- 专有提示优先本地计数 — 本工具从不上传您的文本
分词器与特殊 Token 参考
边界颜色映射到 tiktoken 字节对编码。像 <|endoftext|> 这样的特殊 Token 在作为字面文本出现时会计入。
分词器与特殊 Token 参考
| 字段类型 | 示例载荷 | 结构规则 |
|---|---|---|
| cl100k_base | GPT-4, GPT-4 Turbo, Claude 3 | 默认 OpenAI 聊天编码;英文散文约 4 字符/Token;跨词边界合并空白。 |
| o200k_base | GPT-4o, GPT-4o mini | 面向 omni 模型的扩展词表编码;相同字符串的 Token ID 与 cl100k_base 不同。 |
| <|endoftext|> | <|endoftext|> | GPT 训练语料中标记文档边界的保留控制 Token;字面出现时计为单个 Token。 |
| Unicode emoji | 🚀 | 视编码常为 1–3 个 Token;多码点字素可能拆到多个 BPE 合并。 |
| JSON whitespace | {\n "key": "value"\n} | 缩进换行与空格消耗 Token — 统计上下文占用前请 minify JSON 载荷。 |
常见问题
关于常见调试问题和数据隐私的可展开解答。
相关工具
探索可与此工具配合使用的其他相关实用工具。
官方文档与参考
本工具的权威规范与平台文档。