使用 o200k_base 或 cl100k_base 在浏览器内统计文本 Token,查看分词片段、Token ID 和 UTF-8 字节数。

等待处理。

输入仅在当前浏览器处理,不上传、不自动保存。

文本 Token
-
Unicode 码点
-
UTF-8 字节
-

分词片段与 Token ID

最多展示前 500 个 Token,计数包含完整输入。片段中的替换字符可能来自跨 Token 的 UTF-8 字节边界。

Token 在线计算器适合哪些 AI 使用场景?

在准备提示词、代码片段、JSON 或中文材料时,可以先检查文本 Token 数,再安排上下文长度或估算 API 输入费用。输入文本后选择编码并点击计算,结果会展示 Token 总数、Unicode 码点数、UTF-8 字节数,以及前 500 个 Token 的片段和 ID。分词只发生在当前浏览器。

o200k_base 与 cl100k_base 有什么区别?

这两种 BPE 分词编码具有不同的词表,相同中文、英文或代码可能得到不同的 Token 数。应选择目标模型官方说明对应的编码。工具按编码名称提供计数,不将一个算法冒充所有模型的通用分词器,也不保证它适用于 Claude、Gemini、DeepSeek 或未确认编码的模型。

为什么一个汉字、一个英文单词不一定是一个 Token?

Token 可能表示完整单词、词的一部分、标点或一段字节。中文、emoji、空格和代码符号的切分方式都受词表影响,因此字符数除以固定系数只能作为粗略估算。本工具直接执行所选编码的分词算法;跨 Token 的多字节字符单独展示时可能出现替换字符,完整文本不受影响。

这里的 Token 数等于 API 最终计费量吗?

不等于。本工具计算原始文本,特殊标记按普通文本处理,不添加对话角色、工具定义、系统包装、图片或音频输入,也不预测模型回复和推理用量。完整请求的计费应参考对应供应商返回的 usage 数据。首版最多处理 100,000 个字符,分词在浏览器后台线程执行。

参考资料: gpt-tokenizer