等待处理。
输入仅在当前浏览器处理,不上传、不自动保存。
- 文本 Token
- -
- Unicode 码点
- -
- UTF-8 字节
- -
分词片段与 Token ID
最多展示前 500 个 Token,计数包含完整输入。片段中的替换字符可能来自跨 Token 的 UTF-8 字节边界。
Token 在线计算器适合哪些 AI 使用场景?
在准备提示词、代码片段、JSON 或中文材料时,可以先检查文本 Token 数,再安排上下文长度或估算 API 输入费用。输入文本后选择编码并点击计算,结果会展示 Token 总数、Unicode 码点数、UTF-8 字节数,以及前 500 个 Token 的片段和 ID。分词只发生在当前浏览器。
o200k_base 与 cl100k_base 有什么区别?
这两种 BPE 分词编码具有不同的词表,相同中文、英文或代码可能得到不同的 Token 数。应选择目标模型官方说明对应的编码。工具按编码名称提供计数,不将一个算法冒充所有模型的通用分词器,也不保证它适用于 Claude、Gemini、DeepSeek 或未确认编码的模型。
为什么一个汉字、一个英文单词不一定是一个 Token?
Token 可能表示完整单词、词的一部分、标点或一段字节。中文、emoji、空格和代码符号的切分方式都受词表影响,因此字符数除以固定系数只能作为粗略估算。本工具直接执行所选编码的分词算法;跨 Token 的多字节字符单独展示时可能出现替换字符,完整文本不受影响。
这里的 Token 数等于 API 最终计费量吗?
不等于。本工具计算原始文本,特殊标记按普通文本处理,不添加对话角色、工具定义、系统包装、图片或音频输入,也不预测模型回复和推理用量。完整请求的计费应参考对应供应商返回的 usage 数据。首版最多处理 100,000 个字符,分词在浏览器后台线程执行。
参考资料: gpt-tokenizer