novocab
无需加载词表,一次遍历字符串即可精确预估多种主流 AI 模型 token 数量
novocab 是一个纯算法级别的 token 数量预估工具,可以在不加载任何词表文件的情况下,仅通过一次字符串遍历精确估算文本在不同 AI 模型分词器下的 token 数量。该项目采用 Unicode 分桶配合简单计数器的方式,根据词长等特征进一步分桶,然后暴力拟合系数直至收敛,实现了平均仅约 5% 的偏移率(主流方法 char/4 的偏移可达 30%-50%)。该项目不依赖任何外部词表文件,无需网络请求,无冷启动问题,novocab.py 用纯标准库 Python 实现,代码简洁单一。项目支持 Claude 4.7 及更新版本、Claude 4.7 之前版本、OpenAI o200k_base、OpenAI cl100k_base 以及 SentencePiece 系列(包括 Gemini 和 Gemma 全系列)等多种主流分词器,并提供默认表和多语言表两套系数以适应不同语言场景。适用于需要在本地快速估算 token 数量但不想每次都调用分词器 API 的开发者,尤其在处理大量文本或需要做 token 预算控制的场景下非常实用。
团队信息
AI产品库
官方
由 AI 猎手自动发现
评论与建议
登录 后参与评论或提建议