GigaToken开源:分词速度最高提升约1000倍

时间:2026年7月22日

地点:全球在线开源社区

人物:GigaToken开源项目作者Marcel Roed

事件详情:开源开发者Marcel Roed公开GigaToken语言模型分词器,并通过PyPI提供安装包。项目采用Rust实现,可作为Hugging Face Tokenizers和Tiktoken的兼容替代方案,也提供绕过部分Python数据结构开销的原生API。项目公布的自测显示,在双路AMD EPYC 9565服务器处理11.9GB OpenWebText训练文本时,GPT-2分词吞吐达到24.53GB/s,对比Hugging Face Tokenizers约提升989倍;在Apple M4 Max上,部分模型分词器的加速幅度超过1000倍。上述数字为项目方基准结果,实际收益会随CPU、文本、模型分词规则和调用方式变化。

背景:大模型训练、数据清洗、推理服务、路由和限流都需要先把文本转换为Token。现有Hugging Face Tokenizers与Tiktoken本身已采用多线程Rust,但预分词正则处理、缓存查找、Python交互和线程协调仍可能形成延迟。GigaToken针对预分词环节使用SIMD优化,改进长尾词元缓存,并减少Python边界与线程间交互;项目还覆盖Llama、Qwen、DeepSeek、GLM、Gemma、Mistral、Phi等常见模型家族,并以MIT许可证开源。

影响:

  • 数据处理效率——在大规模语料预处理、离线Token计数和训练数据制作中,GB/s级吞吐有望显著缩短CPU侧准备时间,降低多核服务器占用。
  • 在线服务延迟——分词通常只占完整推理耗时的一部分,但在高速GPU、小模型、长输入以及路由、计费、限流等前置环节中仍属延迟敏感路径;作者引用的初步测试显示,长输入场景首Token时间可获得约3%至10%的改善。
  • 迁移与生态——兼容Hugging Face Tokenizers和Tiktoken可降低接入门槛,但项目方也提醒,完全兼容模式会牺牲部分峰值性能,开发者仍需验证特殊Token、Unicode边界和批处理结果的一致性。

总结:GigaToken把长期被视为成熟基础设施的分词环节重新变成系统优化对象。其最醒目的“约1000倍”来自特定硬件、数据集和原生API路径,不能直接等同于模型整体推理提速1000倍;不过,公开基准显示它在多种x86与ARM CPU、多个主流模型家族上均实现显著吞吐提升。若后续独立测试能够复现结果并证明兼容性稳定,该项目可能成为大模型训练数据管线和高并发推理网关中的实用组件。

参考来源:

  • https://github.com/marcelroed/gigatoken
  • https://pypi.org/project/gigatoken/
  • https://news.ycombinator.com/item?id=49010167
  • https://github.com/marcelroed/gigatoken/blob/main/benchmarks/results.json
  • https://github.com/marcelroed/gigatoken/commits/main/
  • https://github.com/crusoecloud/fastokens