热门AI工具推荐

焚书AI多模型聚合平台
AI多模型聚合平台( Claude 系列、GPT 系列)支持聊天、搜索、图片、视频、音乐等多种功能;聚合了 Claude 系列(如 Sonnet 5、Opus 5 等)、Gemini 系列、GPT 系列、DeepSeek(搜索模式默认调用 DeepSeek V4 Pro)以及通义千问、Kimi 等数十款国内外主流模型。
AI编程订阅服务,支持多款国产主流编程模型自由切换。
Seedance 2.0AI视频生成
具备卓越的物理真实性和角色一致性,可生成电影级视频内容。
方舟 Agent PlanAI智能体订阅
火山引擎推出的全场景AI智能体订阅服务,通过一个订阅整合5大主流模型和10+AI工具
SpeedAIAI内容检测降重
AI内容检测与降重工具,能有效帮助用户通过论文AI率检测
秒哒AI工具
不懂代码也能开发应用?百度秒哒:无需编程,快速搭建小程序与网站
有戏AIAI漫剧生成工具
全流程AI短剧创作工具,实现从剧本到成片的自动化生产,让“一人即剧组”成为现实。
沁言学术智能科研平台
一站式文献管理与科研写作工具,支持边写作边搜索文献,高效阅读,文献管理,

GigaToken开源:分词速度最高提升约1000倍

时间:2026年7月22日

地点:全球在线开源社区

人物:GigaToken开源项目作者Marcel Roed

事件详情:开源开发者Marcel Roed公开GigaToken语言模型分词器,并通过PyPI提供安装包。项目采用Rust实现,可作为Hugging Face Tokenizers和Tiktoken的兼容替代方案,也提供绕过部分Python数据结构开销的原生API。项目公布的自测显示,在双路AMD EPYC 9565服务器处理11.9GB OpenWebText训练文本时,GPT-2分词吞吐达到24.53GB/s,对比Hugging Face Tokenizers约提升989倍;在Apple M4 Max上,部分模型分词器的加速幅度超过1000倍。上述数字为项目方基准结果,实际收益会随CPU、文本、模型分词规则和调用方式变化。

背景:大模型训练、数据清洗、推理服务、路由和限流都需要先把文本转换为Token。现有Hugging Face Tokenizers与Tiktoken本身已采用多线程Rust,但预分词正则处理、缓存查找、Python交互和线程协调仍可能形成延迟。GigaToken针对预分词环节使用SIMD优化,改进长尾词元缓存,并减少Python边界与线程间交互;项目还覆盖Llama、Qwen、DeepSeek、GLM、Gemma、Mistral、Phi等常见模型家族,并以MIT许可证开源。

影响:

  • 数据处理效率——在大规模语料预处理、离线Token计数和训练数据制作中,GB/s级吞吐有望显著缩短CPU侧准备时间,降低多核服务器占用。
  • 在线服务延迟——分词通常只占完整推理耗时的一部分,但在高速GPU、小模型、长输入以及路由、计费、限流等前置环节中仍属延迟敏感路径;作者引用的初步测试显示,长输入场景首Token时间可获得约3%至10%的改善。
  • 迁移与生态——兼容Hugging Face Tokenizers和Tiktoken可降低接入门槛,但项目方也提醒,完全兼容模式会牺牲部分峰值性能,开发者仍需验证特殊Token、Unicode边界和批处理结果的一致性。

总结:GigaToken把长期被视为成熟基础设施的分词环节重新变成系统优化对象。其最醒目的“约1000倍”来自特定硬件、数据集和原生API路径,不能直接等同于模型整体推理提速1000倍;不过,公开基准显示它在多种x86与ARM CPU、多个主流模型家族上均实现显著吞吐提升。若后续独立测试能够复现结果并证明兼容性稳定,该项目可能成为大模型训练数据管线和高并发推理网关中的实用组件。

参考来源:

  • https://github.com/marcelroed/gigatoken
  • https://pypi.org/project/gigatoken/
  • https://news.ycombinator.com/item?id=49010167
  • https://github.com/marcelroed/gigatoken/blob/main/benchmarks/results.json
  • https://github.com/marcelroed/gigatoken/commits/main/
  • https://github.com/crusoecloud/fastokens