热门AI工具推荐

焚书AI多模型聚合平台
AI多模型聚合平台( Claude 系列、GPT 系列)支持聊天、搜索、图片、视频、音乐等多种功能;聚合了 Claude 系列(如 Sonnet 5、Opus 5 等)、Gemini 系列、GPT 系列、DeepSeek(搜索模式默认调用 DeepSeek V4 Pro)以及通义千问、Kimi 等数十款国内外主流模型。
AI编程订阅服务,支持多款国产主流编程模型自由切换。
Seedance 2.0AI视频生成
具备卓越的物理真实性和角色一致性,可生成电影级视频内容。
方舟 Agent PlanAI智能体订阅
火山引擎推出的全场景AI智能体订阅服务,通过一个订阅整合5大主流模型和10+AI工具
SpeedAIAI内容检测降重
AI内容检测与降重工具,能有效帮助用户通过论文AI率检测
秒哒AI工具
不懂代码也能开发应用?百度秒哒:无需编程,快速搭建小程序与网站
有戏AIAI漫剧生成工具
全流程AI短剧创作工具,实现从剧本到成片的自动化生产,让“一人即剧组”成为现实。
沁言学术智能科研平台
一站式文献管理与科研写作工具,支持边写作边搜索文献,高效阅读,文献管理,

Cursor开源MoK训练内核 提速MoE 2.37倍

时间:2026年8月4日 地点:美国旧金山 人物:Cursor Research(AI编程工具Cursor的研究部门) 事件详情:Cursor Research 8月4日正式开源 Mixture-of-Kittens(MoK),这是其编程模型 Composer 背后的 MoE 训练 megakernel,已支撑 Composer 在数万张 GPU 上的训练。MoK 将 MoE 训练中所有的通信与计算步骤融合进一个确定性 megakernel,单卡测试相比最强公开基线最高可获得 2.37 倍加速。代码以 Apache-2.0 协议在 GitHub 公开,同时配套博客技术详解。 背景:MoE 层在分布式训练中常消耗超过一半的端到端时间。Cursor 此前已自研 MXFP8/NVFP4 量化内核和 warp decode 推理路径,但随着训练迁移到 GB300 NVL72 机架,整机 72 颗 GPU 共享 NVLink 域让通信与计算的耦合更紧,原本由 CPU 负责的同步开销成为瓶颈。MoK 的设计目标是彻底去掉这条 CPU-GPU 同步路径。 影响: - NVL72 上最高 2.37 倍 MXFP8 前向加速、1.78 倍反向加速,端到端 512 卡提升 1.41 倍 - 采用 pull 派发加 push 合并策略,把派发信令开销从 103 微秒压到 18 微秒(约 5.8 倍降幅) - 环形 token buffer 完全去除 CPU 调度,训练过程零 token 丢弃,可直接服务于策略内 RL 后训练 - 但 MoK 限定 NVIDIA Blackwell SM100/SM103、PyTorch 2.10+ 与 CUDA 13.0+,仅 NVL72 持有者或租用者能落地 总结:MoK 的开源把原本只有头部实验室才能复现的 NVL72 训练优化开放给社区。它用确定性 megakernel 思路把 MoE 通信和计算彻底融合,再叠加 pull/push 派发和环形 token buffer 两个核心设计,把硬件利用率推到新的高度。但其硬性硬件门槛意味着短期受益者仍将是大型云厂、GPU neocloud 和国家算力中心,对单节点或 8 卡团队仍不友好。Cursor 也借此进一步巩固其在 AI 编程模型领域的技术话语权。 参考来源: - https://www.marktechpost.com/2026/08/04/cursor-open-sources-mixture-of-kittens-mok-a-deterministic-moe-training-megakernel-for-gb300-nvl72-racks/ - https://cursor.com/blog/mixture-of-kittens - https://github.com/cursor/mixture-of-kittens - https://hazyresearch.stanford.edu/blog/2025-05-27-no-bubbles - https://github.com/deepseek-ai/DeepEP - https://arxiv.org/abs/2502.19811 - https://arxiv.org/abs/2512.14080