热门AI工具推荐

AI编程订阅服务,支持多款国产主流编程模型自由切换。
Seedance 2.0AI视频生成
具备卓越的物理真实性和角色一致性,可生成电影级视频内容。
方舟 Agent PlanAI智能体订阅
火山引擎推出的全场景AI智能体订阅服务,通过一个订阅整合5大主流模型和10+AI工具
StepClaw阶跃AI桌面伙伴龙虾Agent智能体
StepClaw是阶跃星辰推出的本地和云端的AI龙虾助手,通过一键部署让普通用户也能拥有7×24小时在线、可自主执行任务的AI数字工作伙伴。
基于OpenClaw架构打造的AI助手平台,核心优势包括云端一键部署、沙箱隔离安全运行、全面接入企业微信/钉钉/飞书三大主流IM工具
SpeedAIAI内容检测降重
AI内容检测与降重工具,能有效帮助用户通过论文AI率检测
墨刀AIAI原型设计平台
墨刀AI是一款能通过一句话描述或图片,快速生成可交互原型、PRD文档及各类图表的一站式智能产品设计协作平台。
秒哒AI工具
不懂代码也能开发应用?百度秒哒:无需编程,快速搭建小程序与网站
有戏AIAI漫剧生成工具
全流程AI短剧创作工具,实现从剧本到成片的自动化生产,让“一人即剧组”成为现实。
沁言学术智能科研平台
一站式文献管理与科研写作工具,支持边写作边搜索文献,高效阅读,文献管理,

伯克利开源FreeToken 单卡跑753B级模型

时间:2026 年 8 月 23 日 地点:美国(加州大学伯克利分校 UC Berkeley 与 德州大学奥斯汀分校 UT Austin) 人物:Shuo Yang(UC Berkeley)、Chenfeng Xu(UT Austin)、Matei Zaharia、Ion Stoica、Song Han、Kurt Keutzer 等 11 位研究者组成的 FlashML 团队 事件详情:FlashML 团队正式开源边缘原生 MoE 推理引擎 FreeToken,可在单张消费级工作站显卡上运行 753B 参数的 GLM-5.2 模型。该系统采用带宽自适应执行 q* 策略与语义感知缓存,将个人电脑视为统一弹性推理平台,按实时可用的 GPU/CPU/内存/总线带宽动态映射计算与权重:8GB 笔电 GPU 跑 35B Qwen3.6 达 39 tokens/s,RTX 5090 台式机跑 284B DeepSeek-V4-Flash 达 22-25 tokens/s,RTX PRO 6000 工作站单卡跑 753B GLM-5.2 达 14.9 tokens/s、平均 TTFT 7.5 秒。FreeToken 以 Apache-2.0 协议发布在 GitHub(FlashML-org/FreeToken),同时上架 PyPI(freetoken v0.1.2)与 flashml.ai 一键桌面端,兼容 Claude Code、Codex、OpenCode、OpenClaw、DeepSeek Harness 等智能体。论文 8 月 17 日上线 arXiv(2608.16157),相比 llama.cpp 在 RTX 5090 上解码速度提升 2.0-2.3 倍,TTFT 控制在 44 秒以内。 行业背景:Kimi-K3、GLM-5.2、DeepSeek-V4-Flash 等开源权重模型能力已逼近闭源系统,但运行成本仍是瓶颈;全球超过 1 亿台消费级设备搭载独立显卡,Steam 月活超 2 亿、其中 72% 系统有独立 NVIDIA GPU。现有引擎(llama.cpp、KTransformers、Ollama、MoE-Infinity)存在三大痛点:预填充破坏稀疏性、专家分配静态化、消费级 CPU 难以承担剩余计算。 影响:FreeToken 将前沿 MoE 模型的部署从数据中心级 GPU 集群下沉到单张消费级显卡,意味着医疗、法律、国防、金融等数据敏感行业的本地大模型部署成本结构性下降;同时也对 Etched 等专用推理芯片公司提出挑战,开源生态可能在消费级硬件上吃掉相当一部分推理工作负载。 总结:FreeToken 用软件重新定义了大模型的硬件门槛,把 753B 级 MoE 模型从机房搬进桌面,标志着用已有的硬件跑前沿开源模型在工程上正式可行。 参考来源: 1. https://www.marktechpost.com/2026/08/23/meet-freetoken-an-edge-native-moe-serving-engine-that-runs-753b-glm-5-2-on-a-single-workstation-gpu/ 2. https://arxiv.org/abs/2608.16157 3. https://github.com/FlashML-org/FreeToken 4. https://www.flashml.ai/ 5. https://ai-beat.github.io/news/2026/08/freetoken-edge-moe-serving 6. https://aiinsiders.net/article/a-753b-parameter-model-now-fits-on-one-workstation-gpu 7. https://dev.to/breachprotocol/a-753-billion-parameter-model-ran-on-a-single-workstation-gpu-bh6 8. https://wpnews.pro/news/run-frontier-models-on-gaming-gpus 9. https://www.emergentmind.com/papers/2608.16157 10. https://thecryptopost.io/meet-freetoken-an-edge-native-moe-serving-engine-that-runs-753b-glm-5-2-on-a-single-workstation-gpu