热门AI工具推荐

焚书AI多模型聚合平台
AI多模型聚合平台( Claude 系列、GPT 系列)支持聊天、搜索、图片、视频、音乐等多种功能;聚合了 Claude 系列(如 Sonnet 5、Opus 5 等)、Gemini 系列、GPT 系列、DeepSeek(搜索模式默认调用 DeepSeek V4 Pro)以及通义千问、Kimi 等数十款国内外主流模型。
AI编程订阅服务,支持多款国产主流编程模型自由切换。
Seedance 2.0AI视频生成
具备卓越的物理真实性和角色一致性,可生成电影级视频内容。
方舟 Agent PlanAI智能体订阅
火山引擎推出的全场景AI智能体订阅服务,通过一个订阅整合5大主流模型和10+AI工具
SpeedAIAI内容检测降重
AI内容检测与降重工具,能有效帮助用户通过论文AI率检测
秒哒AI工具
不懂代码也能开发应用?百度秒哒:无需编程,快速搭建小程序与网站
有戏AIAI漫剧生成工具
全流程AI短剧创作工具,实现从剧本到成片的自动化生产,让“一人即剧组”成为现实。
沁言学术智能科研平台
一站式文献管理与科研写作工具,支持边写作边搜索文献,高效阅读,文献管理,

RTX 4090 跑通125B大模型:Qwen3.8-Flash-Next 达100 tokens/s

10月4日,一位开发者在 Hacker News 分享:他在单张英伟达 RTX 4090(24GB 显存)上成功运行通义千问 Qwen3.8-Flash-Next(125B 参数),实测速度达 **100 tokens/s**,远超市面上任何消费级 GPU 运行同规模模型的记录。 ## 技术背景 **Qwen3.8-Flash-Next** 是阿里巴巴通义千问团队于 2026 年 8 月 26 日发布的开源大语言模型,是 Qwen4 架构的首个开放权重预览版: - **总参数:** 125B(稀疏 MoE 架构) - **每 Token 激活参数:** 6B(每次推理只激活约 5% 参数) - **额外嵌入:** 51B N-gram 嵌入表 + 4B MTP(Multi-Token Prediction) - **上下文窗口:** 支持 25 万 tokens 超长上下文 - **能力:** 编程、协作等任务优于 Qwen3.7-Plus,能力对标 Claude Opus 4.6 此前,125B 参数级别模型通常需要 A100/H100 等数据中心级 GPU 才能流畅运行。 ## 实现方式 开发者使用 **llama.cpp** 配合 INT4 量化(IQ3_XXS)在 RTX 4090 上运行,并通过 `--fit` 参数优化显存分配。多位用户在 Reddit r/LocalLLaMA 独立验证,报告 16GB 显存显卡亦可达到 17–26 tok/s。 ## 影响 1. **消费级 AI 民主化:** 100T/s 意味着在消费级硬件上获得接近云端付费 API 的交互体验 2. **开源模型本地化提速:** 与闭源模型相比,开源权重模型在本地运行成本趋近于零 3. **Qwen 生态加速:** Flash-Next 成为本地大模型社区最热话题 ## 总结 Qwen3.8-Flash-Next 证明:稀疏 MoE 架构 + 量化技术已让 125B 参数模型进入消费级 GPU 时代。这意味着 AI 应用将从云端向本地设备加速迁移。 ## 参考来源 1. Hacker News 讨论帖:https://news.ycombinator.com/item?id=49953495 2. Qwen 官方博客介绍:https://qwen.ai/blog?id=qwen3.8-flash-next 3. Hugging Face 模型页:https://huggingface.co/Qwen/Qwen3.8-Flash-Next 4. GitHub llama.cpp 配置:https://gist.github.com/ryan4yin/48617bbddacc7067f10799770b7cc33f 5. NVIDIA 开发者论坛:https://forums.developer.nvidia.com/t/qwen3-8-flash-next/381228 6. YouTube 运行演示:https://www.youtube.com/watch?v=gR20MGAhll8 7. CSDN 本地部署教程:https://bbs.csdn.net/weixin_29800471/article/details/100271550 8. X 社区验证帖:https://x.com/analogalok/status/2092697021790708148