时间:2026年9月3日
地点:美国加利福尼亚州圣何塞(Cerebras Systems 总部)
人物:Cerebras Systems(晶圆级 AI 芯片厂商)、阿里巴巴 Qwen 团队
事件详情:美国晶圆级推理芯片厂商 Cerebras Systems 于 9 月 3 日在其公共推理端点正式上线阿里 Qwen3.8-27B 模型,提供约 1500 tokens/s 的推理速度。Qwen3.8-27B 在 Cerebras 平台支持 64K(免费层)/ 128K(付费层)上下文窗口。该模型与 OpenAI GPT OSS 120B(约 3000 tokens/s)共同构成 Cerebras 当前公共推理模型目录,所有端点均提供原始未剪枝权重,采用选择性权重量化(16/8/4-bit)保持质量,激活、注意力机制与 KV Cache 全精度运行。
背景:Qwen3.8-27B 是阿里 8 月开源的 27B 参数原生多模态稠密模型,采用 Apache 2.0 协议,原生 262K 上下文可经 YaRN 扩展至 1M token。开源两天下载量破百万次,社区自发贡献约 500 个量化版本。在编程(LiveCodeBench v6、DeepSWE 1.1)、智能体(SWE-bench Pro)等基准上得分超过 Claude Opus 4.6 Max。
影响:1500 tokens/s 推理速度使 Qwen3.8-27B 在低延迟编码 Agent、研究循环等场景接近即时反馈;Cerebras 加入 NVIDIA、AMD、平头哥、沐曦、联发科、摩尔线程以及 SGLang、vLLM、Ollama、LM Studio 行列,成为又一个支持 Qwen3.8-27B 的推理平台。社区已利用 MTP(多 Token 预测)推测解码在 RTX 3090 上将解码速度从 31 tokens/s 提升至 41.3 tokens/s。需要注意的是 Cerebras 端点上下文 64K/128K 低于模型原生 262K,开发者需验证部署约束。
总结:Cerebras 上线 Qwen3.8-27B 提供 1500 tokens/s 高速推理,与 GPT OSS 120B 共建其推理服务基础架构;这显示开源大模型的部署生态正在向"云端推理即服务"层面快速延伸,使中小参数密度模型在企业级低延迟场景具备可用性。
参考来源:
1. Cerebras 官方模型目录:https://inference-docs.cerebras.ai/models/overview
2. TechTextNews 报道:https://www.techtextnews.com/qwen-38-27b-now-live-on-cerebras-at-1500-tokenss
3. AICrier 报道:https://aicrier.com/post/nd41hqc1oy5fh6di2unr
4. HyperAI 报道:https://beta.hyper.ai/en/stories/d055f5ec31ebc871825a02c4c5009d06
5. AGI Hunt 报道:https://agihunt.info/en/p/1a06899ca19349239367fc8eff0
6. Web Pulse 报道:https://wpnews.pro/news/qwen-3-8-27b-available-on-cerebras-at-1500-tok-sec
7. 36氪 Qwen3.8-27B 工程优化分析:https://www.36kr.com/p/3943218675383689









