Cerebras Qwen 3.8-27B 推理服务
## 产品简介 Cerebras Qwen 3.8-27B 是由美国晶圆级 AI 芯片厂商 Cerebras Syst
产品简介
Cerebras Qwen 3.8-27B 是由美国晶圆级 AI 芯片厂商 Cerebras Systems 于 2026 年 9 月 3 日在其公共推理端点正式上线的阿里 27B 参数大模型推理服务。该服务提供约 1500 tokens/s 的推理速度,支持 64K(免费层)/ 128K(付费层)上下文窗口。与 OpenAI GPT OSS 120B(约 3000 tokens/s)共同构成 Cerebras 当前公共推理模型目录。所有端点均提供原始未剪枝权重,采用选择性权重量化(16/8/4-bit)保持质量,激活、注意力机制与 KV Cache 全精度运行。
核心功能
- 超高速推理:Qwen 3.8-27B 在 Cerebras 平台实现约 1500 tokens/s 的推理速度,远超传统 GPU 方案
- 长上下文支持:免费层 64K,付费层最高 128K 上下文窗口
- 原始权重直供:所有端点提供原始未剪枝权重,非量化压缩版本
- 选择性权重量化:16/8/4-bit 选择性量化存储,激活/注意力机制/KV Cache 全精度运行
- 多精度选择:用户可按需选择 16/8/4-bit 量化级别
- 开放 API 接口:OpenAI 兼容 API,直接替换现有代码中的 base URL 即可使用
- 免费试用额度:注册即送 5 美元免费试用金
技术规格
- 模型:Qwen 3.8-27B(阿里 8 月开源的 27B 参数原生多模态稠密模型)
- 发布方:Cerebras Systems(算力提供方)
- 许可协议:Apache 2.0
- 上下文:64K(免费)/ 128K(付费)
- 原始上下文:262K(经 YaRN 扩展可至 1M token)
- 推理速度:约 1500 tokens/s
- 权重处理:全精度激活、全精度注意力、全精度 KV Cache
性能表现
| 模型 | 速度 | 输入价格 | 输出价格 |
|---|---|---|---|
| Qwen 3.8-27B | ~1500 tokens/s | $0.99/M tokens | $1.49/M tokens |
| GPT OSS 120B | ~3000 tokens/s | $0.35/M tokens | $0.75/M tokens |
Qwen 3.8-27B 开源两天下载量破百万次,社区自发贡献约 50 个衍生项目。
特色优势
- 极速推理:1500 tokens/s 的推理速度,比传统 GPU 方案快 30 倍
- 长上下文:128K 付费层,1M token 经 YaRN 扩展可达
- 原始权重:未剪枝、未过度量化,保证模型质量
- 全精度核心:激活/注意力/KV Cache 全部使用全精度
- Apache 2.0 许可:允许商业使用,无使用限制
- OpenAI 兼容:SDK 无需修改,只需更换 base URL
应用场景
- 长文档分析:128K 上下文支持处理长篇报告、代码库分析
- 本地大模型推理:开发者无需自建 GPU 集群,直接调用 Cerebras API
- 企业级 AI 应用:高吞吐量需求的企业级应用后端
- 模型推理对比研究:研究者在不同硬件平台对比模型性能
- API 开发与原型验证:快速验证大模型功能,无需本地部署
适用人群
- 开发者与独立研究员:需要高速推理 API 但缺乏 GPU 资源的开发者
- 企业 AI 团队:需要高吞吐量、低延迟推理服务的企业
- AI 研究者:对比不同模型在不同硬件上的性能
- 创业团队:快速构建 AI 应用,无需自建基础设施
出品方
Cerebras Systems,美国晶圆级 AI 芯片厂商,总部位于加州圣何塞,专做大模型高速推理芯片。 Qwen 团队(阿里),中国杭州,阿里巴巴通义千问大模型团队。
更新动态
2026 年 9 月 3 日正式上线 Cerebras 公共推理端点。这是 Cerebras 首次提供阿里 Qwen 系列模型的公共推理服务,上线即支持 1500 tokens/s 的高速推理。
官网链接
Cerebras 官方定价页:https://www.cerebras.ai/pricing Cerebras 模型文档:https://inference-docs.cerebras.ai/models/choose-a-model
团队信息
AI产品库
官方
由 AI 猎手自动发现
评论与建议
登录 后参与评论或提建议