Cerebras Qwen 3.8-27B 推理服务

## 产品简介 Cerebras Qwen 3.8-27B 是由美国晶圆级 AI 芯片厂商 Cerebras Syst

LLM大模型 部分免费

产品简介

Cerebras Qwen 3.8-27B 是由美国晶圆级 AI 芯片厂商 Cerebras Systems 于 2026 年 9 月 3 日在其公共推理端点正式上线的阿里 27B 参数大模型推理服务。该服务提供约 1500 tokens/s 的推理速度,支持 64K(免费层)/ 128K(付费层)上下文窗口。与 OpenAI GPT OSS 120B(约 3000 tokens/s)共同构成 Cerebras 当前公共推理模型目录。所有端点均提供原始未剪枝权重,采用选择性权重量化(16/8/4-bit)保持质量,激活、注意力机制与 KV Cache 全精度运行。


核心功能

  1. 超高速推理:Qwen 3.8-27B 在 Cerebras 平台实现约 1500 tokens/s 的推理速度,远超传统 GPU 方案
  2. 长上下文支持:免费层 64K,付费层最高 128K 上下文窗口
  3. 原始权重直供:所有端点提供原始未剪枝权重,非量化压缩版本
  4. 选择性权重量化:16/8/4-bit 选择性量化存储,激活/注意力机制/KV Cache 全精度运行
  5. 多精度选择:用户可按需选择 16/8/4-bit 量化级别
  6. 开放 API 接口:OpenAI 兼容 API,直接替换现有代码中的 base URL 即可使用
  7. 免费试用额度:注册即送 5 美元免费试用金

技术规格

  • 模型:Qwen 3.8-27B(阿里 8 月开源的 27B 参数原生多模态稠密模型)
  • 发布方:Cerebras Systems(算力提供方)
  • 许可协议:Apache 2.0
  • 上下文:64K(免费)/ 128K(付费)
  • 原始上下文:262K(经 YaRN 扩展可至 1M token)
  • 推理速度:约 1500 tokens/s
  • 权重处理:全精度激活、全精度注意力、全精度 KV Cache

性能表现

模型 速度 输入价格 输出价格
Qwen 3.8-27B ~1500 tokens/s $0.99/M tokens $1.49/M tokens
GPT OSS 120B ~3000 tokens/s $0.35/M tokens $0.75/M tokens

Qwen 3.8-27B 开源两天下载量破百万次,社区自发贡献约 50 个衍生项目。


特色优势

  1. 极速推理:1500 tokens/s 的推理速度,比传统 GPU 方案快 30 倍
  2. 长上下文:128K 付费层,1M token 经 YaRN 扩展可达
  3. 原始权重:未剪枝、未过度量化,保证模型质量
  4. 全精度核心:激活/注意力/KV Cache 全部使用全精度
  5. Apache 2.0 许可:允许商业使用,无使用限制
  6. OpenAI 兼容:SDK 无需修改,只需更换 base URL

应用场景

  1. 长文档分析:128K 上下文支持处理长篇报告、代码库分析
  2. 本地大模型推理:开发者无需自建 GPU 集群,直接调用 Cerebras API
  3. 企业级 AI 应用:高吞吐量需求的企业级应用后端
  4. 模型推理对比研究:研究者在不同硬件平台对比模型性能
  5. API 开发与原型验证:快速验证大模型功能,无需本地部署

适用人群

  1. 开发者与独立研究员:需要高速推理 API 但缺乏 GPU 资源的开发者
  2. 企业 AI 团队:需要高吞吐量、低延迟推理服务的企业
  3. AI 研究者:对比不同模型在不同硬件上的性能
  4. 创业团队:快速构建 AI 应用,无需自建基础设施

出品方

Cerebras Systems,美国晶圆级 AI 芯片厂商,总部位于加州圣何塞,专做大模型高速推理芯片。 Qwen 团队(阿里),中国杭州,阿里巴巴通义千问大模型团队。


更新动态

2026 年 9 月 3 日正式上线 Cerebras 公共推理端点。这是 Cerebras 首次提供阿里 Qwen 系列模型的公共推理服务,上线即支持 1500 tokens/s 的高速推理。


官网链接

Cerebras 官方定价页:https://www.cerebras.ai/pricing Cerebras 模型文档:https://inference-docs.cerebras.ai/models/choose-a-model

团队信息

由 AI 猎手自动发现

评论与建议

0 条评论