时间:2026年9月14日
地点:中国杭州(DeepSeek 总部),面向全球开发者同步上线
人物:DeepSeek 创始人梁文锋及其工程团队
事件详情:DeepSeek 正式发布 V4.1 Flash 模型,相对上一代 V4 Flash 采用完全不同的非对称 Transformer 架构 CED(Causal-Encoder-Decoder),原生支持多模态,把 V4 时代积累的训练配方、优化技巧和工程适配大部分作废,从头重训。Harness 同步升级到 v0.1.5,腾讯 WorkBuddy、CodeBuddy 和 OpenCode 已接入。
背景:V4 Flash 是 decoder-only 结构,每层同时负责"读"和"写",本就是为"聊天"场景设计。但 Agent 时代几十轮中间状态常驻上下文,输入动辄几十万 token,远大于输出。密歇根大学、斯坦福大学等 2026 年 4 月联合发布的论文指出,agentic 代码任务中输入与输出 token 比高达 154:1,传统 decoder-only 在长上下文预填充上严重吃紧,硬件成本高企。
影响:第一,V4.1 Flash 主干为 552B 参数的 MoE,采用 1 个共享专家 + 384 个路由专家、每 token 激活 6 个路由专家,叠加 196B 参数的 Engram 条件记忆模块。第二,新架构把 40 层 Transformer 拆成 20 层因果编码器 + 20 层解码器:编码器只"读"输入并生成摘要,解码器只"写"、其全局 KV Cache 直接从编码器最终隐状态投影,预填充阶段每 token 仅激活 8B 参数、解码阶段激活 16B。第三,CSA2(Compressed Sparse Attention 2)将注意力层划分为 Full、Reindex、Reuse 三种模式跨层共享 KV 与索引,配合 FP4 KV Cache 与 SWA Bounded Replay,把全局 KV Cache 压到 890 字节/token,是 V4 Flash 的 1/4、相比 V1 缩小约 437 倍,HBM 需求降至上一代 1/4、SSD 需求降至 1/8。第四,DeepSeek 同步宣布 V4 Pro 退役,原指向 deepseek-v4-pro 的 API 请求自 9 月 14 日起全部自动路由到 V4.1 Flash 并按 Flash 价格计费。第五,V4.1 Flash 在 Terminal-Bench 2.1、Codeforces、GPQA Diamond 等多项 Agent 与推理基准上超过 V4 Pro,权重以 MIT 协议开源托管在 Hugging Face。
总结:DeepSeek 用架构重写而非堆规模的方式,把"输入比输出重"的 Agent 推理成本压到新低,并以退役自家 Pro 模型的激进商业动作,向"入口公司"全面靠拢;国内大模型正式从"聊天模型"过渡到"Agent 模型"。
参考来源:
- 钛媒体《DeepSeek"推倒重来"》https://www.tmtpost.com/8139302.html
- Hugging Face README(DeepSeek-V4.1-Flash 官方技术报告)https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash
- DeepSeek API 官方文档 https://api-docs.deepseek.com/news/26151
- The Next Gen Tech Insider《DeepSeek Unveils V4.1 Flash Featuring Native Multimodality and CED Architecture》https://www.thenextgentechinsider.com/pulse/deepseek-unveils-v41-flash-featuring-native-multimodality-and-ced-architecture
- AGI Hunt《DeepSeek 发布 V4.1 Flash:552B MoE,CED 非对称架构大幅降推理成本》https://agihunt.info/p/1a08a795b517a2be6826b6922f1
- 深求社区《DeepSeek V4.1 重回国产一哥》https://deepseek.club/topic/4367
- 腾讯搜一搜《深度解读 DeepSeek V4.1 Flash 全新架构,如何成为显存杀手》https://so.html5.qq.com/page/real/search_news?docid=70000021_1546aa2ac7c47152







