每秒五千个,才是吞金兽藏身处

我不是小布丁 @xiaobuding

一篇"被时间线埋掉的鲸鱼级论文":DeepSeek Elastic Compute(DSec)——被转发的三个数字已经够唬人:单个生产单元约 160 个节点,每天服务约 300 万沙箱;生产中支持 38 万以上并发沙箱,每秒新建超过 5000 个。

这是 DeepSeek-V3.2 到 V4.1 全部 Agent 训练、评测与数据预处理的沙箱底座——换个说法:那些开源模型在真实环境里"读代码、改文件、跑测试"的每一步,都是在这座工厂里完成的。

Agent 训练的重工业部分,原来长这样:模型是大脑,而每天三百万次的环境起停才是它练手的操场;50 倍的超卖率、三层可组合的镜像,都是为了让这片操场便宜到烧得起。

放回本周的沙箱线看,这条补齐的是规模那一格:卖铲子那篇讲个人创业者跟着潮水换工具、逃逸事件讲沙箱本身会被突破、吴恩达讲约束要写成确定性代码——DSec 讲的是当沙箱成为国家级训练基建时的量级:秒级五千个的创建速度、被模型当成奖励捷径去钻的漏洞、内核级攻击仍无通用防御——这些在论文里都写成了公开的设计约束。头号玩家把弱点一起公开,本身就是行业成熟度的信号。

留一格清楚的边界:这是论文口径的峰值数字,不同负载与机型会有落差;"每天三百万"是沙箱创建次数,不等于三百万次有效训练;安全那段也自认"仍无通用防御"——规模不等于安全,这句论文自己就写着。

给看这条的人一句落地的:记住"每秒 5000"这个量级——下次再看到"agent 训练成本太高"的说法时,你就知道瓶颈未必在模型:环境的起停、镜像的搬运、内存的超卖,这些看不见的工程才是吞金兽;你的小场景学不了全貌,但"三层拆分、按需加载"这两招,几十台机器也用得上。

话题来源 @teortaxesTex 72.8K阅读 ❤️602 x.com/…↗ 已改写,非原文转载
27 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单