Shopify CEO Tobi Lütke今天晒了一个挺夸张的内部案例。 他们…

Shopify CEO Tobi Lütke今天晒了一个挺夸张的内部案例。 他们在Buyer Profile这个高度垂直的任务上,把Qwen3.5-0.8B微调后,内部Judge得分做到84.6,超过GPT-5.6 Sol xhigh的83.0,也远高于此前线上2B模型的77.2。 更离谱的是效率。System Prompt从9.1K tokens压到1.1K,吞吐从每天200万个Profile,直接干到7200万,36倍。 这个模型是一轮轮喂数据滚出来的:7月23日,2.9万样本,得分75.3;7月27日,4.2万样本,得分78.1;7月30日,5.4万样本,得分84.6。Tobi把它叫做self-improving recursive flywheel,自我改进的递归飞轮。 背后其实是Shopify已经搭了一套Universal Distillation Platform:拿前沿模型当Teacher,给定数据、Eval和目标小模型,自动完成蒸馏和微调。他们甚至把支撑这套ML实验和Pipeline的Tangle开源了。 Shopify工程负责人Farhan Thawar说,这种模式经常能同时拿到更高准确率、更低延迟和更低成本,代价就是牺牲通用性。 这个案例挺重要的。很多公司的AI架构可能会变成:最强模型负责探索、标注和当Teacher,然后把成熟、高频、边界清晰的任务不断蒸馏成0.xB、1B、3B的专用模型。前沿模型越来越强,反而可能养出越来越多小模型。人类折腾了几年大模型,最后又把模型拆回一堆专业小工种,组织架构的轮回感相当完整。
话题来源 @MaxForAI 33.8K阅读 ❤️251 x.com/…↗ 已改写,非原文转载 Max For AI (@MaxForAI) on X 🚨0.8B 小模型,把 GPT-5.6 Sol xhigh 打了。 Shopify CEO Tobi Lütke 今天晒了一个挺夸张的内部案例:他们在 Buyer Profile 这个高度垂直的任务上,把 Qwen3.5-0.8B 微调后,内部 Judge 得分做到 84.6,超过 GPT-5.6 Sol xhigh 的 83.0,也远高于此前线上 2B 模型的 77.2。 更离谱的是效率。 X (formerly Twitter)
27 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单