时间:2026年9月11日
地点:美国加利福尼亚州山景城(LinkedIn总部)
人物:LinkedIn 工程团队(Yiming Yue、Animesh Singh、Fedor Borisyuk、Muchen Wu、Sriram Vasudevan、Vitaly Abdrashitov、Lijuan Zhang 等)
事件详情:LinkedIn 工程博客披露 AI 求职搜索训练基础设施细节,公开多教师蒸馏(Multi-Teacher Distillation)管线设计,将 0.6B 参数的紧凑学生模型蒸馏自 8B 相关性教师与 1.7B 参与度教师。该框架基于开源 SGLang 引擎构建在线/离线蒸馏切换,配合 LiGer 内核、多节点训练、FSDP2 与 H200 集群,端到端训练耗时从 45 小时压缩至 5 小时以内,整体提速 8 倍;NDCG@10 从 0.7583 跃升至 0.9432,相关性指标提升 24.48%。推理端采用结构化剪枝与上下文压缩,单 GPU 排序吞吐从约 290 提升至 2000+ items/s。
背景:AI 求职搜索是 LinkedIn 核心业务,每秒处理数十万次查询,传统关键词检索难以理解语义;直接上线大模型则受限于推理延迟与成本。LinkedIn 此前已上线"语义检索 + SLM 重排"两阶段架构,本次首次公开训练侧基础设施细节。系统还给出 FP8 混合精度的负面结果:在 8B 以下模型中,由于类型转换开销反超计算收益,因此并不启用。
影响:该管线已在美国市场生产环境上线,支撑自然语言求职搜索;其在线/离线分离、LiGer 内存优化、FSDP2 分布式策略的工程经验对其他推荐/搜索团队具直接复用价值,并将工业级 SLM 蒸馏基准从 45 小时压缩至 5 小时内。Pinterest、DeepSeek-V4、NVIDIA Nemotron 3 Ultra 等同样采用多教师蒸馏路线,工业级"训练即瓶颈"问题正在被系统级优化逐步解决。
总结:LinkedIn 通过多教师蒸馏与系统级协同优化,把 0.6B 学生 SLM 训练提速 8 倍至 5 小时内,NDCG@10 提升 24.48%,证明在大模型工业化部署中"训练基础设施"与"模型架构"同等关键。
参考来源:
- https://www.linkedin.com/blog/engineering/infrastructure/the-training-infrastructure-behind-ai-powered-job-search-eight-x-faster-multi-teacher-distillation
- https://www.infoq.com/news/2026/09/linkedin-ai-multi-teacher/
- https://daily.dev/posts/the-training-infrastructure-behind-ai-powered-job-search-8x-faster-multi-teacher-distillation-sfwknf7xt
- https://www.contentbuffer.com/news/linkedins-ai-job-search-training-infrastructure-details-revealed-e9b991fd
- https://aipulselab.tech/news/how-linkedin-trains-ai-job-search-8x-faster-with-multi-teacher-distillation-9480d6
- https://news.lavx.hu/article/linkedin-trains-ai-job-search-8x-faster-with-multi-teacher-distillation
- https://www.linkedin.com/posts/yiming-yue_the-training-infrastructure-behind-ai-powered-activity-7492753420215472128-2Asj
- https://www.linkedin.com/posts/animeshsingh1_the-training-infrastructure-behind-ai-powered-activity-7492666706742464512-KaCA
- https://github.com/sgl-project/sglang
- https://github.com/linkedin/Liger-Kernel/









