时间:2026年9月22日
地点:北京(中国)
人物:龙芯中科(Loongson)
事件详情:龙芯中科于9月22日正式推出支持自研通用GPU的"龙芯加速计算平台"(Loongson Accelerated Computing Platform)首个软件版本。该平台基于龙芯2K3000及9A1000内置的自研LG200系列通用GPU核心开发,提供从底层驱动、编程环境到AI模型推理的全栈一体支持,是国内首个全栈国产GPU软件平台。
核心组件方面,平台覆盖算力芯片驱动、编译器、运行时环境、高性能算子库(BLAS/DNN)、推理引擎LacInfer、调试工具与性能分析套件。平台同时兼容OpenCL 3.0与CUDA两类主流编程模型接口,开发者可将基于CUDA开发的AI应用低成本迁移至龙芯平台。
AI推理层面,龙芯自研推理引擎LacInfer通过算子融合、常量折叠、算子消除和布局转换等手段优化计算图,已完成对目标检测、图像分割、姿态估计等主流视觉模型的深度优化,并作为执行后端集成进ONNX Runtime,支持PyTorch、TensorFlow导出模型直接部署。
背景:长期以来,国产GPU面临的最大瓶颈并非硬件算力而是软件生态——CUDA作为英伟达护城河在全球AI开发中占据绝对主导地位,国产GPU若不能兼容CUDA/OpenCL等主流编程模型,将难以吸引开发者迁移。龙芯此次发布的平台是国产GPU首次实现"硬件+驱动+编译器+算子库+推理引擎"完整栈的对外公开,被业内视为国产算力生态建设的标志性事件。
影响:该平台覆盖龙芯全系列算力芯片,并计划随9A2000、9A3000等后续芯片同步演进,实现代际兼容。早期客户已基于2K3000、9A1000开展多款具身智能设备研发,应用场景拓展至工业视觉、智能安防、智慧零售、车载感知等领域。
总结:龙芯中科以"兼容CUDA/OpenCL + 全栈一体"策略切入国产AI算力市场,首次把国产GPU从单点硬件升级为完整软件平台,显著降低国产算力生态迁移门槛,为后续9A2000/9A3000等新品铺路,也是国内AI基础设施去CUDA化的关键一步。
参考来源:
1. IT之家:https://www.ithome.com/1/005/595.htm
2. 快科技:https://news.mydrivers.com/1/1153/1153027.htm
3. 网易科技:https://www.163.com/dy/article/L7E66MED0511CPVM.html
4. 金融界:https://finance.jrj.com.cn/2026/09/22113258507454.shtml
5. 新浪财经:https://finance.sina.com.cn/tech/digi/2026-09-22/doc-inissitp2230220.shtml
6. 智东西:https://zhidx.com/p/596011.html
7. 龙芯中科官网(背景):https://www.loongson.cn/
8. Jon Peddie Research:https://www.jonpeddie.com/news/loongsons-newest-gpu/







