57,834 颗星、2 小时、3 块钱:从零训练一个 LLM 是什么样的体验

大模型训练这件事,大多数人止步于”下载模型 → 跑推理”。真正想搞清楚从零到一的训练链路?要么去看 Paper 里的数学公式,要么去买几千块的付费课程——中间那条路,几乎没人认真填过。

直到这个项目出现。

jingyaogong/minimind 是一个从零复现 LLM 全链路的开源项目,当前 57,834 颗 Star,7,525 个 Fork。最小版本参数量约 64M,体积是 GPT-3 的 1/2700,可以在单张 NVIDIA 3090 上用约 3 块钱电费、2 小时完成从零训练。不是推理,是真正的 Pretrain + SFT + RLHF 全流程。

它到底是什么

主线代码覆盖以下几个阶段,全部从 0 用 PyTorch 原生实现,不依赖 transformers / trl / peft 提供的高层抽象:

  • Pretrain:语言模型预训练,最小规模版本约 64M 参数
  • SFT:监督微调,让模型学会对话格式和指令遵循
  • LoRA:低秩适配微调,降低微调成本
  • RLHF-DPO:基于直接偏好优化的强化学习训练
  • RLAIF:支持 PPO / GRPO / CISPO 等多种 RLAIF 算法
  • Tool Use / Agentic RL:工具调用能力与 Agent 强化学习训练
  • 模型蒸馏:将大模型能力迁移到小模型

2026 年 4 月发布的 v3 版本,将主干结构全面对齐 Qwen3 / Qwen3-MoE 生态,最新模型规格如下:

模型 参数量 发布时间
minimind-3 64M Dense 2026.04.01
minimind-3 MoE 198M-A64M 2026.04.01
minimind2 104M 2025.04.26
minimind2-small 26M 2025.04.26

此外项目还衍生出了 MiniMind-V(视觉模型)和 MiniMind-O(多模态 Omni 模型),生态在持续扩展。

谁在做这件事

项目作者是北京航空航天大学的 @jingyaogong。从 2024 年 9 月发布 v1 版本至今,保持着稳定的更新节奏。v3 于 2026 年 4 月 1 日发布,是目前最新的主线版本。

README 的第一句话直接点出项目初衷:”这不仅是一个大语言模型全阶段开源复现项目,也是一套面向 LLM 入门与实践的教程。”作者在文档里写道,他相信”用乐高自己拼出一架飞机,远比坐在头等舱里飞行更让人兴奋”——这大概解释了这个项目的定位:不是给从业者用的生产工具,而是给想真正理解 LLM 内部机制的人的学习路径。

真实使用门槛

这里说几个实际的问题:

硬件要求是多少? 64M 版本可以在单张 3090 上完成训练,按官方说法最低仅需 2G 显存即可推理。更小的 26M 版本在部分场景下可以用消费级显卡甚至 MacBook 本地跑完。真实成本大约是 3 元电费(3090 跑 2 小时),这在 CSDN 博客 上有网友的实测记录。

代码是否真的可复现? 有一定 Python 深度学习经验的人可以跟着 README 跑通全流程。官方提供了完整的训练数据集和预处理脚本,HuggingFace 和 ModelScope 上都有预训练好的模型权重可以直接下载体验推理。

适合谁? 对 LLM 训练链路有好奇心、想从代码层面理解 Transformer 是怎么训练的开发者;想给学生或团队讲清楚 GPT 实际工作原理的教育者;以及想找一个轻量级基座模型做定制微调的个人开发者。

不适合谁? 已经在用 LLM 做生产业务、关心的是推理速度和部署成本,而不是训练过程本身的人。64M 参数的模型能力有限,无法和 GPT-4 或 Qwen3 比肩,用它做实际产品开发并不现实。

社区反应

从搜索结果来看,这个项目在中文技术社区的讨论热度不低。CSDN 上有多篇详细的复现教程,知乎上也有技术博主做深度解析。多数反馈集中在”终于有一个能跟着跑完的 LLM 训练教程”——这个需求比想象中大得多。

英文社区的传播主要靠 GitHub 本身和 HPC / AI 爱好者博客,项目 README 同时提供中英文两个版本。

链接资源

下一步建议

如果你想亲自跑一遍,建议按这个路径走:

  1. 先读 README中文版在项目根目录),搞清楚环境和依赖
  2. 下载预训练权重HuggingFaceModelScope 上有 v1 到 v3 全系列模型权重,先跑通推理确认环境正常
  3. 跑 SFT 阶段:Pretrain 最耗时,先从 SFT 开始体验完整训练流程,2 小时足够
  4. 尝试 LoRA 微调:用你自己的业务数据跑一个轻量微调,感受小模型的定制能力边界
  5. 读 train_agent.py:如果你对 Agent 训练感兴趣,v3 的 Agentic RL 脚本是目前最小可运行的 Agent 训练 Demo 之一

这个项目的价值不在于模型本身有多强,而在于它提供了一条从数学公式到真实跑通的最短路径。

评论区

0 条评论

登录后可评论。