MiniMind Vibe 项目
**项目简介** MiniMind 是一个完全从零开始训练超小型语言模型的开源项目
项目简介
MiniMind 是一个完全从零开始训练超小型语言模型的开源项目,主线最小版本仅 64M 参数(约 GPT-3 的 1/2700),用单张 NVIDIA RTX 3090 在 2 小时内即可完成训练,GPU 租用成本约 3 元钱。项目的目标是把大模型训练的完整流程拆开、摊平,让每一个普通开发者、研究生、AI 爱好者都能亲眼看到、亲手跑通从"一堆词向量"到"会聊天的大模型"的全过程,而不是永远停留在"调 API"或"微调 LoRA"阶段。2026 年 4 月最新发布的 minimind-3 系列在模型结构上全面对齐 Qwen3 生态,支持原生 Tool Use 与 Agentic RL 训练,是目前最完整的迷你 LLM 全流程开源复现项目。
核心功能
-
全链路从零实现:所有核心算法(Transformer、MoE、RoPE、Attention)均使用 PyTorch 原生代码实现,不依赖任何高层封装库,代码可读性与教学性极强。
-
完整训练流程覆盖:Pretrain → SFT → LoRA → RLHF(DPO)→ RLAIF(PPO / GRPO / CISPO)→ Tool Use → Agentic RL → 模型蒸馏,完整覆盖现代 LLM 训练的所有阶段。
-
多模型架构系列:除主线 Dense 模型外,同时开源 MiniMind-V(视觉)、MiniMind-O(多模态 Omni)、MiniMind-dLM(扩散语言模型)、MiniMind-Linear(线性注意力),可续训可扩展。
-
极低训练门槛:64M 参数版本单卡 3090 即可训练,MoE 版本(198M-A64M)也只需数卡并行,让个人开发者也能跑完全套流程。
-
兼容主流生态:模型兼容 transformers、trl、peft、llama.cpp、vllm、ollama 等常用推理与训练框架,支持 FastGPT、Open-WebUI 等第三方 ChatUI 接入。
-
配套轻量级工具:提供基于 Streamlit 的聊天 WebUI(支持思考过程展示与 Tool Call 可视化),以及兼容 OpenAI API 协议的极简服务端,方便快速部署与调用。
技术实现
MiniMind 的技术路线是一次对现代 LLM 训练体系的全景式复现。数据层面,项目开源了经过收集、清洗、去重后的高质量预训练语料与 SFT 数据集,并公开了数据处理脚本,研究者可自行替换数据源进行实验。Tokenizer 基于 BPE + ByteLevel 重新训练,新增了 Tool Call 标记、思考标记与预留 buffer token,支持模型原生的工具调用与自适应思考能力。
模型结构上,主线 Dense 模型(64M)对齐 Qwen3 生态的架构设计,MoE 版本(198M-A64M)在多个专家模块间实现稀疏激活。训练流程从预训练的因果语言建模开始,经过有监督微调(SFT)注入指令跟随能力,再通过 DPO/GRPO/CISPO 等离线偏好学习算法进一步对齐人类偏好,最后进入 Agentic RL 阶段——让模型在多轮对话中学习使用工具、规划任务,形成真正的"干活能力"。整个过程中,关键的归一化、位置编码、注意力机制均从零手写,确保研究者能深入理解每一步的实现细节。
快速上手
-
环境准备:克隆仓库,安装 Python 依赖(transformers、torch、trl、peft 等),确保至少有单张 16GB 以上显存 GPU。
-
数据配置:项目已内置预处理好的预训练与 SFT 数据路径,也可按文档指引替换为自己的数据集进行自定义训练。
-
启动训练:执行预训练脚本(Pretrain)从随机初始化开始,约 2 小时 / 1 epoch;完成后运行 SFT 脚本注入对话能力;最后可选运行 DPO / GRPO 偏好对齐脚本。
-
推理体验:训练完成后,使用 WebUI(streamlit run web_demo.py)或 OpenAI API 服务端(python serve_openai_api.py)直接体验对话效果,支持 Tool Call 与思考过程展示。
适用人群
- 对大模型内部原理感兴趣、想"从零理解 Transformer 是怎么work"的 AI 研究者与学生;
- 希望掌握完整 LLM 训练链路、不满足于只会"调 API"的开发者;
- 需要轻量级本地模型用于边缘部署、隐私场景的工程师;
- 想通过实战理解 RLHF、Tool Use、Agentic RL 等前沿技术的 AI 爱好者;
- 计算机科学相关专业学生,用于课程设计、毕业设计或科研入门实践。
评论与建议
登录 后参与评论或提建议