7.4 万星、ACL 2024 收录、大厂都在用:LlamaFactory 想让微调大模型变成零代码的事
7.4 万星、ACL 2024 收录、大厂都在用:LlamaFactory 想让微调大模型变成”零代码”的事
你可能已经听说过 LlamaFactory——那个把”微调大模型”这件事变得像搭积木一样简单的开源框架。但你可能不知道的是,它已经跑进了 Amazon SageMaker、NVIDIA RTX AI Toolkit 和阿里云 PAI-DSW 的官方集成里,Google Scholar 引用突破 1000 次,GitHub Star 超过 7.4 万。
最近,这个项目发布了 v0.9.5,距离上一个重磅版本 v0.9.4 过去了五个月。这次更新带来了 OFT 正交微调、KTransformers 后端、FP8 训练等新能力,同时仓库名也从 LLaMA-Factory 正式更名为 LlamaFactory。站在 7.4 万星这个节点上,这是一个值得认真看一下的项目。
LlamaFactory 解决的是什么问题
微调大模型的门槛,长期以来高得离谱。哪怕你只是想用 LoRA 在一张 4090 上跑一个 7B 参数的模型,也得折腾数据集格式、训练循环、显存分配、评估脚本……稍有不慎就是 CUDA OOM,或者模型训出来效果一塌糊涂。
LlamaFactory 的核心思路是:把这些复杂度全部封装起来,给开发者留出足够用的配置项,但不让他们接触到底层的 torch.cuda.set_device。它既不是玩具级的一键脚本,也不是重量级的分布式训练框架——它的目标用户是想快速验证想法、把模型落地到真实场景的中小团队。
具体来说,它统一了微调的整个流程:数据准备 → 训练 → 评估 → 导出推理。三个入口,CLI、Web UI(LLaMA Board)和 Python API,覆盖从”第一次听说微调到模型跑在生产环境”的全路径。
100+ 模型、全部主流对齐方法
LlamaFactory 目前支持 100 多个 LLMs 和 VLMs,包括 Qwen3/Qwen2.5-VL、Gemma 3、DeepSeek-R1、GLM-4.1V、Llama 4、MiniCPM-o-2.6 等主流模型,且新模型通常在发布当天(Day-0)就能获得支持。9 月初刚推送的 commit 显示,团队正在持续扩展多模态数据训练能力。
训练方法上,它覆盖了业界几乎所有主流方案:
- 全量微调 / Freeze / LoRA / QLoRA(2~8bit量化)/ DoRA / PiSSA / OFT
- 对齐方法:SFT、RLHF、PPO、DPO、KTO、ORPO、SimPO
这意味着,无论你是想做纯指令微调,还是走完整的 RLHF 流程,或者只是用 DPO 做偏好对齐,LlamaFactory 都有对应的实现,不需要自己从 trl 库里拼装。
v0.9.5 的几个新特性值得关注。OFT(正交微调) 由上海交通大学的团队提出(arXiv:2506.19847),与 LoRA 不同,OFT 不依赖低秩近似,而是通过正交变换保持原模型能力,适合对微调扰动更敏感的场景。KTransformers 后端则允许用 2 张 4090 + CPU 内存微调 1000B 参数的模型,对于没有 A100/H100 的团队来说,这是目前最低成本的千亿参数微调方案之一。
硬件门槛:一张卡能跑多大
这是很多人真正关心的。LlamaFactory 官方给出了一份显存需求表:
| 方法 | 精度 | 7B | 14B | 30B | 70B |
|---|---|---|---|---|---|
| 全量微调 | bf16 | 60GB | 120GB | 300GB | 600GB |
| LoRA / QLoRA | 4bit | 6GB | 12GB | 24GB | 48GB |
| QLoRA | 2bit | 4GB | 8GB | 16GB | 24GB |
一张 RTX 4090(24GB)可以跑通 7B 模型的全流程 LoRA 微调,14B 模型用 QLoRA 4bit 也能压在 12GB 以内。FSDP+QLoRA 方案下,两张 24GB 显存的卡可以跑 70B 模型——这个配置在个人开发者和小团队中相当常见。
加速方面,Unsloth 集成让 LoRA 训练速度提升 170%,长序列(Llama-2-7B-56k)仅需 24GB 显存,比 FlashAttention-2 快 17% 并节省 50% 显存。vLLM 推理加速可达 270%。
上手体验:零代码 Web UI 能做到什么程度
如果你不想碰命令行,LLaMA Board(Gradio Web UI)提供了完整的可视化界面:选择模型 → 上传/选择数据集 → 配置训练参数 → 开始微调 → 对话测试 → 导出模型。全部鼠标操作,不需要写任何代码。
但这里有个边界需要注意:Web UI 适合跑通流程、做概念验证。对于生产级任务——比如大批量数据实验、多卡训练、分布式推理——最终还是要回到 YAML 配置和 CLI。LLaMA Factory 的设计逻辑是”UI 降低入门门槛,CLI/Python 承接工程复杂度”,两者不是替代关系。
谁该用、谁该等
适合用 LlamaFactory 的场景:
- 想快速微调一个垂直领域模型(客服、教育、医疗),但没有分布式训练团队
- 需要在同一批基座模型上做对比实验,挑选最优基座
- 团队没有大模型训练经验,希望用标准化工具链管理实验
- 需要消费级显卡能跑得动的方案(7B~14B 模型为主)
可以先等等的场景:
- 需要微调超过 70B 的超大模型——这需要 DeepSpeed/Megatron-LM 级别的分布式能力,LlamaFactory 可以通过 MCoreAdapter 接入,但运维复杂度会大幅上升
- 对微调算法有非常强的定制需求(比如自创的对齐方法)——框架覆盖不了的部分,改起来不一定比手写快
- 追求极致训练吞吐量——对于日均处理 PB 级数据的场景,专用训练框架(如 Megatron-LM 原生)效率更高
下一步建议
如果你想实际跑一下,官方提供了几条免费路径:
- Colab(免费):直接打开 https://colab.research.google.com/drive/1eRTPn37ltBbYsISy9Aw2NuI2Aq5CQrD9 ,T4 显卡即可跑通 LoRA 微调 Qwen3-8B 的完整流程。
- 阿里云 PAI-DSW(免费试用):https://gallery.pai-ml.com 提供预装环境,适合国内用户。
- Docker(最干净):
docker pull hiyouga/llamafactory:latest,官方镜像基于 Ubuntu 22.04 + CUDA 12.4 + Python 3.11,开箱即用。
如果你在选型阶段,核心判断标准是:你的团队有没有 ML 工程能力。完全没有 → 从 Web UI 开始;有 CLI 经验 → 用 YAML 配置跑标准流程;有分布式训练经验 → 直接上手 FSDP/QLoRA + DeepSpeed。
LlamaFactory 的价值不在于它是”最强大”的微调框架,而在于它把门槛降到了足够低的水平——让更多人在自己的显卡上就能验证想法,而不是等到有了 A100 才能开始。
评论区
登录后可评论。