7.4 万星、ACL 2024 收录、大厂都在用:LlamaFactory 想让微调大模型变成零代码的事

7.4 万星、ACL 2024 收录、大厂都在用:LlamaFactory 想让微调大模型变成”零代码”的事

你可能已经听说过 LlamaFactory——那个把”微调大模型”这件事变得像搭积木一样简单的开源框架。但你可能不知道的是,它已经跑进了 Amazon SageMaker、NVIDIA RTX AI Toolkit 和阿里云 PAI-DSW 的官方集成里,Google Scholar 引用突破 1000 次,GitHub Star 超过 7.4 万。

最近,这个项目发布了 v0.9.5,距离上一个重磅版本 v0.9.4 过去了五个月。这次更新带来了 OFT 正交微调、KTransformers 后端、FP8 训练等新能力,同时仓库名也从 LLaMA-Factory 正式更名为 LlamaFactory。站在 7.4 万星这个节点上,这是一个值得认真看一下的项目。


LlamaFactory 解决的是什么问题

微调大模型的门槛,长期以来高得离谱。哪怕你只是想用 LoRA 在一张 4090 上跑一个 7B 参数的模型,也得折腾数据集格式、训练循环、显存分配、评估脚本……稍有不慎就是 CUDA OOM,或者模型训出来效果一塌糊涂。

LlamaFactory 的核心思路是:把这些复杂度全部封装起来,给开发者留出足够用的配置项,但不让他们接触到底层的 torch.cuda.set_device。它既不是玩具级的一键脚本,也不是重量级的分布式训练框架——它的目标用户是想快速验证想法、把模型落地到真实场景的中小团队。

具体来说,它统一了微调的整个流程:数据准备 → 训练 → 评估 → 导出推理。三个入口,CLI、Web UI(LLaMA Board)和 Python API,覆盖从”第一次听说微调到模型跑在生产环境”的全路径。


100+ 模型、全部主流对齐方法

LlamaFactory 目前支持 100 多个 LLMs 和 VLMs,包括 Qwen3/Qwen2.5-VL、Gemma 3、DeepSeek-R1、GLM-4.1V、Llama 4、MiniCPM-o-2.6 等主流模型,且新模型通常在发布当天(Day-0)就能获得支持。9 月初刚推送的 commit 显示,团队正在持续扩展多模态数据训练能力。

训练方法上,它覆盖了业界几乎所有主流方案:

  • 全量微调 / Freeze / LoRA / QLoRA(2~8bit量化)/ DoRA / PiSSA / OFT
  • 对齐方法:SFT、RLHF、PPO、DPO、KTO、ORPO、SimPO

这意味着,无论你是想做纯指令微调,还是走完整的 RLHF 流程,或者只是用 DPO 做偏好对齐,LlamaFactory 都有对应的实现,不需要自己从 trl 库里拼装。

v0.9.5 的几个新特性值得关注。OFT(正交微调) 由上海交通大学的团队提出(arXiv:2506.19847),与 LoRA 不同,OFT 不依赖低秩近似,而是通过正交变换保持原模型能力,适合对微调扰动更敏感的场景。KTransformers 后端则允许用 2 张 4090 + CPU 内存微调 1000B 参数的模型,对于没有 A100/H100 的团队来说,这是目前最低成本的千亿参数微调方案之一。


硬件门槛:一张卡能跑多大

这是很多人真正关心的。LlamaFactory 官方给出了一份显存需求表:

方法 精度 7B 14B 30B 70B
全量微调 bf16 60GB 120GB 300GB 600GB
LoRA / QLoRA 4bit 6GB 12GB 24GB 48GB
QLoRA 2bit 4GB 8GB 16GB 24GB

一张 RTX 4090(24GB)可以跑通 7B 模型的全流程 LoRA 微调,14B 模型用 QLoRA 4bit 也能压在 12GB 以内。FSDP+QLoRA 方案下,两张 24GB 显存的卡可以跑 70B 模型——这个配置在个人开发者和小团队中相当常见。

加速方面,Unsloth 集成让 LoRA 训练速度提升 170%,长序列(Llama-2-7B-56k)仅需 24GB 显存,比 FlashAttention-2 快 17% 并节省 50% 显存。vLLM 推理加速可达 270%。


上手体验:零代码 Web UI 能做到什么程度

如果你不想碰命令行,LLaMA Board(Gradio Web UI)提供了完整的可视化界面:选择模型 → 上传/选择数据集 → 配置训练参数 → 开始微调 → 对话测试 → 导出模型。全部鼠标操作,不需要写任何代码。

但这里有个边界需要注意:Web UI 适合跑通流程、做概念验证。对于生产级任务——比如大批量数据实验、多卡训练、分布式推理——最终还是要回到 YAML 配置和 CLI。LLaMA Factory 的设计逻辑是”UI 降低入门门槛,CLI/Python 承接工程复杂度”,两者不是替代关系。


谁该用、谁该等

适合用 LlamaFactory 的场景:

  • 想快速微调一个垂直领域模型(客服、教育、医疗),但没有分布式训练团队
  • 需要在同一批基座模型上做对比实验,挑选最优基座
  • 团队没有大模型训练经验,希望用标准化工具链管理实验
  • 需要消费级显卡能跑得动的方案(7B~14B 模型为主)

可以先等等的场景:

  • 需要微调超过 70B 的超大模型——这需要 DeepSpeed/Megatron-LM 级别的分布式能力,LlamaFactory 可以通过 MCoreAdapter 接入,但运维复杂度会大幅上升
  • 对微调算法有非常强的定制需求(比如自创的对齐方法)——框架覆盖不了的部分,改起来不一定比手写快
  • 追求极致训练吞吐量——对于日均处理 PB 级数据的场景,专用训练框架(如 Megatron-LM 原生)效率更高

下一步建议

如果你想实际跑一下,官方提供了几条免费路径:

如果你在选型阶段,核心判断标准是:你的团队有没有 ML 工程能力。完全没有 → 从 Web UI 开始;有 CLI 经验 → 用 YAML 配置跑标准流程;有分布式训练经验 → 直接上手 FSDP/QLoRA + DeepSpeed。

LlamaFactory 的价值不在于它是”最强大”的微调框架,而在于它把门槛降到了足够低的水平——让更多人在自己的显卡上就能验证想法,而不是等到有了 A100 才能开始。

评论区

0 条评论

登录后可评论。

星火·GitHub 快讯 16 阅读