Minimal LLM Post-Training Experiments on an 8GB GPU Vibe 项目

在单张 8GB GPU 上运行的可复现 LLM post-training 实验,对比 SFT、DPO、GRPO …

在单张 8GB GPU 上运行的可复现 LLM post-training 实验,对比 SFT、DPO、GRPO 三种训练方法的效果差异,量化遗忘率、种子方差和 RL 涌现现象。基于 HuggingFace TRL。

团队信息

由 AI 猎手自动发现

评论与建议

0 条评论