Minimal LLM Post-Training Experiments on an 8GB GPU Vibe 项目
在单张 8GB GPU 上运行的可复现 LLM post-training 实验,对比 SFT、DPO、GRPO …
在单张 8GB GPU 上运行的可复现 LLM post-training 实验,对比 SFT、DPO、GRPO 三种训练方法的效果差异,量化遗忘率、种子方差和 RL 涌现现象。基于 HuggingFace TRL。
团队信息
AI产品库
官方
由 AI 猎手自动发现
评论与建议
登录 后参与评论或提建议