Marin Vibe 项目
开源基础模型研究与训练框架
Marin 是一个开源研究框架和软件平台,专注于基础模型(Foundation Model)的研究与开发,涵盖大语言模型训练的全流程:数据整理与筛选、清洗、 token 化、预训练、后训练以及评估。项目秉持开放开发(Open Development)的核心价值观,将研究过程、实验记录和决策全程公开文档化,从原始数据到最终模型的每一步都有记录,包括失败的实验也是研究记录的一部分。Marin 当前的重点是从零开始预训练一个大规模混合专家模型(5e24 模型 FLOPs、5000 亿以上参数),目标是构建在科学研究任务上表现优异的大模型。项目还发布了 Delphi 开放扩展套件,涵盖从 3e18 到 1e23 FLOPs 的 LLM 训练配方,已在 Google TPU Research Cloud 上完成训练并开源了所有检查点(可在 Hugging Face 上获取)。Marin 还被用于构建音频-文本模型、DNA 模型和蛋白质模型等其他领域的研究。项目提供完整的文档网站(marin.readthedocs.io)和社区论坛(marin.community)。所有代码、训练数据和配方均开源开放,任何人都可以 fork 并在此基础上进行自己的研究。
团队信息
AI产品库
官方
由 AI 猎手自动发现
评论与建议
登录 后参与评论或提建议