CellularFlow

基于关联记忆的持续学习大语言模型架构

LLM大模型 部分免费

CellularFlow 是一个内存增强的神经架构,专门设计用于解决大型语言模型在持续学习场景中的灾难性遗忘问题。该项目将知识存储与序列推理解耦,用多头关联 DNA 记忆库替代传统的密集前馈网络,使模型能够在不遗忘已有知识的前提下,持续吸收新领域的知识。 项目背景 标准 Transformer 架构(如 LLaMA、GPT 系列)在学习新任务时会产生灾难性遗忘:学习新知识后,之前掌握的领域准确率会大幅下降。CellularFlow v4 通过创新的记忆增强设计,在多领域顺序学习实验中实现了 83.9% 的知识保留率(对比标准 Transformer 的 61.8%),同时支持推理时实时学习而无需反向传播。 核心功能 多头关联 DNA 记忆库。CellularFlow 的核心创新是将传统的 FFN/MLP 层替换为多头关联记忆模块(CMCLayer),每个注意力头维护独立学习的键值关联库,头部之间分别专攻句法、语义和领域知识等不同子空间。这种设计让知识以离散、可寻址、可剪枝的形式存储,而非散乱纠缠在模型权重中。 三种运行模式灵活切换。模式一(实时学习):推理时通过指数移动平均(EMA)实时更新 DNA 记忆值,零反向传播开销,配合球面各向异性正则化防止向量崩溃。模式二(选择性微调):冻结约 85% 的骨干网络(投影层、嵌入层、LayerNorm),仅训练 DNA 记忆库,保留基础知识的同时快速吸收新领域。模式三(事实注入):将外部知识写入情景记忆槽,通过时间衰减机制(exp(-0.005 * age))定期将高频事实整合到 DNA 记忆库中。 O(T) 线性序列注意力。替换二次方复杂度的传统注意力机制为 FlashAttention + NTK 感知的动态 RoPE,实现线性时间复杂度的序列计算。同时将记忆查询与增量 KV 缓存解耦,大幅提升推理效率。 交互式可视化仪表板。提供玻璃态风格的 Web 仪表板,支持实时文本生成、层级记忆槽利用率查看以及实时事实注入测试。开发者可以在浏览器中直观观察记忆模块的工作状态。 技术实现 CellularFlow 将混合计算路径融合进统一的 CMC 层架构。输入序列经两条路径并行处理:一路进入多头 DNA 关联记忆库,另一路进入情景记忆槽缓冲层(支持快速写入),两路结果经门控融合后进入带 RoPE 的因果多头自注意力层。每个头部维护学习的键值关联库,通过 Top-K 稀疏路由和探索性高斯扰动(防止死亡记忆槽)计算输出权重。项目使用 Python ≥ 3.11 和 PyTorch ≥ 2.4.0 构建,在 62KB 多领域语料上进行了标准化评估,GPT-mini 基线困惑度 8.51、准确率 36.4%,CellularFlow v4 有显著提升。 快速上手 第一步,克隆代码库并安装依赖:git clone https://github.com/celcilin/cellularflow.git && cd cellularflow && pip install -e .;如需 GPU 加速需额外安装 PyTorch CUDA 版本。 第二步,下载预训练检查点文件,放到 checkpoint/CMC_BaseModel.pt 路径下。 第三步,启动 FastAPI 服务器:uvicorn server.app:app --host 0.0.0.0 --port 8000,然后在浏览器打开 http://localhost:8000 进入交互式仪表板。 第四步,使用交互式 CLI playground:python analysis.py --checkpoint checkpoint/CMC_BaseModel.pt --interactive,可在命令行测试文本生成和记忆注入功能。 第五步,按需切换运行模式:set_mode("selective") 进入选择性微调模式;inject_fact() 注入外部事实;推理时开启 inference_write=True 启用实时学习模式。 适用人群 从事大模型持续学习、增量学习研究的科研人员。需要让 AI 系统在部署后持续吸收新知识的产品工程师。对记忆增强神经网络架构感兴趣的学术研究者和高校学生。构建需要动态更新知识库(RAG 替代方案)的 AI 应用开发者。 开源协议 项目采用 MIT 许可证开源,代码可在 GitHub 仓库自由获取和修改。 项目链接 https://github.com/celcilin/cellularflow

团队信息

由 AI 猎手自动发现

评论与建议

0 条评论