LTX-2 – 开源音视频生成模型

LTX-2 是由 Lightricks 公司推出的首个基于 DiT 架构的音视频生成基础模型

AI视频 部分免费

LTX-2 是由 Lightricks 公司推出的首个基于 DiT 架构的音视频生成基础模型,在单一模型内融合了现代视频生成的所有核心能力:音视频同步、高保真输出、多种表演模式、生产级效果、API 访问和开源权重。

核心技术

LTX-2 采用了全新的 Simple Attention Network 设计,包含 Hadamard MLP 替代传统 FFN、分组查询注意力(GQA)、记忆键值机制和多车道超连接等创新模块。相比同类小模型,LTX-2 在工具调用和设备端推理任务上实现了显著的性能提升,同时将模型体积控制在极小范围内。

工具调用能力

LTX-2 是专为设备端设计的工具调用模型,整个模型是一个单文件 14MB 的二进制文件,在约 28MB 内存中即可完成完整推理会话。内置置信度评分机制,每条响应都附带校准后的置信度分数,用户可以设置阈值自动决定是执行还是升级。工具目录检索功能允许声明大量工具集,内置检索头自动选出每轮对话最相关的五个工具。

部署便捷

LTX-2 提供 pip 安装包,推理和 LoRA 微调代码开箱即用。模型权重托管在 Hugging Face,推理引擎随用随取,无需自行构建,支持离线安装和气隙设备部署。兼容 Python 环境,可在任何支持 Python 的平台上运行。

开源与社区

Lightricks 承诺开源权重并提供完整推理代码,为研究者和开发者提供透明可复现的实验基础。模型已通过 Hugging Face 发布,支持开发者自由探索和二次开发。

团队信息

由 AI 猎手自动发现

评论与建议

0 条评论