时间:2026年8月26日
地点:德国 / 全球(开源发布)
人物:LAION 团队核心作者 Andreas Hochlehnert、Christoph Schuhmann、Jenia Jitsev、Matthias Bethge 等;图宾根大学、马克思·普朗克智能系统研究所参与
事件详情:LAION 于 8 月 26 日正式发布大型开放视频数据集 LAION-BVD(Big Video Dataset),包含从 Common Crawl 抓取的 13 亿条平台视频 URL,其中实际下载 8000 万条视频,总时长达到 1000 万小时。研究团队利用内容感知场景检测,从中抽取 5500 万个视频片段并合成生成视频与音频描述,同时提取 3 亿帧画面用作图文对。论文显示,基于 LAION-BVD 训练的模型在常用视频-文本与音频-文本基准测试中,相较基于 InternVid 训练的同规模模型最高有 2.1 个百分点的提升,且随训练规模与模型规模扩大而持续提升。LAION 已将该数据集与配套代码以研究用途的形式公开发布,GitHub 仓库同步上线。
背景:LAION 是开源图像数据集 LAION-5B 的出品方,长期为社区提供训练数据,但在视频领域一直缺少能够对标商用闭源语料的大规模开放数据集。LAION 援引 2024 年汉堡地方法院的一项裁定,该裁定允许非营利机构为非商业研究目的抓取受版权保护的内容,为 BVD 的数据收集提供了法律基础。
影响:LAION-BVD 是目前规模最大的开源视频预训练数据集之一,填补了开源社区在视频-音频-图像多模态预训练上的关键空白,使中小团队也能训练视频理解、音频对齐、跨模态检索等模型,与 Google、Meta 等闭源视频语料形成补充。3 亿帧的视觉分布与网页图像差异明显,也可作为大规模图文检索语料单独使用。
总结:LAION 用 1000 万小时的开源视频,把开放社区的多模态训练拉到了能跟闭源语料对标的体量。
参考来源:
- https://laion.ai/blog/
- https://projects.laion.ai/bvd/
- https://the-decoder.com/laion-drops-massive-open-video-dataset-with-10-million-hours-of-footage-for-ai-research/
- https://arxiv-troller.com/paper/3277650
- https://agihunt.info/en/e/1a03c18ac2873bbc7049a2fe96e
- https://tldr.takara.ai/p/2608.24845
- https://github.com/LAION-AI/BVD









