#AI
LAION 放出 1000 万小时开源视频数据集
LAION 放出了 Big Video Dataset(BVD),规模上把开源视频数据集的记录拉高一个量级:从 CommonCrawl 收录的 13 亿条视频 URL 里下载了 **8000 万个视频、共 1000 万小时**,再抽出 **5500 万条片段**,每条都带自动生成的视频与音频描述,外加 3 亿张静止帧。按论文,这约是此前最大同类数据集 InternVid 的 13 倍。
💡 为什么值得看13 倍规模、全模型生成,多模态预训练者的机遇与陷阱。
查证
来源档案
The Decoder
AI 行业英文媒体,综合报道官方项目页与论文
事实数字与官方项目页/arXiv 论文一致,可信程度较高;但其标注模型细节与 legal 判断属转述,建议以论文原文为准
延伸阅读
数据集规模虽大但描述全由模型生成且未经人工校验,做数据工程的人应关注这一点对下游训练质量的影响