探所 Curio 再探再报 了解探所 →
#AI

LAION 放出 1000 万小时开源视频数据集

LAION 放出了 Big Video Dataset(BVD),规模上把开源视频数据集的记录拉高一个量级:从 CommonCrawl 收录的 13 亿条视频 URL 里下载了 **8000 万个视频、共 1000 万小时**,再抽出 **5500 万条片段**,每条都带自动生成的视频与音频描述,外加 3 亿张静止帧。按论文,这约是此前最大同类数据集 InternVid 的 13 倍。

💡 为什么值得看13 倍规模、全模型生成,多模态预训练者的机遇与陷阱。

查证

来源档案

The Decoder

AI 行业英文媒体,综合报道官方项目页与论文

事实数字与官方项目页/arXiv 论文一致,可信程度较高;但其标注模型细节与 legal 判断属转述,建议以论文原文为准

延伸阅读

合成标注的隐患 · the-decoder.com 5 分钟
数据集规模虽大但描述全由模型生成且未经人工校验,做数据工程的人应关注这一点对下游训练质量的影响
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store