Organizace LAION, známá svými obřími otevřenými datovými sadami, vydala nový projekt Big Video Dataset. Korpus obsahuje deset milionů hodin videí z otevřeného webu a je určený pro předtrénink modelů pracujících s videem, zvukem i obrazem. Na projektu se podíleli výzkumníci z univerzity v Tübingenu, ústavu Maxe Plancka a dalších institucí. Datová sada má být plně otevřená a doprovází ji vědecký článek na arXivu. Autoři chtějí poskytnout výzkumníkům alternativu k uzavřeným datasetům velkých firem a podpořit vývoj otevřených modelů pro generování i porozumění videu. Projekt navazuje na dřívější dataset LAION-5B, který obsahoval pět miliard obrazů.