TECH 으로 돌아가기
TECH HACKER NEWS 오늘 6분 읽기 26 READS

1000만 시간 규모 오픈 영상 데이터셋 'LAION-BVD', 멀티모달 연구의 문턱을 낮추다

멀티모달 인공지능의 성능이 데이터의 규모와 품질에 좌우된다는 사실은 이제 상식에 가깝다. 그러나 대규모 영상 데이터, 특히 영상과 음성, 이미지를 한꺼번에 아우르는 학습용 데이터는 소수의 빅테크 기업 내부에 집중되어 있어 외부 연구자가 접근하기 어렵다는 구조적 한계가 있었다. 비영리 연구 조직 LAION이 공개한 'LAION-BVD(Big Video Dataset)'는 이 병목을 정면으로 겨냥한 시도다. 총 1000만 시간 분량, 8000만 개의 영상으로 구성된 이 데이터셋은 현재까지 공개된 것 중 멀티모달 학습 연구용으로는 가장 큰 규모라고 소개된다.

어떻게 만들어졌나

LAION-BVD의 출발점은 웹 아카이브인 커먼크롤(Common Crawl)이다. 연구진은 여기서 플랫폼별 영상 URL 13억 개를 수집했고, 그 가운데 8000만 개의 영상을 실제로 내려받아 처리했다. 이렇게 모인 영상의 총 재생 시간이 1000만 시간에 이른다. 단순히 영상 파일을 쌓아둔 것이 아니라, 장면 전환을 인식하는 콘텐츠 기반 씬 감지(scene detection) 기술로 영상을 짧은 클립 단위로 잘라내고, 각 클립에 대해 영상 설명문과 음성 설명문을 합성적으로 생성했다. 즉 사람이 일일이 라벨을 다는 대신 모델이 캡션을 자동 생성하는 방식으로 대규모 주석 문제를 해결한 것이다.

주목할 만한 부분은 영상을 이미지 학습 자원으로도 재활용했다는 점이다. 연구진은 장면이 바뀌는 프레임을 추출해 이미지-텍스트 사전학습용 데이터로 삼았는데, 이 프레임들이 기존 웹 이미지 말뭉치와는 시각적 분포가 뚜렷이 다르다는 특징을 보였다고 설명한다. 웹에서 긁어모은 정지 이미지가 주로 가공되거나 선별된 사진인 반면, 영상에서 뽑은 프레임은 자연스러운 순간을 담고 있어 기존 데이터를 보완하는 성격을 갖는다는 의미다.

성능 검증 결과

LAION은 데이터를 공개하는 데 그치지 않고 실제 학습 성능도 함께 제시했다. 영상-텍스트 분야에서는 ViCLIP 모델을 이 데이터로 학습했을 때 기존 InternVid로 학습한 모델과 대등하거나 표준 벤치마크 기준 최대 2.1%포인트까지 앞섰으며, 학습 클립 규모를 1000만에서 5000만으로 늘릴수록 성능이 꾸준히 개선됐다고 밝혔다. 음성 쪽에서는 CLAP 모델이 영상에서 직접 추출한 실제 환경의 다양한 소리를 활용해 다른 대규모 비정제 오디오 데이터셋과 견줄 만한 성능을 냈다. 프레임 기반 CLIP 모델 역시 이미지-텍스트 검색에서 준수한 결과를 보였다.

이 결과들이 실무자에게 시사하는 바는 분명하다. 하나의 원천, 즉 웹상의 영상에서 영상·음성·이미지라는 세 가지 모달리티의 학습 데이터를 동시에 뽑아낼 수 있다는 점이다. 데이터 수집과 정제 파이프라인을 세 갈래로 따로 구축하는 대신, 영상 한 축에서 파생시키는 접근은 자원이 제한된 연구팀이나 스타트업에게 특히 매력적이다. 규모를 키울수록 성능이 일관되게 오른다는 관찰도, 데이터 확보가 곧 경쟁력인 현재 상황에서 실용적 신호로 읽힌다.

개방의 의미와 남는 과제

LAION이 이 데이터셋을 내놓은 명분은 재현 가능성과 투명성이다. 대규모 영상 데이터와 그것으로 학습된 모델이 주로 폐쇄적인 기업 내부에 집중되면서 독립적인 과학적 검증이 어려워지고 있다는 문제의식이 배경에 깔려 있다. 개방된 자원이 있어야 학계가 대형 멀티모달 모델의 능력뿐 아니라 안전성까지 투명하게 평가할 수 있다는 것이다.

다만 활용에는 분명한 조건과 한계가 따른다. LAION-BVD는 연구 목적으로만 공개되며 상업적 이용은 허용되지 않는다. 데이터가 커먼크롤에서 수집된 만큼 창작자의 권리와 저작권, 각 플랫폼의 이용약관을 존중해야 한다는 단서도 붙어 있다. 실제로 URL 기반으로 배포되는 대규모 데이터셋은 원본 링크의 소멸이나 법적 지위를 둘러싼 논란에서 자유롭지 않았던 전례가 있어, 도입을 검토하는 조직이라면 이 부분을 신중히 따져야 한다.

내용상의 편향 문제도 간과할 수 없다. LAION 측은 다른 대규모 웹 데이터와 마찬가지로 이 데이터셋에도 편견과 고정관념, 언어·지역·주제별 불균형이 존재할 수 있으며 학습된 모델이 이를 그대로 물려받을 수 있다고 명시했다. 결국 LAION-BVD는 그동안 소수 기업이 독점하던 영상 학습 자원의 문을 크게 넓혔다는 데 의의가 있지만, 그 데이터를 쓰는 연구자와 개발자에게는 성능 지표와 함께 편향과 한계를 스스로 측정하고 보고할 책임이 남는다.

SOURCE · HACKER NEWS
원문 전체 보기 → https://projects.laion.ai/bvd/
SHARE
NEXT · CHOOSE

변화를 읽었다면,
내가 만들 수익 구조를 고릅니다.

정보를 더 모으는 데서 멈추지 않고, 광고·외주·판매·중개·구독 중 내 상황에 맞는 출발점을 정해보세요.

21가지 수익 구조 살펴보기
처리 중...