TECH 으로 돌아가기
TECH HACKER NEWS 오늘 8분 읽기 20 READS

허깅페이스에서 사라진 모델을 살려낸다: 'Pirate Face'가 던지는 오픈 모델 보존 문제

허깅페이스에서 사라진 모델을 살려낸다: 'Pirate Face'가 던지는 오픈 모델 보존 문제
SOURCE IMAGE · HACKER NEWS
허깅페이스에서 사라진 모델을 살려낸다: 'Pirate Face'가 던지는 오픈 모델 보존 문제

무슨 일이 있었나요?

'Pirate Face'라는 이름의 사이트가 등장했어요. 이름부터 허깅페이스(Hugging Face)를 대놓고 비튼 건데요, 하는 일은 이름 그대로예요. 허깅페이스나 원 배포처에서 삭제됐거나 삭제될 예정인 LLM 모델 가중치를 미리 받아두고, 누구나 다시 내려받을 수 있게 보존하는 거예요.

'모델이 왜 삭제돼?' 싶을 수 있는데, 생각보다 자주 일어나요. 회사가 라이선스 정책을 바꾸면서 예전 버전을 내리는 경우, 법적 문제(저작권, 상표, 초상권)로 게시가 중단되는 경우, 개인이 올린 파인튜닝 모델이 계정 삭제와 함께 사라지는 경우, 스타트업이 문을 닫으면서 저장소가 통째로 없어지는 경우 등이 있죠. 허깅페이스 자체도 무료 저장 용량에 제한을 두기 시작하면서 오래된 저장소가 정리되는 일이 늘었어요.

문제는 LLM 가중치 파일이 수십에서 수백 GB짜리라서, 한번 사라지면 '누군가 백업해뒀겠지'가 잘 안 통한다는 거예요. 그래서 이런 사이트가 나온 거죠.

이게 뭐냐면: 모델 가중치와 '보존'의 의미

잠깐 기본부터 짚고 갈게요. LLM '모델'이라고 하면 코드가 아니라 사실상 거대한 숫자 덩어리예요. 수십억에서 수천억 개의 파라미터(가중치)를 safetensors 같은 파일 형식으로 저장한 건데, 이 파일이 있어야 모델을 실행할 수 있어요. 코드는 깃허브에 남아 있어도 가중치 파일이 없으면 그 모델은 사실상 죽은 거예요.

허깅페이스는 이 가중치 파일을 올리고 받는 사실상의 표준 저장소예요. 깃허브가 코드의 중심이라면 허깅페이스는 모델의 중심이죠. 그런데 단일 회사가 운영하는 중앙 저장소라는 건, 그 회사의 정책이나 법적 판단 하나로 모델이 사라질 수 있다는 뜻이기도 해요.

Pirate Face의 접근은 P2P 시절 해적판 사이트를 떠올리게 해요. 다만 대상이 영화가 아니라 AI 모델이라는 점이 다르죠. 구체적인 방식은 사이트마다 다르지만, 이런 아카이브는 보통 삭제 위험이 있는 모델을 미리 미러링해두고 토렌트나 직접 다운로드 형태로 다시 배포해요. 이름에 'Pirate'를 붙인 건 스스로 '회색 지대'에 있다는 걸 인정하는 셈이에요.

이게 합법인가요? 여기서부터 복잡해져요

핵심 쟁점은 '오픈 모델의 라이선스가 정말 재배포를 허용하느냐'예요.

아파치 2.0이나 MIT 라이선스로 공개된 모델(대표적으로 Qwen, 미스트랄 일부, 딥시크 등)은 원 배포자가 나중에 저장소를 내려도 이미 받은 사람이 재배포하는 게 라이선스상 문제없어요. 오픈소스 라이선스는 한번 부여하면 취소가 안 되거든요. 이 경우 미러 사이트는 사실상 합법적인 보존 활동이에요.

반면 라마(Llama) 커뮤니티 라이선스나 젬마(Gemma) 이용 약관처럼 회사가 만든 커스텀 라이선스는 재배포 조건이 까다로워요. 사용 제한, 이용 약관 동의 요구, 특정 국가 배포 금지 같은 조항이 있죠. 이런 모델을 미러링하면 라이선스 위반이 될 수 있어요. 그리고 저작권 침해로 내려간 모델(예를 들어 특정 인물 목소리를 학습한 음성 모델)을 다시 올리는 건 명백히 문제가 되고요.

그래서 이 사이트는 '디지털 도서관'이냐 '해적판 창고'냐를 두고 의견이 갈릴 수밖에 없어요. 인터넷 아카이브(archive.org)가 웹페이지와 책을 보존하면서 겪은 논쟁이 이제 AI 모델로 넘어온 셈이에요.

업계 맥락: 모델 보존은 누가 책임지나요?

이 논쟁의 배경에는 더 큰 질문이 있어요. '오픈 모델은 정말 오픈인가?'라는 거예요.

지금까지 공개된 중요한 모델들을 떠올려 보세요. 초기 라마 가중치는 원래 연구자 신청제였는데 토렌트로 유출되면서 오픈 모델 생태계가 폭발적으로 성장했어요. 미스트랄이 토렌트 링크 하나로 첫 모델을 공개한 것도 유명하죠. 즉, 오픈 모델 역사 자체가 '누군가 파일을 뿌린' 사건들로 이어져 있어요.

한편 회사들은 점점 더 공개 모델을 관리하려고 해요. 이전 버전을 내리고 새 버전만 남기거나, 라이선스를 바꾸거나, 아예 오픈 웨이트 정책을 축소하기도 하죠. 연구 재현성 관점에서는 심각한 문제예요. 논문에서 'X 모델을 파인튜닝했다'고 했는데 그 X 모델이 사라지면 아무도 결과를 재현할 수 없거든요.

이런 문제에 대응하는 시도가 Pirate Face만은 아니에요. 허깅페이스 안의 미러링 커뮤니티, 각 대학과 연구소의 자체 아카이브, 그리고 IPFS나 비트토렌트 기반의 분산 모델 배포 실험들이 있어요. 다만 대부분은 눈에 잘 띄지 않고, 이렇게 대놓고 '삭제된 걸 살려낸다'고 내건 곳은 드물어요.

한국 개발자에게 주는 시사점

첫째, 프로덕션에 쓰는 오픈 모델은 반드시 자체 저장소에 복사해두세요. 허깅페이스 허브에서 매번 내려받는 구조로 배포하고 있다면, 어느 날 모델이 사라지거나 리비전이 바뀌어서 서비스가 깨질 수 있어요. 특정 커밋 해시를 고정하고, 가중치는 자체 오브젝트 스토리지(S3, 네이버클라우드, 자체 MinIO 등)에 미러링하는 게 기본이에요.

둘째, 라이선스를 진짜로 읽으세요. '오픈 모델이니까 괜찮겠지'가 제일 위험해요. 아파치 2.0인지, 커뮤니티 라이선스인지, 상업 이용 제한이 있는지, 월간 사용자 수 제한이 있는지(라마 3 계열은 7억 MAU 제한이 있어요) 확인해야 해요.

셋째, 국내 연구자와 스타트업이 자체 모델을 공개할 때 보존 계획까지 생각해보면 좋겠어요. 허깅페이스 하나에만 올리지 말고, 국내 기업들이 공개한 한국어 모델을 커뮤니티가 함께 미러링하는 문화가 생기면 생태계가 더 튼튼해질 거예요.

마무리

한 줄로 정리하면, 'Pirate Face는 오픈 모델도 중앙 저장소 하나에 의존하면 언제든 사라질 수 있다는 걸 보여주는 사건'이에요.

여러분은 어떻게 생각하세요? 삭제된 모델을 살려내는 건 보존 활동일까요, 라이선스 위반일까요? 그리고 여러분 팀은 쓰고 있는 오픈 모델 가중치를 어디에 백업하고 있나요?


🔗 출처: Hacker News

SOURCE · HACKER NEWS
원문 전체 보기 → https://pirateface.co/
SHARE
NEXT · CHOOSE

변화를 읽었다면,
내가 만들 수익 구조를 고릅니다.

정보를 더 모으는 데서 멈추지 않고, 광고·외주·판매·중개·구독 중 내 상황에 맞는 출발점을 정해보세요.

21가지 수익 구조 살펴보기
처리 중...