TECH 으로 돌아가기
TECH HACKER NEWS 오늘 6분 읽기 26 READS

게임 잡지 5,000권이 검색 가능한 데이터로, 비디오게임역사재단 아카이브가 보여주는 디지털 보존의 현실

게임 잡지 5,000권이 검색 가능한 데이터로, 비디오게임역사재단 아카이브가 보여주는 디지털 보존의 현실
SOURCE IMAGE · HACKER NEWS
게임 잡지 5,000권이 검색 가능한 데이터로, 비디오게임역사재단 아카이브가 보여주는 디지털 보존의 현실

무슨 일이 있었나

미국 비영리단체 비디오게임역사재단(Video Game History Foundation, VGHF)의 디지털 아카이브에 등록된 게임 잡지가 5,000권을 넘었어요. 재단은 이 소식과 함께 앞으로의 방향도 공유했고요. 숫자만 보면 “잡지를 많이 스캔했네” 정도로 들릴 수 있어요. 그런데 개발자 관점에서 보면 꽤 흥미로운 데이터 엔지니어링 프로젝트이기도 하거든요.

VGHF는 게임 역사가 프랭크 시팔디(Frank Cifaldi)가 2017년에 세운 단체예요. 개발 자료, 홍보물, 잡지 같은 게임 관련 기록을 모아 보존하고, 연구자와 일반인이 볼 수 있게 공개하는 일을 하고 있어요.

왜 하필 잡지일까

인터넷 이전 시대에 게임 잡지는 사실상 업계의 실시간 기록 장치였어요. 발매 전 프리뷰, 개발자 인터뷰, 리뷰 점수, 광고, 독자 편지까지 그 시대 게이머와 업계가 무슨 생각을 했는지가 고스란히 담겨 있거든요. 문제는 종이 잡지가 시간이 지나면 바래고, 찢어지고, 버려진다는 거예요. 소장자가 세상을 떠나면 컬렉션 전체가 사라지기도 하고요.

VGHF가 2023년 소프트웨어 보존 네트워크(SPN)와 함께 발표한 연구에 따르면, 2010년 이전에 미국에서 출시된 고전 게임의 약 87%를 지금은 정식으로 구할 수 없어요. 게임 자체가 이렇게 사라지고 있으니, 그 게임을 기록한 잡지는 더 중요한 1차 사료가 되는 거죠.

기술적으로 보면: 스캔에서 검색까지

잡지 한 권을 ‘검색 가능한 데이터’로 만드는 데는 생각보다 손이 많이 가요.

첫 단계는 고해상도 스캔이에요. 제본을 풀어서 평판 스캐너로 스캔할지, 원본을 살려둔 채 촬영할지부터 정해야 해요. 색 보정이나 페이지 순서 검수도 필요하고요.

다음은 OCR(광학 문자 인식)이에요. 이게 뭐냐면, 이미지 속 글자를 컴퓨터가 읽을 수 있는 텍스트로 바꾸는 기술이에요. 그런데 게임 잡지는 OCR이 가장 다루기 힘든 문서 중 하나예요. 화려한 배경 위에 글자가 올라가 있고, 여러 단으로 편집된 지면에 말풍선과 게임 스크린샷 속 글자까지 뒤섞여 있거든요. 레이아웃 분석이 틀리면 옆 단의 문장이 섞여서 엉뚱한 텍스트가 나와요.

마지막은 메타데이터와 검색이에요. 어느 호 몇 페이지에서 어떤 게임을 다뤘는지, 기사 제목과 필자는 누구인지가 정리돼 있어야 “1994년에 이 게임을 처음 소개한 잡지가 어디였지?” 같은 질문에 답할 수 있어요. 그러니까 5,000권은 단순한 스캔 분량이 아니라, 이 파이프라인을 수천 번 돌렸다는 뜻이에요.

업계 맥락: 저작권이라는 벽

디지털 보존의 가장 큰 장애물은 기술보다 법이에요. VGHF와 SPN은 연구자가 보존된 게임에 원격으로 접근할 수 있도록 미국 저작권법(DMCA)에 예외 조항을 만들어달라고 요청했어요. 하지만 2024년 미국 저작권청은 게임 업계 단체(ESA)의 반대 속에 이 요청을 받아들이지 않았어요. 그래서 보존 단체들은 저작권이 걸린 자료를 어디까지, 누구에게, 어떻게 공개할지 늘 줄타기하듯 판단해야 해요.

잡지 아카이브도 이 고민에서 자유롭지 않아요. 인터넷 아카이브(Internet Archive)가 전자책 대출 문제로 출판사들과 소송을 벌였다가 패소한 사례를 보면, 디지털 공개는 선의만으로 해결되지 않는다는 걸 알 수 있어요. VGHF가 접근 범위를 어떻게 넓혀가는지는 다른 보존 프로젝트들에도 좋은 참고가 될 거예요.

한국 개발자에게 주는 시사점

한국에도 「게임챔프」, 「게임월드」, 「PC챔프」 같은 게임 잡지가 있었고, PC통신 시절 게임 커뮤니티 기록도 남아 있어요. 그런데 이 자료들이 체계적으로 디지털화돼서 검색할 수 있는 상태로 보존되고 있는지 생각해보면 아쉬운 부분이 많아요. 제주 넥슨컴퓨터박물관 같은 의미 있는 시도가 있긴 하지만, 누구나 검색해서 볼 수 있는 공개 아카이브는 아직 부족한 편이에요.

개발자가 기여할 수 있는 부분도 분명해요. 한글 OCR, 특히 옛날 인쇄체나 복잡한 지면 레이아웃 인식은 여전히 어려운 문제예요. 요즘은 비전 언어 모델(VLM)로 레이아웃과 텍스트를 함께 이해하는 접근도 나오고 있고요. 디지털 아카이브는 OCR, 검색 엔진, 메타데이터 설계를 한꺼번에 다뤄볼 수 있어서 사이드 프로젝트 주제로도 좋아요.

마무리

한줄 정리: 게임 잡지 5,000권의 디지털화는 추억 보존을 넘어, 사라져가는 문화를 데이터로 되살리는 엔지니어링 작업이에요.

다시 보고 싶은 옛날 게임 잡지나 PC통신 자료가 있으신가요? 한국 게임 역사 아카이브를 만든다면 어떤 방식이 현실적일까요?


🔗 출처: Hacker News

SOURCE · HACKER NEWS
원문 전체 보기 → https://gamehistory.org/5k-magazines/
SHARE
NEXT · CHOOSE

변화를 읽었다면,
내가 만들 수익 구조를 고릅니다.

정보를 더 모으는 데서 멈추지 않고, 광고·외주·판매·중개·구독 중 내 상황에 맞는 출발점을 정해보세요.

21가지 수익 구조 살펴보기 →
처리 중...