TECH 으로 돌아가기
TECH HACKER NEWS 오늘 7분 읽기 22 READS

PDF 위조는 너무 쉬운데, 왜 위조된 논문은 거의 없을까?

위조하기 가장 쉬운 문서, 그런데 위조는 거의 없다?

혹시 PDF 파일을 열어서 숫자 하나 바꿔본 적 있으세요? 사실 이건 누구나 할 수 있어요. 그런데 이상하죠. 이렇게 쉬운데도 위조된 PDF, 특히 위조된 논문이나 보고서를 실제로 본 적은 거의 없을 거예요. 이 이상한 현상을 파고든 글이 있어요. gwern.net을 운영하는 Gwern이 2022년에 쓴 에세이 「PDF Forgeries Are Surprisingly Rare」인데요. Gwern은 자기 사이트에 수천 개의 논문 PDF를 직접 호스팅하고 있고, 그만큼 학술 문서를 많이 다뤄본 사람이에요. 그런 그가 "PDF 위조는 기술적으로 너무 쉬운데, 왜 실제로는 거의 안 일어나는 걸까?"라는 질문을 던진 거죠.

PDF가 왜 이렇게 위조하기 쉬운 걸까

이게 뭐냐면, PDF는 그냥 파일 포맷일 뿐이에요. 종이에 찍힌 인쇄물이 아니라 텍스트와 이미지의 배치 정보를 담은 데이터 덩어리거든요. 디지털 서명이 붙어 있지 않은 PDF는 원본과 사본, 진짜와 가짜를 구분할 방법이 아예 없어요. 예를 들어 학술 논문을 위조하고 싶다면 이런 방법이 있어요.

셋 다 몇 시간이면 충분하고, 결과물은 진짜와 구분이 안 가요. 학술지 PDF에 워터마크가 찍혀 있긴 하지만 그걸 실제로 검증하는 사람은 거의 없고, DOI(논문마다 붙는 고유 번호)를 눌러서 출판사 원본과 대조해 보는 독자도 드물죠. 그러니까 기술적 관점에서만 보면 PDF는 "누구나 위조할 수 있고, 아무도 검증하지 않는" 문서인 셈이에요.

그런데 왜 위조가 드물까

Gwern의 핵심 관찰은 여기서 시작해요. 이렇게 쉬운데도 위조 사례가 거의 발견되지 않는다는 건, 문서의 신뢰가 기술이 아니라 다른 것에 의해 지켜지고 있다는 뜻이거든요. 몇 가지 이유를 짚어볼 수 있어요.

첫째, 위조해서 얻는 이득이 생각보다 작아요. 논문 하나를 위조해서 뭘 할 수 있을까요? 인용 수를 올리려면 다른 연구자들이 그 논문을 찾아 읽어야 하는데, 그러면 원본이 없다는 게 금방 드러나요. 둘째, 위조가 진짜 중요한 순간에는 반드시 검증이 일어나요. 채용 심사, 학위 심사, 법정 증거 같은 상황에서는 출판사 원본이나 기관 기록과 대조하니까 걸리게 되어 있죠. 셋째, 걸렸을 때의 손실이 너무 커요. 연구자 커리어가 끝나는 수준이니까 기대값 계산이 안 맞아요.

재미있는 건, 학계에서 실제로 문제가 되는 부정행위는 PDF 위조가 아니라는 점이에요. 데이터를 조작한 논문을 정식 심사 절차를 통과시켜 진짜 학술지에 싣는 "논문 공장(paper mill)" 문제가 훨씬 심각하거든요. 즉 공격자는 파일을 위조하는 대신 정식 채널을 통과하는 쪽을 택해요. 그게 더 오래 살아남고 더 큰 이득을 주니까요.

보안 엔지니어가 배울 점: 위협 모델

이 글이 개발자에게 주는 진짜 교훈은 위협 모델(threat model)에 대한 거예요. 위협 모델이 뭐냐면, 우리 시스템을 누가, 왜, 어떻게 공격할 것인지를 정리한 시나리오예요. 보안 설계를 할 때 흔히 저지르는 실수가 "기술적으로 가능한 공격"과 "실제로 일어나는 공격"을 혼동하는 거거든요. PDF 위조는 가능하지만 거의 일어나지 않아요. 반대로 피싱 메일은 기술적으로 아무것도 아닌데 매일 수천 건씩 성공하죠.

기술적으로는 PDF에 디지털 서명(PAdES 같은 표준)을 붙이거나, 해시값을 별도로 공개하거나, 최근에는 C2PA처럼 콘텐츠의 출처와 편집 이력을 기록하는 표준도 나와 있어요. 하지만 Gwern의 요지는 그런 게 없어도 시스템이 굴러간다는 거예요. 사회적 신뢰, 평판, 검증 비용의 구조가 기술적 보안 장치 역할을 대신하고 있는 셈이죠.

한국 개발자에게 주는 시사점

실무에서 문서 검증 기능을 설계할 일이 은근히 많아요. 전자계약, 증빙서류 업로드, 재직증명서 확인 같은 것들이요. 이때 "위조 방지를 위해 모든 문서에 서명 검증을 붙이자"고 하기 전에, 그 위조가 실제로 얼마나 자주 일어나는지, 위조로 얻는 이득이 뭔지를 먼저 물어보세요. 정말 위조 유인이 큰 문서(통장 사본, 신분증)와 그렇지 않은 문서를 같은 강도로 방어하는 건 개발 비용만 늘리는 일이거든요. 반대로 사용자가 늘고 위조 유인이 커지는 시점에는 신뢰 기반 구조가 무너질 수 있으니, 그때를 대비한 검증 경로는 미리 열어두는 게 좋아요.

다만 한 가지 변수가 있어요. 이 글은 2022년에 쓰였고, 그 뒤로 생성형 AI가 문서 위조 비용을 훨씬 더 낮췄어요. 위조가 드물었던 이유 중 하나가 "귀찮음"이었다면, 그 장벽은 이미 많이 낮아졌죠.

정리

한줄 요약: 문서의 신뢰는 암호 기술보다 인센티브 구조가 지켜주고 있으며, 보안 설계는 "가능한 공격"이 아니라 "일어나는 공격"에 맞춰야 해요.

여러분은 어떻게 생각하세요? AI로 그럴듯한 문서를 몇 초 만에 만들 수 있는 지금도 "위조는 드물다"는 관찰이 유효할까요? 여러분이 만드는 서비스에서는 문서 검증 강도를 어떻게 정하고 계신지 궁금해요.


🔗 출처: Hacker News

SOURCE · HACKER NEWS
원문 전체 보기 → https://gwern.net/blog/2022/pdf-forgery
SHARE
NEXT · CHOOSE

변화를 읽었다면,
내가 만들 수익 구조를 고릅니다.

정보를 더 모으는 데서 멈추지 않고, 광고·외주·판매·중개·구독 중 내 상황에 맞는 출발점을 정해보세요.

21가지 수익 구조 살펴보기
처리 중...