디지털 콘텐츠에 삽입되는 '워터마크(watermark)'라는 단어는 오랫동안 진위 확인이나 소유권 주장을 위한 눈에 보이는 표식을 뜻했다. 지폐의 위조 방지 장치나 저작권 표시 오버레이가 대표적이다. 그런데 최근 이 용어가 전혀 다른 성격의 기술까지 뭉뚱그려 지칭하게 되면서 문제가 생겼다. 사용자가 인지하거나 동의하지 않은 채 콘텐츠를 추적 가능하게 만드는 숨겨진 신호까지 '워터마크'로 불리고 있기 때문이다. 원문 저자는 이런 은닉 추적 신호를 별도로 '스파이마크(spymark)'라 부르자고 제안한다. 기존 워터마크가 사용자에게 보이고 대개 악의적이지 않은 반면, 스파이마크는 눈에 보이지 않으면서 그 목적이 사용자에게 적대적이라는 점을 언어 차원에서 명확히 하자는 것이다.
눈에 보이지 않는 식별자
가장 널리 알려진 사례는 구글의 SynthID다. 구글은 이 기술이 이미지, 오디오, 텍스트, 영상에 '사람이 지각할 수 없는(imperceptible to humans)' 숨겨진 신호를 심는다고 설명한다. 문제는 이 신호가 단순한 'AI 생성물 여부' 표시를 넘어 데이터베이스 식별자를 담을 수 있다는 데 있다. 구글의 SynthID-Image 논문에 따르면 SynthID-O 변형은 512×512 픽셀 이미지에 136비트 페이로드를 인코딩할 수 있다. 이는 64비트 데이터베이스 식별자를 담고도 72비트를 오류 정정용으로 남길 만큼 넉넉한 용량이다. 이 식별자가 사용자 기록과 연결되면 이름, IP 주소, 생년월일, 주소, 정치 성향 같은 정보까지 특정 이미지 한 장에 사실상 연동될 수 있다는 것이 저자의 우려다.
스파이마크는 SynthID에만 국한되지 않는다. 오디오 영역에서는 파형을 시간 영역에서 미세하게 바꾸거나 주파수 영역의 특징을 수정하는 방식으로 사람이 들을 수 없는 신호를 심는다. 이런 기법은 압축이나 재인코딩을 견디도록 설계된다는 점이 핵심이다. 오픈소스 도구 audiowmark는 2018년에 등장해 오디오에 128비트 페이로드를 숨기고 AES 비밀키로 보호할 수 있는데, 키가 없는 사용자는 이를 해독조차 할 수 없다. 텍스트에서도 마찬가지다. SynthID는 단어 선택을 통계적으로 유도해 특정 패턴을 만들고, 여기에 추적용 페이로드를 담을 수 있다. 즉 픽셀, 파형, 단어 어느 층위든 은닉 식별자를 끼워 넣을 여지가 있다는 뜻이다.
기존 메타데이터와 무엇이 다른가
실무자 입장에서 중요한 구분은 스파이마크가 우리가 다뤄 온 표준 메타데이터와 근본적으로 다르다는 점이다. 사진의 EXIF 태그나 MP3의 ID3 태그는 표준화되고 문서화된 필드다. EXIF가 GPS 좌표 같은 민감 정보를 노출할 수 있긴 하지만, 이런 필드는 사용자가 직접 열어보고 수정하고 삭제할 수 있다. 반면 픽셀이나 오디오, 단어 선택에 새겨진 스파이마크 신호는 애초에 눈에 보이지 않아 존재 자체를 파악하기 어렵다. 게다가 표준 메타데이터를 제거해도 신호가 파일에 남을 수 있고, 일부 편집을 거쳐도 살아남도록 설계된다. 곡 제목이나 노출 설정처럼 사용자에게 유용한 정보를 담는 태그와 달리, 스파이마크는 사용자에게 아무 쓸모없고 불투명한 추적 식별자만 담는다.
이런 은닉 추적 자체는 생성형 AI 이전에도 존재했다. 1980년대부터 쓰인 프린터 추적용 노란 점(tracking dots)이 초기 사례로 꼽힌다. 다만 지금 달라진 것은 규모다. 소셜미디어, 콘텐츠 제작 도구, 스마트폰이 이런 알고리즘으로 채워지면 사용자가 게시하는 거의 모든 것에 신호가 스며들 수 있다. 저자는 모든 기기가 인증(attestation)되고 모든 게시물에 계정 연동 신호가 붙는 미래를 상정한다. 계정 기록과 콘텐츠가 어디에 나타나는지에 대한 관찰을 결합하면, 한 장의 JPEG이나 한 건의 게시물에서 출처를 역추적하는 일이 위험할 정도로 쉬워진다는 것이다. 내부 고발자나 특정 성향을 드러내고 싶지 않은 사람에게 이는 특히 불리하다.
실무적 함의와 한계
한국 IT 실무자 관점에서 이 논의는 두 가지를 시사한다. 첫째, 콘텐츠 파이프라인을 다루는 조직이라면 '워터마크'라는 한 단어 아래 진위 확인용 표식과 추적용 신호가 섞여 있다는 점을 인지하고, 자사가 채택·연동하는 도구가 어느 쪽인지 구체적으로 확인할 필요가 있다. 둘째, 메타데이터 제거만으로 프라이버시가 보장된다는 통념이 더 이상 안전하지 않다는 점이다. 표준 태그를 지워도 픽셀·파형 층위의 신호는 남을 수 있기 때문이다.
다만 이 글의 성격과 한계도 분명히 해 둘 필요가 있다. 원문은 특정 벤더를 상대로 한 기술 분석 보고서라기보다, '스파이마크'라는 새 용어를 통해 프라이버시 위험을 대화의 전면에 끌어내려는 주장에 가깝다. SynthID의 136비트 페이로드나 audiowmark의 128비트 같은 수치는 인코딩 용량이라는 기술적 사실이지만, 그 용량이 실제로 개인 식별자와 연결되어 대규모로 운용되고 있다는 것은 저자가 그린 시나리오이지 확인된 배포 현황은 아니다. 기업들은 이들 기술을 AI 생성 콘텐츠 식별 수단으로 내세운다. 결국 이 용어 제안이 설득력을 가지려면 각 시스템이 실제로 무엇을 인코딩하고 누가 해독 키를 쥐는지에 대한 검증이 뒤따라야 한다. 그럼에도 '이름을 부르는 것이 곧 그것을 통제하는 것'이라는 인용처럼, 기술을 정확히 명명하는 일이 논의의 출발점이라는 저자의 문제의식은 실무자에게도 되새길 만하다.