웹 서비스를 만들다 보면 봇을 걸러내기 위해 CAPTCHA를 붙이는 일이 흔하다. "횡단보도가 있는 사진을 모두 고르세요", "택시를 포함한 칸을 클릭하세요" 같은 이미지 인식 문제 말이다. 표면적으로 이 테스트는 '당신이 사람인가'를 묻는다. 그러나 한 블로거는 정작 이 테스트가 검증하는 것은 인간성이 아니라 특정 문화권의 상식이라고 지적한다. 그는 어린 시절 치른 IQ 검사에서 "사탕이 25센트인데 조니가 다임을 가지고 있다면 니켈이 몇 개 더 필요한가"라는 문제에 막혔던 경험을 떠올린다. 자기 나라에는 니켈도 다임도, 센트 단위조차 없었기 때문이다. 문제를 풀 실력이 없어서가 아니라, 출제자가 응시자와 같은 문화권에 산다고 전제했기 때문에 풀 수 없었던 것이다.
노란 택시와 소화전이라는 전제
최근 그가 마주친 CAPTCHA는 '택시를 고르라'는 것이었다. 문제는 그의 나라에서 택시가 대체로 검은색이라는 점이다. 노란 택시는 뉴욕이나 로스앤젤레스처럼 미국의 일부 도시에서나 통하는 이미지이고, 실제로 미국 안에서도 아이다호에서는 노란 택시를 본 적이 없고 보이시의 최대 택시 회사는 초록색 차를 쓴다는 댓글이 달렸다. 독일에서는 택시가 관례적으로 RAL 1015(연한 아이보리) 색이라는 이야기도 나온다. 색으로 택시를 판별하려는 순간 이미 전제가 무너지는 셈이다. 소화전, 크로스워크(횡단보도), 사이드워크(인도) 역시 마찬가지다. 소화전을 실물로 한 번도 본 적 없다는 사람, 미국식 도로 규범이 전 세계에 통용된다고 가정한 사진 때문에 시각적으로 애를 먹는다는 사람들의 불만이 이어진다. 글쓴이는 이 문제의 핵심을 "전 세계 이용자의 6%에게만 성립하는 가정 위에 인터넷을 설계해서는 안 된다"는 한 문장으로 요약한다.
번역만으로는 해결되지 않는다
흥미로운 대목은 문제 텍스트를 모국어로 번역해도 편향이 사라지지 않는다는 점이다. 한 네덜란드 사용자는 CAPTCHA가 네덜란드어로 '자전거를 모두 고르라'고 요구해 놓고 정작 오토바이 사진만 보여줬다고 전한다. 네덜란드어에서 자전거와 오토바이는 다른 단어인데도 그렇다. 언어는 현지화했지만 이미지에 담긴 대상 분류와 문화적 기준은 그대로였던 것이다. 로컬라이제이션이 단순한 문자열 번역이 아니라 대상·범주·시각적 관습까지 아우르는 작업이라는 점을 이보다 잘 보여주는 사례도 드물다. 통화 은어를 둘러싼 댓글들도 같은 맥락이다. 알바니아·폴란드·아르헨티나에서는 화폐 개혁 뒤에도 노인들이 옛 단위로 값을 말하고, 러시아에서 "루블 좀 줘"가 1루블인지 1000루블인지는 두 사람의 상황을 알아야 판별된다. 맥락 지식이 없으면 정답이 성립하지 않는다는 구조가 CAPTCHA와 정확히 겹친다.
접근성과 실무적 함의
실무자 입장에서 이 이야기는 단순한 불평 이상의 의미를 갖는다. 첫째는 접근성이다. 글쓴이는 도로 표지판을 5분간 고르다 실패했는데, 기둥까지 포함해야 하는지, 구석에 잘린 조각도 세야 하는지, 두 칸에 걸친 신호등은 양쪽 다 골라야 하는지 같은 모호함이 원인이었다. 실패하면 시스템이 더 까다로워지고 대체 문제도 주지 않아, 결국 시크릿 모드로 바꿔야 통과했다는 경험담이 이어진다. 시각장애가 있거나 저시력인 이용자, 작은 화면에서 확대도 못 하는 모바일 이용자에게 이 벽은 훨씬 높다. 둘째는 이 이미지 문제들이 실은 자율주행차 학습 데이터를 라벨링하는 무료 노동이라는 점이다. 특정 국가의 도로 풍경으로 사람을 거르고 동시에 모델을 학습시킨다면, 런던의 검은 택시나 영국의 노란 승용차를 오분류하는 편향이 데이터 단계에서부터 스며들 수 있다.
셋째는 봇 방어 논리 자체의 허점이다. 한 댓글 작성자는 일부러 오답을 내도 여전히 사람으로 인정받는다고 말한다. 정답 여부보다 마우스 움직임 같은 행동 신호로 판별하는 경우가 있다는 뜻인데, 그렇다면 이용자에게 미국식 상식을 강요하는 이미지 문제는 방어 효과에 비해 마찰과 배제 비용만 키우는 설계일 수 있다. 국내 서비스를 만드는 개발자라면, 글로벌 CAPTCHA 위젯을 그대로 붙이기 전에 그것이 우리 이용자에게 어떤 문화적 전제를 요구하는지, 접근성 대체 수단은 있는지 점검할 필요가 있다.
다만 이 글은 2017년 개인 블로그 글과 그에 달린 댓글 모음이라는 점을 감안해야 한다. 체계적인 통과 실패율 통계나 특정 CAPTCHA 서비스의 정확한 오분류 지표를 제시하지는 않으며, '6%'라는 수치도 근거가 명시되지 않은 저자의 표현이다. 이후 CAPTCHA 기술도 위험 기반·행동 기반 판별로 상당 부분 옮겨갔다. 그럼에도 이 글이 던지는 질문은 여전히 유효하다. 인간임을 증명하라면서 실은 특정 문화의 회원증을 요구하고 있지는 않은가. 인증이든 IQ 검사든, '보편적'이라 믿는 기준이 사실은 누군가의 지역적 상식일 뿐일 때 그 시스템은 조용히 일부 이용자를 배제한다.