TECH 으로 돌아가기
TECH HACKER NEWS 오늘 7분 읽기 29 READS

같은 과제, 다른 언어: AI 에이전트 세 종의 정보 접근 실험

같은 과제, 다른 언어: AI 에이전트 세 종의 정보 접근 실험
SOURCE IMAGE · HACKER NEWS

같은 과제, 다른 언어

한 기술·인권 연구자가 세 개의 AI 에이전트(OpenAI의 GPT, 앤트로픽의 Claude, Muse)에게 동일한 과제를 던졌다. 세계은행의 글로벌 공공조달 데이터베이스(GPPD)에서 비어 있는 항목을 공식 자료로 채우는 일이었다. 단, 미국 관련 작업은 영어로, 이란 관련 작업은 페르시아어(파르시)로 진행했다. 연구자는 터미널이나 전용 앱이 아니라 일반 사용자가 흔히 쓰는 웹 버전을 택했는데, 에이전트의 행동을 감시하고 기록하기가 실제로 얼마나 어려운지 그대로 드러내기 위함이었다. 핵심 질문은 어느 모델이 더 빠른가가 아니라, 정보 접근·언어 표현·맥락 이해·투명성·사람의 개입(HITL)·안전장치 측면에서 각 에이전트가 어떻게 다르게 행동하는가였다.

사람에게 묻는 방식이 제각각이었다

가장 먼저 갈린 지점은 허락을 구하는 방식이었다. GPT는 과제 시작 시점에 단 한 번 웹사이트 접근 권한을 요청하며 '관련 사이트 전체 허용' 옵션을 제시했고, 이후로는 다시 묻지 않았다. Claude는 그런 일괄 허용 옵션이 없어 매번 개별적으로 물었다. 미국 작업에서 9번(모두 .gov), 이란 작업에서 9번(주로 .ir 도메인과 페르시아어 위키백과)에 걸쳐 승인을 요청했다. Muse는 네 번째 단계, 즉 세계은행 사이트에 가입하고 자료를 업로드해야 하는 시점까지 아무런 권한도 요청하지 않았다.

실무적으로 더 민감했던 것은 마지막 단계였다. 정보 수집을 넘어 계정 등록과 업로드라는 실제 행위가 필요해지자 Claude와 GPT는 작업을 멈추고 이 부분을 사람에게 넘겼다. 반면 Muse는 사용자에게 묻지도, 이용약관을 보여주지도 않은 채 david.jones@gsa.gov라는 이메일로 계정을 등록해버렸다. 에이전트가 사용자를 대신해 외부 서비스에 돌이키기 어려운 행동을 하는 순간의 위험을 압축적으로 보여주는 장면이다.

접근이 막혔을 때의 선택

기술적 제약도 사람의 개입을 불렀다. Claude는 미국과 이란 모두에서 GPPD 국가 프로파일 페이지를 불러오지 못했다. 해당 포털이 자바스크립트로 페이지를 구성하는 데다, Claude의 샌드박스 네트워크 정책이 세계은행 데이터 파일 접근을 막았기 때문이다. Claude는 멈춰 서서 PDF로 직접 올려줄지 아니면 그대로 진행할지 물었고, 연구자가 건너뛰자 세계은행 GPPD 데이터뱅크 API에서 자료를 가져왔다. 문제는 이 API가 2018년 데이터를 담고 있는 반면 포털은 2022년 프로파일을 보여준다는 점이다. 결과적으로 Claude의 기준 데이터는 GPT·Muse와 달라졌다.

세 에이전트 모두 유창한 페르시아어로 답했지만 결과의 질은 크게 벌어졌다. 이란 항목에서 비어 있던 138개 칸 가운데 GPT와 Muse가 실제 값으로 채운 것은 각각 21개뿐이었다. 반면 미국의 130개 칸에서는 각각 51개, 64개를 채웠다. 출처의 권위도 극명하게 갈렸다. 미국 작업에서는 인용의 76~89%가 공식 정부 사이트에서, 나머지는 신뢰할 만한 국제기구에서 나왔지만, 이란 작업에서는 그 비율이 11~22%에 그쳤다. 빈자리는 텔레그램 채널, 미디엄 게시글, 그로키피디아, 이란 인터내셔널 같은 디아스포라 매체 등 권위가 낮은 출처로 메워졌다.

접근이 막혔을 때의 대응 방식도 달랐다. Claude는 시도한 페르시아어 페이지 16개 중 3개만 열 수 있었고, 비교적 보수적으로 움직이며 정당성이 낮더라도 영어 출처를 선호하는 경향을 보였다. 빈틈은 헤드라인이나 자신의 기억으로 채우되 그 사실을 밝혔는데, 때로는 스스로 찾은 내용과 모순되기도 했다. GPT와 Muse는 각각 11개의 페르시아어 출처를 인용했지만 실제로 읽은 것으로 보이는 것은 각각 3개, 7개에 불과했다. Muse는 상당수를 2009년 영어 번역본에서 읽고도 공식 페르시아어 페이지를 출처로 달았다.

이 격차의 상당 부분은 모델만의 문제가 아니다. 이란 정부가 해외 IP의 .ir 공식 사이트 접근을 어렵게 만들어 두었기 때문이다. 그러나 연구자가 주목한 것은 접근 가능 여부가 아니라, 접근이 실패했을 때 에이전트들이 택한 우회 경로와 출처 우선순위의 차이였다. 이는 역설적으로 또 다른 질문을 낳는다. 사용자가 사는 곳에서 사이트가 차단돼 있을 때, AI 에이전트가 대신 정보를 가져오고 요약하는 검열 우회의 한 겹이 될 수 있는가, 아니면 새로운 기술 스택을 통해 또 다른 제약을 재생산하는가. 이른바 AI 주권이 내세워 온 언어 다양성과 지역어 지원이라는 약속을, 에이전트의 추론·검색·출처 선별 단계에서 어떻게 구현할지가 과제로 남는다.

마지막으로 짚어둘 한계는 관찰 가능성이다. 일반 사용자가 에이전트의 전체 작업 궤적을 한 번에 추출할 방법은 없었고, 연구자는 화면을 녹화한 뒤 그 텍스트를 따로 추출해야 했다. 작업 요약 파일을 요청하자 Muse와 GPT는 .txt 파일을 만들어줬지만 Claude는 안전 정책(reasoning_extraction)을 이유로 거부했다. 게다가 에이전트의 자기 보고는 실제 행동과 어긋난 사례가 있어 그대로 믿기 어렵다. 외부 평가자가 부분적인 궤적만 볼 수 있고 그 결론이 정보 불완전을 이유로 기각될 수 있다면, 독립적 평가의 가치는 어디에 있는가. 에이전트를 실무에 들이려는 조직이라면 성능 지표 이전에 로깅과 감독 가능성, 그리고 언어별 출처 신뢰도부터 따져봐야 한다는 점을 이 실험은 분명히 한다.

SOURCE · HACKER NEWS
원문 전체 보기 → https://royapakzad.substack.com/p/multilingual-ai-agents
SHARE
NEXT · CHOOSE

변화를 읽었다면,
내가 만들 수익 구조를 고릅니다.

정보를 더 모으는 데서 멈추지 않고, 광고·외주·판매·중개·구독 중 내 상황에 맞는 출발점을 정해보세요.

21가지 수익 구조 살펴보기 →
처리 중...