TECH 으로 돌아가기
TECH HACKER NEWS 오늘 8분 읽기 27 READS

미 국방부가 인정한 'AI 과의존'과 이란 학교 오폭, 자동화 편향은 개발자의 문제이기도 해요

미국 국방부가 이란의 한 학교를 미사일로 타격한 사건에 대해, AI 시스템에 대한 과도한 의존이 원인 중 하나였다고 인정했어요. 블룸버그가 이 사건을 상세히 다룬 보도를 내놓았는데요. 구체적인 작전 경위나 피해 규모는 보도 원문을 참고하시면 되고, 여기서는 기술을 만드는 사람의 관점에서 이 발표가 왜 중요한지 이야기해보려고 해요. 군이 공식적으로 'AI에 너무 기댔다'는 표현을 조사 결과에 담았다는 건, AI를 실제 의사결정에 넣고 있는 모든 조직에 던지는 경고이기도 하거든요.

자동화 편향이 뭐냐면

이 사건을 이해하는 핵심 단어는 자동화 편향(automation bias)이에요. 이게 뭐냐면, 사람이 자동화된 시스템의 판단을 자기 판단보다 더 믿어버리는 경향을 말해요. 내비게이션이 강으로 들어가라고 해서 정말 차를 몰고 들어간 사고 이야기 들어보셨죠? 눈앞에 강이 보이는데도 화면의 파란 선을 따라간 거예요. 그게 자동화 편향이에요.

이 편향은 사람이 게을러서 생기는 게 아니에요. 시스템이 대부분의 경우에 맞는 답을 내놓으면, 사람은 자연스럽게 검토를 건너뛰게 돼요. 99번 맞았는데 100번째에 틀렸을 때, 그 100번째를 잡아내려면 99번 동안 계속 의심해야 하잖아요. 그건 인지적으로 굉장히 피곤한 일이고, 시간 압박까지 있으면 거의 불가능에 가까워요.

표적 시스템은 어떻게 동작하나요

군사 표적 식별 시스템의 일반적인 구조를 보면 왜 이런 일이 생기는지 감이 와요. 위성, 드론, 통신 감청 같은 여러 센서에서 데이터가 들어오면, 머신러닝 모델이 이걸 분석해서 '이 건물은 군사 시설일 확률 87%' 같은 식으로 후보 표적을 골라내요. 그 결과가 분석관 화면에 뜨고, 사람이 검토해서 승인하면 다음 단계로 넘어가는 구조예요.

서류상으로는 사람이 항상 중간에 있어요. 이걸 휴먼 인 더 루프(human-in-the-loop)라고 부르는데요. 문제는 실제 운영 환경에서는 이 사람이 하루에 수백 건의 후보를 검토해야 하고, 각 건에 몇 초에서 몇 분밖에 못 쓴다는 거예요. 그러면 사람의 역할은 '판단'이 아니라 '승인 버튼 누르기'로 바뀌어요. 이름만 휴먼 인 더 루프고 실제로는 시스템이 결정하고 사람이 도장만 찍는 구조가 되는 거죠.

모델 쪽 문제도 있어요. 학습 데이터가 특정 지역이나 시기에 편중되어 있으면, 학교처럼 군사 시설과 형태가 비슷한 건물(넓은 마당, 여러 동, 담장)을 잘못 분류할 수 있어요. 또 모델이 내놓는 '87%'라는 숫자가 실제로 87%의 정확도를 뜻하는지, 즉 캘리브레이션이 되어 있는지도 별개 문제예요. 많은 분류 모델이 실제보다 과하게 자신감 있는 숫자를 내놓거든요. 사람은 그 숫자를 보고 안심하는데, 정작 그 숫자 자체가 믿을 만하지 않은 상황인 거예요.

업계에서는 이미 나왔던 이야기

AI 표적 시스템에 대한 우려는 이번이 처음이 아니에요. 2024년에 이스라엘군이 가자 지구에서 사용한 것으로 보도된 '라벤더'라는 시스템은 수만 명을 표적 후보로 자동 분류했고, 검토에 건당 20초 정도밖에 쓰지 않았다는 증언이 나와 큰 논란이 됐어요. 미국도 2017년 프로젝트 메이븐 이후로 드론 영상 분석에 AI를 계속 확대해왔고요.

규제 쪽에서는 미 국방부 지침 3000.09가 자율 무기 시스템에 '적절한 수준의 인간 판단'을 요구하고 있어요. 그런데 '적절한 수준'이 뭔지는 지침에 명확히 정의되어 있지 않아요. EU AI 법은 고위험 AI 시스템에 인간 감독 의무를 두고 있지만, 군사 용도는 아예 적용 범위에서 빠져 있고요. 이번 국방부 발표는 이런 빈틈이 실제 사고로 이어질 수 있다는 걸 공식 문서로 확인해준 셈이에요.

한국 개발자에게는 남의 일이 아니에요

군사 시스템을 만드는 분은 거의 없겠지만, 같은 구조의 문제는 우리가 만드는 시스템에도 그대로 있어요. 대출 심사에서 모델이 '거절 권장'이라고 띄우면 심사역이 그걸 뒤집는 경우가 얼마나 될까요? 채용 플랫폼에서 이력서를 자동으로 걸러주면 인사 담당자가 걸러진 이력서를 다시 볼까요? 병원의 진단 보조 AI가 '정상'이라고 하면 의사가 영상을 처음부터 다시 볼까요?

이런 시스템을 설계할 때 실제로 적용할 수 있는 원칙들이 있어요.

마무리

한 줄로 정리하면, AI가 틀린 게 아니라 사람이 AI를 검토하지 않게 되는 구조가 문제였고, 그 구조는 우리가 만드는 서비스 안에도 똑같이 들어 있다는 거예요.

여러분이 만들거나 운영하는 시스템 중에 '사람이 검토한다'고 되어 있지만 실제로는 자동 승인에 가까운 흐름이 있나요? 그걸 진짜 검토로 만들려면 뭐가 바뀌어야 할까요?


🔗 출처: Hacker News

SOURCE · HACKER NEWS
원문 전체 보기 → https://www.bloomberg.com/graphics/2026-iran-school-attack/
SHARE
NEXT · CHOOSE

변화를 읽었다면,
내가 만들 수익 구조를 고릅니다.

정보를 더 모으는 데서 멈추지 않고, 광고·외주·판매·중개·구독 중 내 상황에 맞는 출발점을 정해보세요.

21가지 수익 구조 살펴보기
처리 중...