TECH 으로 돌아가기
TECH HACKER NEWS 오늘 7분 읽기 19 READS

코드 리뷰를 사람이 계속 해야 하는 이유: '탐지'로 환원되지 않는 것들

코드 리뷰를 사람이 계속 해야 하는 이유: '탐지'로 환원되지 않는 것들
SOURCE IMAGE · HACKER NEWS

코딩 에이전트가 사람의 코드 리뷰를 대체할 수 있는가. 최근 발표된 논문 「The End of Code Review: Coding Agents Supersede Human Inspection」은 그렇다고 단언한다. 이 논문은 1976년 파간(Fagan)이 코드 인스펙션을 정식화한 이래 반세기 동안 코드 리뷰가 소프트웨어 품질의 핵심 관문이었다는 점을 인정하면서도, 코드를 읽고 쓰고 테스트하고 고치는 LLM 기반 자율 시스템, 즉 코딩 에이전트가 이제 임계점을 넘었다고 주장한다. 핵심 논거는 두 가지다. 첫째, 코드 리뷰의 모든 명시적 목적은 에이전트가 더 낮은 비용과 더 높은 처리량으로 수행할 수 있다. 둘째, 에이전트가 코드를 쓰고 사람이 여전히 필수 리뷰어로 남는 '순진한 통합'은 실질적 보증도 제공하지 못하고 AI로 늘어난 처리량을 감당하지도 못하는 막다른 길이라는 것이다.

논문은 동료 코드 리뷰를 결함 탐지, 스타일 준수, 지식 전달, 인지(awareness)라는 네 가지 기능으로 분해한다. 그리고 에이전트가 이 각각을 수행할 수 있으므로 사람 리뷰어를 대체할 수 있다는 결론에 이른다. 어댑티브 캐패시티 랩스(Adaptive Capacity Labs)의 해설은 바로 이 분해 방식, 저자가 '대체 신화(substitution myth)'라고 부르는 전제를 문제 삼는다. 리뷰의 가치를 기능의 합으로 환원하는 순간, 기능으로 쪼갤 수 없는 요소들이 통째로 시야에서 사라진다는 것이다.

이해하지 못한다는 신호, 그리고 없는 것을 보는 능력

경험 많은 엔지니어가 diff를 읽고 "이게 무슨 뜻인지 모르겠다"고 말할 때, 그 혼란 자체가 하나의 발견이다. 코드가 지나치게 복잡하거나, 추상화가 잘못됐거나, 의도가 드러나지 않는다는 신호다. LLM은 코드를 처리한다는 의미에서 언제나 '이해'하기 때문에 이런 정당한 몰이해의 신호를 줄 수 없다. 논문은 이해 가능성을 사실상 스타일 문제로 취급하지만, 이는 사람이 산출물을 이해하려는 상호작용 속에서 창발하는 속성이다.

또 하나는 '없는 것'을 알아채는 능력이다. API 계약이 바뀌었는데 오류 처리는 그대로라거나, 있어야 할 무언가가 빠졌다는 사실을 사람은 감지한다. 흥미롭게도 이 부재 인지(absence blindness)야말로 LLM이 취약한 실패 유형이다. 에이전트는 거기 있는 것을 리뷰하지만, 숙련된 엔지니어는 없는 것을 본다.

리뷰는 검증이기 전에 조율과 판단이다

논문의 틀은 리뷰 대상 변경이 필요하다는 것, 그리고 리뷰의 주목적이 검증이라는 것을 암묵적 전제로 깐다. 그러나 프로덕션을 겪어본 사람은 안다. 코드 리뷰는 "이건 증상만 고치고 근본 문제는 놔둔다" 같은, 그 변경이 애초에 필요한지를 되물을 수 있는 마지막(혹은 유일한) 순간인 경우가 많다. 이는 코드가 옳은지 이전에 오는, 의도·범위·적절성에 관한 질문이다.

리뷰어의 주의력은 균일하지 않다는 점도 짚는다. 결제 모듈에 처음 커밋하는 저연차 엔지니어와 익숙한 리팩터링을 하는 베테랑은 서로 다른 강도의 검토를 받는다. 리뷰어는 누가·무엇을·언제·어디서를 자신의 경험이 축적한 위험 지도에 맞춰 조정한다. 논문은 모든 diff를 동등한 입력으로 다룬다는 것이 비판의 요지다.

지식 전달도 마찬가지다. 논문은 이를 에이전트가 '설명을 생성'하는 정보 전달로 축소하지만, 실제 리뷰의 토론은 공동의 인지 활동이다. 리뷰어는 작성자의 접근을 배우고, 작성자는 질문을 통해 배우며, 그 결과 이전에 어느 쪽도 갖지 못했던 공유된 이해가 생긴다. 에이전트의 요약은 두 사람의 사고 모형을 함께 바꾸는 대화를 대신하지 못한다.

저장소 밖의 맥락과 책임

실무자에게 가장 와닿는 대목은 저장소 바깥의 운영 맥락이다. "지난주 화요일 이 서비스에서 장애가 있었다", "이 다운스트림 소비자를 담당하는 팀이 곧 그 인터페이스를 폐기한다", "법무팀이 이 필드는 더 이상 로깅하지 말라고 했다" 같은 정보는 테스트·문서·버전 관리에 담기지 않는다. 사람은 조직의 현재 상태, 최근 사건, 비공식 합의를 코드와 연결 짓는다. 논문은 코드베이스가 완전한 맥락이라고 가정하지만, 그런 적은 결코 없다.

책임의 문제도 형식이 아니다. 논문은 사람의 책임을 법적·규정적 목적의 '지명된 인간'이라는 컴플라이언스 산물로 취급한다. 그러나 자신이 승인한 변경에 개인적으로 책임진다는 자각은 리뷰의 방식 자체를 바꾼다. 이른바 'skin in the game'이다. PR에 승인 서명을 하는 에이전트는 어떤 결과도 감수하지 않으며 진지한 평가를 이끌 유인 구조도 없다. 논문은 윤리 문제를 논의에 포함하면서도 이를 요구공학과 배포 후 모니터링으로 넘겨버리는데, 이는 문제를 뒤로 미루는 손짓에 가깝다.

결국 이 비판의 뿌리는 하나다. 논문은 코드 리뷰를 무엇보다 탐지 과정으로, 그래서 더 빠르고 싸게 탐지하는 쪽이 언제나 낫다고 전제한다. 그러나 리뷰는 조율이고, 의미 형성이며, 거버넌스다. 대체 신화가 무너지는 지점은 늘 같다. 정작 가장 중요했던 사람의 기여는 개별 기능이 아니라 그 기능들을 가로질러 통합하고, 예상 못 한 상황과 맥락에 적응하며, 기대되는 사회적 책임을 감당하는 능력이었다. 그 적응 능력은 애초의 네 기능 분해에 포함되지 않았고, 논문에도 포함되지 않았다. 코딩 에이전트를 리뷰 파이프라인에 도입하려는 팀이라면, 에이전트가 잘하는 탐지와 사람만이 감당하는 판단·조율·책임을 구분해 배치하는 데서 출발하는 편이 현실적이다.

SOURCE · HACKER NEWS
원문 전체 보기 → https://www.adaptivecapacitylabs.com/2026/08/24/there-is-mor...
SHARE
NEXT · CHOOSE

변화를 읽었다면,
내가 만들 수익 구조를 고릅니다.

정보를 더 모으는 데서 멈추지 않고, 광고·외주·판매·중개·구독 중 내 상황에 맞는 출발점을 정해보세요.

21가지 수익 구조 살펴보기 →
처리 중...