TECH 으로 돌아가기
TECH HACKER NEWS 오늘 7분 읽기 21 READS

Heretic, 오픈소스 LLM의 '거절 회로'를 자동으로 제거하는 도구는 어떻게 동작할까

Heretic, 오픈소스 LLM의 '거절 회로'를 자동으로 제거하는 도구는 어떻게 동작할까
SOURCE IMAGE · HACKER NEWS
Heretic, 오픈소스 LLM의 '거절 회로'를 자동으로 제거하는 도구는 어떻게 동작할까

무슨 도구인가요

Heretic(헤레틱, '이단자'라는 뜻이에요)은 오픈 웨이트 언어 모델에 들어 있는 안전 거절 행동을 자동으로 제거하는 도구예요. 라마, 젬마, 큐원 같은 공개 모델에 '이런 요청에는 답하지 마'라고 학습된 부분을 찾아내서 없애는 거죠. 원래 GitHub에 올라온 오픈소스 프로젝트였는데, 이제 자체 사이트까지 갖췄어요.

이 도구가 특별한 이유는 '자동'이라는 데 있어요. 모델의 거절 행동을 벗겨내는 기법 자체는 예전부터 있었는데, 지금까지는 사람이 수동으로 여러 값을 조정하고 모델이 망가지지 않았는지 확인하는 반복 작업이었거든요. Heretic은 이 과정을 최적화 문제로 바꿔서 파인튜닝 없이 소비자 GPU에서 처리하게 만들었어요.

이게 어떻게 가능한 걸까요: '거절 방향'

핵심 아이디어는 2024년에 나온 한 논문에서 왔어요. 제목이 '언어 모델의 거절은 하나의 방향으로 매개된다(Refusal in Language Models Is Mediated by a Single Direction)'인데요, 이게 뭐냐면 모델 내부에서 '이 요청은 거절해야 해'라는 판단이 아주 단순한 형태로 저장되어 있다는 발견이에요.

조금 더 풀어볼게요. 언어 모델은 문장을 처리하면서 각 층마다 수천 개 숫자로 된 벡터(활성값)를 만들어요. 연구자들이 유해한 요청을 넣었을 때의 활성값과 무해한 요청을 넣었을 때의 활성값을 비교해 봤더니, 그 차이가 특정한 한 방향으로 몰려 있었어요. 그 방향 성분을 활성값에서 빼버리면 모델이 거절을 안 하고, 반대로 그 방향을 더하면 무해한 질문에도 거절을 하더라는 거예요.

비유하면 이래요. 회의실에 열 명이 앉아서 결정을 내리는데, 알고 보니 '안 됩니다'라는 말은 항상 특정 한 사람 입에서만 나오고 있었던 거예요. 그 사람 마이크를 끄면 나머지 아홉 명은 그대로인데 거절만 사라지죠. 이 기법을 방향 제거(directional ablation)라고 부르고, 커뮤니티에서는 abliteration이라는 별명으로 불러요.

Heretic이 자동화한 부분

문제는 '어느 층에서, 얼마나 세게, 어떤 가중치에서 그 방향을 빼야 하나'예요. 너무 약하면 거절이 남고, 너무 세면 모델이 멍청해져요. 지금까지는 이걸 사람이 감으로 조절했어요.

Heretic은 두 가지 목표를 동시에 최적화해요. 하나는 유해 프롬프트 모음에 대한 거절 횟수를 줄이는 것, 다른 하나는 원본 모델과의 KL 발산을 낮게 유지하는 거예요. KL 발산이 뭐냐면, 두 모델이 같은 입력에 대해 얼마나 다른 답 분포를 내는지 재는 척도예요. 이게 낮을수록 원래 모델의 능력이 보존됐다는 뜻이죠. 이 두 값을 놓고 Optuna 같은 하이퍼파라미터 탐색 라이브러리가 수백 번 시도하면서 최적 조합을 찾아요. 사람이 며칠 걸리던 작업이 몇 시간 안에 끝나는 구조예요.

업계 맥락: 오픈 웨이트 모델 안전의 딜레마

이 도구가 던지는 진짜 질문은 '오픈 웨이트 모델에 안전장치를 넣는 게 의미가 있느냐'예요. 메타, 구글, 알리바바가 배포하는 모델은 사용 정책과 라이선스가 있지만, 가중치가 손에 있는 이상 기술적으로 강제할 방법이 없어요. Heretic은 그 사실을 아주 명확하게 보여준 셈이에요.

연구 쪽에서는 이미 대응이 진행 중이에요. 안전 튜닝이 모델의 얕은 층에만 걸려 있어서 쉽게 벗겨진다는 '얕은 정렬(shallow alignment)' 문제 지적, 가중치를 건드려도 안전 행동이 유지되게 하는 탬퍼 저항(tamper-resistant) 학습, 아예 사전학습 데이터 단계에서 유해 내용을 걸러내는 접근 등이 있어요. 거절 방향 논문 자체가 원래는 해석가능성 연구였다는 점도 아이러니해요. 모델 내부를 이해하려는 연구가 그대로 안전장치를 푸는 열쇠가 된 거니까요.

반대편에서는 '과도한 거절이 정당한 용도까지 막는다'는 불만도 커요. 보안 연구, 의료 상담, 소설 창작에서 모델이 필요 이상으로 거절하는 문제는 실제로 있고, 그게 이런 도구의 수요를 만들어요.

한국 개발자에게 주는 시사점

첫째, 커뮤니티에 올라온 'uncensored' 변형 모델을 회사 서비스에 그냥 쓰면 안 돼요. 원본 라이선스의 사용 정책 위반 가능성이 있고, 올해 1월부터 시행된 AI 기본법을 비롯해 서비스 사업자의 책임이 점점 무거워지고 있거든요. 거절 행동이 제거된 모델이 서비스에서 문제를 일으키면 그 책임은 도구 제작자가 아니라 배포한 회사에 돌아가요.

둘째, 안전은 가중치에만 맡길 수 없다는 교훈이에요. 모델 자체의 거절은 언제든 풀릴 수 있으니, 실제 서비스에서는 입력 필터, 출력 검사, 모니터링 같은 시스템 차원의 가드레일을 별도로 두는 게 정석이에요. 이건 오픈 모델을 쓰든 API를 쓰든 마찬가지예요.

셋째, 해석가능성 연구가 얼마나 실용적인지 보여주는 사례예요. '모델이 왜 이런 답을 하는지'를 벡터 수준에서 이해하면 안전장치를 풀 수도 있지만, 반대로 더 튼튼한 안전장치를 만들 수도 있어요. 이 분야는 공부해둘 가치가 충분해요.

마무리

한 줄로 정리하면, Heretic은 '오픈 웨이트 모델의 안전장치는 자물쇠가 아니라 커튼'이라는 걸 자동화된 도구로 증명한 프로젝트예요.

여러분은 어떻게 생각하세요? 공개된 모델의 안전장치는 누가 책임져야 할까요? 모델을 만든 회사, 도구를 만든 사람, 아니면 배포하는 서비스 운영자일까요?


🔗 출처: Hacker News

SOURCE · HACKER NEWS
원문 전체 보기 → https://heretic-project.org/
SHARE
NEXT · CHOOSE

변화를 읽었다면,
내가 만들 수익 구조를 고릅니다.

정보를 더 모으는 데서 멈추지 않고, 광고·외주·판매·중개·구독 중 내 상황에 맞는 출발점을 정해보세요.

21가지 수익 구조 살펴보기
처리 중...