TECH 으로 돌아가기
TECH HACKER NEWS 오늘 5분 읽기 25 READS

검열 없는 '공격 보안 AI 모델' 목록 등장, 실무자는 무엇을 봐야 하나

검열 없는 '공격 보안 AI 모델' 목록 등장, 실무자는 무엇을 봐야 하나
SOURCE IMAGE · HACKER NEWS

레드팀과 침투 테스트 종사자를 겨냥한 오픈웨이트 AI 모델 목록이 깃허브에 공개됐다. 'Offensive Security AI Models Benchmark'라는 이름으로 정리된 이 저장소는 검열이 해제(uncensored)됐거나 사이버보안 작업에 맞춰 파인튜닝된 공개 가중치 모델을 한데 모은 큐레이션이다. 제작자는 레드팀 리더로 소개된 Joas A. Santos이며, 모든 데이터는 허깅페이스 모델 카드와 공식 발표 자료에서 가져왔고 기준 시점은 2026년 9월이라고 명시돼 있다. 목록은 '인가된 레드팀 작전, 침투 테스트, 보안 연구' 용도로만 쓰라는 단서를 달고 있다.

목록에 담긴 모델의 성격

수록된 모델은 크게 두 갈래로 나뉜다. 하나는 보안 특화 파인튜닝 모델이다. WhiteRabbitNeo, Lily-Cybersecurity-7B, CyberPal2.0-20B, VEXT-Pentest-7B, BugTraceAI 계열, Dolphin3-Cyber-8B처럼 취약점 분석·모의해킹·버그 헌팅 같은 작업을 겨냥한 것들이다. 다른 하나는 범용 모델의 안전장치를 제거한 '어블리터레이션(abliterated)' 또는 무검열 변형이다. huihui-ai가 배포한 Qwen 계열 abliterated 모델, Dolphin, Wizard-Vicuna-13B-Uncensored 등이 여기 속한다. 상당수는 로컬에서 돌리기 쉽도록 GGUF 형식으로 양자화돼 제공된다.

어블리터레이션은 모델 내부에서 거부 응답을 유발하는 방향 벡터를 찾아 제거해, 원래라면 답하지 않을 요청에도 응답하도록 만드는 기법이다. 공격 보안 맥락에서 이런 모델이 주목받는 이유는 분명하다. 익스플로잇 코드 작성, 페이로드 생성, 정찰 정보 정리 같은 요청을 일반 상용 모델은 안전 정책상 거절하는 경우가 많은데, 무검열 모델은 이를 우회하기 때문이다.

'벤치마크'라는 이름의 실체

제목에는 벤치마크라는 단어가 들어 있지만, 공개된 내용에서 실제로 확인되는 것은 성능 점수표나 정량적 비교가 아니라 모델과 다운로드 링크의 목록이다. 각 모델의 탐지율, 오탐률, 실제 침투 시나리오에서의 성공률 같은 측정값은 제시되지 않았다. 따라서 이 자료는 '어떤 모델이 가장 뛰어난가'를 가려주는 순위표라기보다, 이 분야에 어떤 선택지가 존재하는지를 훑어보는 카탈로그에 가깝다. 실무자가 특정 모델을 도입하려면 별도의 자체 평가가 반드시 필요하다.

또 하나 유의할 점은 출처의 성격이다. 정보의 근거가 허깅페이스 모델 카드, 즉 모델을 올린 사람이 스스로 작성한 설명이라는 사실이다. 모델 카드에 적힌 파라미터 규모나 능력 주장은 제3자 검증을 거친 값이 아니며, 개인 업로더가 올린 모델은 품질과 학습 데이터의 출처가 불투명한 경우가 흔하다. 일부 이름에서 드러나듯 특정 상용 모델을 모방했다고 표방하는 변형도 섞여 있어, 라이선스와 신뢰성을 사용자가 직접 따져봐야 한다.

실무 도입 시 고려할 점

국내 보안팀 입장에서 이런 오픈웨이트 모델의 매력은 온프레미스 운용에 있다. 외부 API에 민감한 대상 정보나 취약점 데이터를 보내지 않고 격리된 환경에서 모델을 돌릴 수 있어, 고객사 데이터의 외부 유출 위험을 줄이고 규제 대응에도 유리하다. GGUF 양자화본이 많다는 점은 고사양 GPU 없이도 로컬 구동을 시도할 수 있다는 의미다. 다만 무검열 모델은 안전장치가 제거된 만큼 잘못된 프롬프트에 무비판적으로 응답하고, 부정확하거나 위험한 출력을 그대로 내놓을 수 있다는 점을 전제로 다뤄야 한다.

무엇보다 이 목록 자체가 '인가된 보안 연구와 교육 목적'으로 못 박고 있다는 사실을 가볍게 넘겨선 안 된다. 공격용 역량을 갖춘 도구는 사전 서면 동의와 명확한 범위 설정이 있는 계약된 모의해킹 안에서만 정당성을 얻는다. 권한 없는 대상에 사용하는 순간 그것은 실무가 아니라 불법 행위가 된다. 결국 이 카탈로그는 선택지를 넓혀줄 뿐, 어떤 모델을 어디까지 어떤 근거로 쓸지에 대한 판단과 책임은 온전히 사용하는 조직의 몫으로 남는다.

SOURCE · HACKER NEWS
원문 전체 보기 → https://github.com/JoasASantos/Offensive-Security-AI-Models
SHARE
NEXT · CHOOSE

변화를 읽었다면,
내가 만들 수익 구조를 고릅니다.

정보를 더 모으는 데서 멈추지 않고, 광고·외주·판매·중개·구독 중 내 상황에 맞는 출발점을 정해보세요.

21가지 수익 구조 살펴보기 →
처리 중...