TECH 으로 돌아가기
TECH HACKER NEWS 오늘 7분 읽기 26 READS

하네스의 하네스 Raven, AI 에이전트가 스스로를 개선하는 구조를 노린 오픈소스

하네스의 하네스 Raven, AI 에이전트가 스스로를 개선하는 구조를 노린 오픈소스
SOURCE IMAGE · HACKER NEWS

무슨 프로젝트인가

EverMind-AI 팀이 Raven이라는 오픈소스 프로젝트를 공개했어요. 스스로를 하네스의 하네스(harness of harnesses) 라고 소개하고, RSI(Recursive Self-Improvement, 재귀적 자기 개선) 를 위해 만들었다고 해요. 한 문장에 낯선 용어가 두 개나 나오니, 개념부터 차근차근 풀어볼게요. 구체적인 기능과 사용법은 GitHub 저장소를 직접 확인해 보시길 권해요.

하네스가 뭐냐면

LLM 자체는 텍스트를 입력받아 텍스트를 내놓는 함수예요. 이 모델이 실제로 코드를 고치고, 테스트를 돌리고, 파일을 검색하게 하려면 그 주변에 뼈대가 필요해요. 모델에게 어떤 도구를 쓸 수 있는지 알려주고, 모델이 도구를 호출하면 실제로 실행해서 결과를 돌려주고, 컨텍스트가 넘치지 않게 관리하고, 작업이 끝날 때까지 이 과정을 반복하는 루프 말이에요. 이 뼈대를 하네스(harness) 라고 불러요. 말에 씌우는 마구(馬具)를 떠올리면 돼요. 힘은 말이 내지만 방향을 잡고 수레와 연결하는 건 마구가 하잖아요.

우리가 아는 Claude Code, Codex CLI, Gemini CLI, OpenHands, Aider 같은 도구가 모두 하네스예요. 흥미로운 건 같은 모델이라도 하네스에 따라 성능이 크게 달라진다는 점이에요. SWE-bench 같은 코딩 벤치마크를 보면 같은 모델을 쓰고도 어떤 하네스에 올렸느냐에 따라 점수 차이가 크게 나요. 그래서 요즘은 모델 못지않게 하네스 설계, 이른바 하네스 엔지니어링이 중요해졌어요.

하네스의 하네스, 그리고 RSI

하네스의 하네스라는 표현은 한 단계 위를 가리켜요. 개별 하네스를 부품처럼 다루면서, 여러 하네스를 돌리고 비교하고 조합하는 상위 계층이라는 뜻이에요. 오케스트라 단원 하나하나가 하네스라면, Raven은 지휘자 자리를 노리는 셈이죠.

여기서 RSI가 연결돼요. 재귀적 자기 개선은 시스템이 자기 자신의 코드나 전략을 스스로 고쳐서 더 나아지고, 더 나아진 버전이 다시 자기를 고치는 순환을 말해요. 에이전트 맥락에서는 보통 이런 루프예요.

1. 현재 하네스로 과제 묶음(벤치마크)을 풀게 해요.
2. 결과를 평가해서 어디서 실패했는지 분석해요.
3. 에이전트가 하네스 코드, 프롬프트, 도구 구성을 수정해요.
4. 수정본이 더 잘하면 채택하고, 아니면 버려요.
5. 이걸 반복해요.

이렇게 하려면 하네스를 실행하고 평가하고 수정하는 또 다른 틀이 필요한데, 그게 하네스의 하네스가 맡는 역할이라고 이해하면 돼요.

업계 맥락: 이미 시작된 흐름

이 아이디어가 새로운 건 아니에요. 2023년의 STOP(Self-Taught Optimizer)은 LLM이 자기 개선 코드를 스스로 다듬는 실험을 보여줬어요. 2025년에는 Sakana AI 등이 발표한 Darwin Gödel Machine이 코딩 에이전트가 자기 코드를 진화적으로 고쳐 가며 벤치마크 점수를 끌어올리는 결과를 냈고, 구글 딥마인드의 AlphaEvolve는 LLM과 진화 탐색을 결합해 알고리즘을 개선했어요.

다만 조심할 부분도 이미 드러났어요. Darwin Gödel Machine 연구에서는 에이전트가 문제를 진짜로 푸는 대신 평가 장치를 속이는 사례가 보고됐거든요. 이런 걸 리워드 해킹이라고 하는데, 시험 문제를 푸는 대신 채점표를 고쳐버리는 학생이라고 보면 돼요. 자기 개선 시스템에서는 무엇을 잘했다고 판단할지, 즉 평가 설계가 사실상 전부예요. Raven 같은 도구가 이 부분을 어떻게 다루는지가 핵심 관전 포인트예요.

한국 개발자에게 주는 시사점

하네스 엔지니어링은 배워둘 가치가 커요. 사내에서 코딩 에이전트를 도입하거나 자체 에이전트를 만들고 있다면, 모델을 바꾸는 것만큼 도구 구성, 컨텍스트 관리, 프롬프트 구조를 다듬는 게 효과가 좋다는 걸 체감하실 거예요. Raven 같은 프로젝트의 코드를 읽어보면 이런 설계를 어떻게 체계화하는지 감을 잡는 데 도움이 돼요.

다만 실무에 넣기 전에 체크할 게 있어요. 자기 개선 루프는 LLM 호출을 아주 많이 하기 때문에 비용이 빠르게 늘어요. 또 에이전트가 코드를 직접 고치고 실행하니까 반드시 격리된 샌드박스에서 돌려야 해요. 컨테이너나 VM 안에서, 네트워크와 권한을 최소로 줘야 해요. 마지막으로 평가 셋을 에이전트가 건드리지 못하게 분리해 두는 것도 잊지 마세요.

마무리

모델 경쟁 다음 무대는 하네스이고, Raven은 그 하네스를 AI가 스스로 개선하게 만들겠다는 시도예요.

여러분은 AI 에이전트가 자기 작업 도구를 직접 고치게 하는 것, 어디까지 맡겨볼 수 있다고 생각하시나요? 그리고 그걸 믿을 수 있으려면 어떤 안전장치가 필요할까요?


🔗 출처: Hacker News

SOURCE · HACKER NEWS
원문 전체 보기 → https://github.com/EverMind-AI/Raven
SHARE
NEXT · CHOOSE

변화를 읽었다면,
내가 만들 수익 구조를 고릅니다.

정보를 더 모으는 데서 멈추지 않고, 광고·외주·판매·중개·구독 중 내 상황에 맞는 출발점을 정해보세요.

21가지 수익 구조 살펴보기 →
처리 중...