대규모 언어모델을 실제 업무에 투입할 때 가장 자주 부딪히는 벽은 컨텍스트 윈도의 한계다. 긴 문서를 다루거나, 웹을 여러 번 탐색하거나, 며칠에 걸친 작업을 수행하는 에이전트에서는 어떤 정보를 창(window)에 남기고 무엇을 버릴지를 결정하는 일이 성능을 좌우한다. 지금까지 이 결정은 대부분 모델 바깥의 '하네스(harness)', 즉 요약·잘라내기·검색 재주입 같은 규칙을 짜 넣은 외부 제어 로직이 담당해 왔다. arXiv에 공개된 'Context Language Models'(CLM) 연구는 이 역할을 모델 내부로 옮기자는 제안이다.
컨텍스트를 하나의 파일로 다룬다
CLM의 핵심 발상은 단순하다. 모델의 컨텍스트를 하나의 '파일'로 취급하고, 모델이 그 파일을 제약 없이 직접 수정하도록 허용한다. 외부 시스템이 '이 부분을 요약하라'거나 '오래된 내용을 지워라'라고 지시하는 대신, 모델 스스로 무엇이 중요한지 판단해 유지하거나 덮어쓴다. 이렇게 하면 컨텍스트 관리가 외부 규칙의 산물이 아니라 모델이 학습하는 행동이 된다. 연구진은 이 구조가 다중 에이전트 시스템으로 자연스럽게 확장된다고 설명한다. 여러 에이전트의 컨텍스트가 각각 별개의 파일로 공존하기 때문에, 에이전트들이 서로의 작업 상태를 파일을 매개로 주고받는 형태가 가능해진다는 것이다.
주목할 점은 이 방식이 별도의 재학습 없이, 즉 제로샷으로 기존 모델에 적용했을 때에도 기존의 최신 컨텍스트 관리 전략들을 앞섰다는 주장이다. 웹 탐색형 과제인 BrowseComp-Plus에서는 정확도가 11.4% 높아지면서 연산량(FLOPs)은 21.5% 줄었고, 12시간 길이의 EdgeBench에서는 점수가 5% 오르면서 연산량은 59% 감소했다. 24시간에 걸친 다중 저장소 에이전트 군집 과제에서는 동일한 연산 예산에서 개선 폭이 65% 더 컸다고 한다. 정확도와 비용을 동시에 개선했다는 점이 이 결과의 핵심이다. 긴 작업일수록 불필요한 토큰을 끌고 다니지 않는 것이 연산 절감으로 직결되기 때문이다.
지시와 강화학습으로 다듬어지는 관리 전략
컨텍스트 관리를 모델의 내재적 행동으로 돌리면, 그 전략 자체를 학습 대상으로 삼을 수 있다는 것이 두 번째 주장이다. 연구진은 두 가지 경로를 제시한다. 하나는 맥락 안에서의 학습으로, 자연어 지시문을 표준적인 스킬 최적화 루프를 통해 진화시켜 모델을 유도하는 방식이다. 이렇게 다듬은 지시만으로 한 컨텍스트 관리 과제의 미학습(held-out) 정확도가 최대 35.9포인트 올랐고 연산량은 오히려 줄었다고 한다. 다른 하나는 파라미터 자체를 바꾸는 온라인 강화학습으로, Qwen3.5-9B 모델의 BrowseComp-Plus 성능을 47.6% 끌어올리면서 FLOPs는 12% 줄였다. 코드 수정 없이 지시문만으로 조정하는 가벼운 길과, 가중치를 갱신하는 무거운 길을 모두 열어 둔 셈이다.
서빙 단계의 최적화도 함께 설계됐다. CLM은 컨텍스트 파일을 반복적으로 덮어쓰기 때문에 매번 같은 접두부를 다시 계산하는 낭비가 생길 수 있는데, 연구진은 'Suffix Cache Reuse'라는 기법을 CLM에 맞춰 함께 설계해 동일 성능 기준으로 표준 SGLang 대비 서버 측 연산을 35% 줄였다고 밝혔다. 모델의 동작 방식과 서빙 인프라를 따로 두지 않고 함께 설계했다는 점이 특징이다.
실무 관점에서의 의미와 유보할 점
실무자 입장에서 이 연구가 시사하는 바는 비교적 분명하다. 그동안 긴 에이전트 워크플로를 운영하려면 요약 주기, 메모리 저장소, 검색 재주입 같은 하네스 로직을 손으로 설계하고 과제별로 튜닝해야 했다. CLM이 제시하는 방향은 이 책임의 상당 부분을 모델에 넘겨, 하네스를 단순화하는 것이다. 특히 여러 에이전트가 파일을 매개로 협업하는 구조는 멀티 에이전트 오케스트레이션을 짜는 팀에게 참고할 만한 설계 패턴이다. 비용 절감 수치가 정확도 향상과 나란히 제시됐다는 점도 장시간 운영형 서비스에서는 직접적인 유인이 된다.
다만 이 결과들은 아직 특정 벤치마크와 특정 모델 구성에서 얻은 수치라는 점을 기억할 필요가 있다. BrowseComp-Plus, EdgeBench, 24시간 군집 과제 같은 환경에서의 상대적 우위가 실제 사내 데이터나 도메인 특화 작업에서 그대로 재현된다는 보장은 없다. 또한 모델이 컨텍스트 파일을 '제약 없이' 수정한다는 설계는 유연함인 동시에 위험이기도 하다. 중요한 정보를 모델이 잘못 지워 버리는 상황을 어떻게 방지하고 감사하는지, 즉 신뢰성과 관측 가능성 측면은 공개된 요약 범위에서는 충분히 드러나지 않는다. 자체 적용을 검토한다면 논문 본문을 직접 확인하고, 작은 규모의 재현 실험으로 자신의 과제에서 비용과 안정성이 실제로 개선되는지 가늠해 보는 편이 안전하다.