
지금 우리가 쓰는 LLM에는 묘한 특징이 하나 있어요. 학습이 끝나는 순간 뇌가 굳어버린다는 거예요. 챗봇과 아무리 오래 대화해도 모델의 가중치(weight), 그러니까 모델이 실제로 '아는 것'은 단 1비트도 바뀌지 않아요. 우리가 느끼는 '기억'은 대화 내용을 컨텍스트 창에 다시 넣어주거나, 외부 DB에 저장했다가 검색해서 붙여주는 기법일 뿐이거든요. 사람은 오늘 배운 걸 내일 써먹으면서 뇌 자체가 바뀌는데, 모델은 그게 안 돼요. 이 간극을 메우려는 분야가 지속 학습(continual learning)이고, 오늘 소개할 Mini-AGI는 한 개인 개발자가 이 문제를 소비자용 GPU 한 장으로 실험해본 오픈소스 프로젝트예요.
왜 모델은 계속 배우지 못하나요?
'그냥 새 데이터로 파인튜닝하면 되는 거 아니야?'라고 생각하실 수 있어요. 문제는 파국적 망각(catastrophic forgetting)이에요. 신경망에 새로운 것을 가르치면 기존 지식을 담당하던 가중치들이 덮어써지면서 예전에 잘하던 걸 잊어버려요. 비유하자면 메모지 한 장에 새 내용을 적으려고 옛 내용을 지우는 셈이죠. 사람의 뇌는 새로운 기억을 만들면서도 옛 기억을 어느 정도 보호하는 메커니즘이 있는데, 표준적인 신경망 학습에는 그게 없어요.
그래서 연구자들은 여러 방법을 시도해왔어요. 중요한 가중치는 덜 바꾸도록 벌점을 주는 EWC 같은 방법, 옛 데이터를 조금씩 섞어서 다시 보여주는 리플레이(replay), 새 지식을 위한 뉴런을 추가로 붙이는 방식, 그리고 최근에는 추론 중에 가중치 일부를 갱신하는 테스트 타임 트레이닝(test-time training) 같은 접근이요. 이 중 '동적(dynamic)'이라는 단어가 붙으면 보통 네트워크 구조 자체가 고정되어 있지 않고, 필요에 따라 커지거나 재구성된다는 뜻이에요.
Mini-AGI는 뭘 하는 프로젝트인가요?
저장소 설명에 따르면 Mini-AGI는 '동적 지속 학습 모델'을 표방해요. 거창한 이름과 달리 실체는 개인 연구 프로젝트에 가깝고, 핵심 특징은 두 가지예요. 하나는 모델이 한 번 학습되고 끝나는 게 아니라 새로운 데이터가 들어올 때마다 계속 가중치를 갱신하면서도 이전 능력을 유지하려 한다는 것. 다른 하나는 그 전체 과정이 8GB VRAM, 즉 RTX 3060이나 4060급의 흔한 게이밍 GPU에서 돌아간다는 거예요.
두 번째가 왜 중요하냐면, 지속 학습 연구는 보통 '큰 모델에서 실험하려면 큰 장비가 필요하다'는 벽에 막혀 있거든요. 그런데 문제의 본질(새로운 것을 배우면서 옛것을 잊지 않기)은 모델 크기와 무관하게 존재해요. 작은 모델로 그 메커니즘을 검증할 수 있다면 개인 연구자도 참여할 수 있는 판이 열리는 거죠. 저자가 '미니'라는 이름을 붙인 것도 그 취지로 읽혀요. 다만 AGI라는 단어는 상당히 야심 찬 표현이라, 실제 기능은 저장소의 데모와 코드를 직접 보고 판단하시는 걸 권해요. 이런 종류의 프로젝트는 아이디어 자체가 흥미로운 것과 그 결과가 큰 모델로 확장되는 것 사이에 아주 큰 간격이 있으니까요.
업계에서는 어디까지 왔나요?
지속 학습은 지금 AI 연구에서 가장 뜨거운 미개척지 중 하나예요. 구글 리서치는 2025년 말 '중첩 학습(Nested Learning)'이라는 틀과 함께 Titans, Hope 같은 아키텍처를 발표하면서 모델 안에 여러 속도로 갱신되는 기억 계층을 두는 방식을 제안했어요. MIT에서는 모델이 스스로 학습 데이터를 만들어 자기 가중치를 갱신하는 SEAL(Self-Adapting LLMs) 연구를 냈고요. 메타는 대규모 메모리 레이어를, 사카나 AI는 시간에 따라 뉴런 동기화가 변하는 CTM 같은 색다른 구조를 실험했어요. 공통점은 '컨텍스트 창을 늘리는 것만으로는 한계가 있고, 결국 모델 자체가 변해야 한다'는 문제의식이에요. 대형 연구소들이 큰 그림을 그리는 동안, Mini-AGI 같은 개인 프로젝트는 그 아이디어를 작은 규모에서 만져볼 수 있는 놀이터 역할을 해요.
한국 개발자 입장에서
당장 실무에 쓸 물건은 아니에요. 하지만 배워둘 가치는 충분해요. 첫째, 지속 학습은 앞으로 몇 년 안에 에이전트 제품의 핵심 차별점이 될 가능성이 높아요. 사용자와 오래 함께하면서 진짜로 성장하는 AI 비서를 만들려면 결국 이 문제를 풀어야 하니까요. 둘째, 8GB VRAM으로 뭔가를 해봤다는 사실 자체가 국내 개인 연구자와 학생들에게 좋은 신호예요. 국내에는 고성능 GPU 없이 공부하는 분들이 많은데, 이런 프로젝트의 코드를 뜯어보면서 파국적 망각을 직접 재현해보고 완화 기법을 실험해보는 것만으로도 훌륭한 공부가 돼요. 실제로 작은 MLP에 태스크 A를 학습시키고 태스크 B를 이어서 학습시킨 뒤 A의 정확도가 얼마나 떨어지는지 보는 실험은 노트북에서도 30분이면 해볼 수 있어요.
정리
한 줄로 정리하면 '멈춰 있는 모델을 계속 배우게 만드는 문제는 아직 아무도 못 풀었고, 그래서 개인 개발자의 작은 실험도 의미가 있다'예요. 여러분은 AI 비서가 여러분과의 대화로 진짜 가중치가 바뀌는 게 좋을까요, 아니면 지금처럼 고정된 모델에 외부 메모리를 붙이는 게 더 안전하다고 생각하시나요?
🔗 출처: Hacker News