AWS 진영의 에이전트 개발 도구 모음인 strands-labs가 Strands Decider 2B라는 소형 오픈소스 모델을 공개했다. 20억 파라미터 규모로, 로컬 CPU나 GPU에서 돌릴 수 있고 의미 있는 질문에 수십 밀리초 안에 답을 내놓는 것을 목표로 한다. 가중치는 Hugging Face에, 코드와 학습 데이터·스크립트는 GitHub에 모두 공개됐다. 흥미로운 점은 이 모델이 우리가 흔히 쓰는 LLM과는 다른 범주, 공개 설명에서 '결정 모델(decision model)' 또는 '시스템 원(system one) 모델'이라고 부르는 부류에 속한다는 것이다.
생성하지 않고 고르는 모델
일반적인 LLM이 임의의 텍스트를 생성한다면, 결정 모델은 미리 주어진 선택지 중 하나를 고르거나 단순한 수치 점수를 매기는 데 특화돼 있다. 예컨대 '\'turn on the lights\'라는 문장이 커피머신에 관한 것인가? 예/아니오', 혹은 '이 문장이 긍정적 감정인가? 0과 1 사이 값으로' 같은 질문에 답하는 식이다. 유연성을 포기한 대가로, 같은 크기에서 더 빠르고 더 정확하며, 항상 선택지 안에서 답을 내고, 지연 시간이 매우 낮다는 특성을 얻는다.
반대로 한계도 분명하다. 모든 출력을 한 번의 병렬 패스로 생성하는 구조이기 때문에 복잡한 문제 해결에서는 추론형 모델보다 크게 떨어지고, 텍스트를 생성하지 못하므로 코딩·챗봇·문서 요약 같은 전형적인 LLM 작업에는 맞지 않는다. 즉 LLM의 대체재가 아니라, LLM이 하기엔 비싸고 느린 자잘한 판단을 떠맡는 보조 부품에 가깝다.
신뢰도 점수와 멀티 질의
실무자 입장에서 눈여겨볼 특성은 두 가지다. 하나는 각 판단에 대해 '이 예/아니오를 얼마나 믿어도 되는가'를 나타내는 신뢰도 점수를 제공한다는 점으로, 공개 자료에 따르면 이는 현재 프론티어 LLM의 추론 API로는 얻기 어려운 값이다. 다른 하나는 같은 프롬프트에 대해 여러 질문을 효율적으로 던질 수 있다는 점이다. 이 조합 덕분에 결정 모델은 에이전트 워크플로를 제어하는 용도에 적합하다는 것이 공개 측의 설명이다.
아키텍처는 사전학습된 Qwen3.5-2B를 몸통으로 삼아 텍스트 생성을 담당하는 LM 헤드를 떼어내고, 그 자리에 선택지들을 채점하는 '포인터 헤드'를 붙인 구조다. 이 헤드는 100만 파라미터 남짓으로 작고, 몸통은 rank-16 LoRA 어댑터로 미세조정했다. 공개된 것은 v19 버전으로, 그 이전의 수많은 반복 과정과 각 버전에서 바꾼 내용이 저장소에 그대로 기록돼 있다는 점도 특징이다.
정확도·보정·지연이라는 세 축
성능은 정확도, 보정(confidence 점수의 신뢰성), 지연 세 가지로 측정됐다. JevBench 공개 세트에서의 정확도와 Brier 점수로 본 보정에서 2B 급 33개 중 3위, 2B를 갓 넘는 모델들을 제외하면 30개 중 1위라고 밝혔다. 쉬운 과제는 100% 정답을 맞혔다고 한다. 지연은 널리 쓰이는 하드웨어 기준 중앙값 약 115ms, RTX 3090에서 측정됐으며 M3 맥북에서도 소형 과제 중앙값 약 153ms로 큰 차이가 없었다. 지연은 과제 토큰 크기에 대략 선형으로 증가한다.
어디에 쓰나
공개 측은 모델 라우팅, 도구 선택, 평가, 가드레일, 메모리와 컨텍스트 관리, 정책 분류 등에서 초기 성과가 나오고 있다고 전한다. 특히 가장 어려운 판단은 LLM이, 반복적이고 쉬운 판단은 결정 모델이 맡는 하이브리드 에이전트 구성이 비용과 지연을 함께 줄이는 사례로 소개됐다. 예제는 Strands의 intervention 시스템을 활용한다. 사용자가 장소를 말하지 않고 '날씨 어때?'라고 묻자 도시를 멋대로 추측해 도구를 호출하려는 에이전트에 대해, 결정 모델이 '인자 값이 사용자의 말에 근거하는가', '지금 이 도구를 부르기엔 이른가'라는 두 예/아니오 질문을 던지고, InterventionHandler가 그 예측을 Proceed·Deny·Confirm·Guide 같은 타입화된 동작으로 바꿔 호출을 되돌린다.
다만 이 예제는 권장 구성이 아니라 예시일 뿐이며, 질문과 임계값, 정책은 모두 수작업으로 고른 것이라고 분명히 밝혀 둔 점은 짚어둘 만하다. 핵심 메시지는 'LLM 호출을 끼워 넣을 수 없을 만큼 비용에 민감한 경로에도 이 정도로 싼 판단은 앉힐 수 있다'는 것이다. Strands 팀은 결정 모델 통합을 위한 라이브러리를 작업 중이라고 밝혔으므로, 지금 단계에서는 완성된 제품이라기보다 직접 실험하고 뜯어보며 기여할 재료에 가깝다고 보는 편이 정확하다.