대형 언어 모델이 텍스트를 한 토큰씩 생성하며 답을 만들어내는 동안, 전혀 다른 계보의 모델도 조용히 자리를 넓혀 왔다. 이른바 '결정 모델(decision model)'이다. 이 모델은 문장을 이어 쓰는 대신, 주어진 텍스트나 JSON에 대해 미리 정의된 형태의 질문을 던지면 단 한 번의 순전파(forward pass)로 답을 돌려준다. 최근 공개된 Ollaya는 이런 오픈소스 결정 모델을 사용자의 컴퓨터에 내려받아 로컬 서버로 띄워 주는 도구다. 이름과 사용 방식에서 짐작할 수 있듯, LLM을 로컬에서 돌리는 Ollama의 접근을 결정 모델 영역으로 옮겨 온 셈이다.
토큰 생성이 없다는 것의 의미
Ollaya가 내세우는 핵심은 속도와 응답 형식이다. 토큰을 하나씩 만들어내는 과정이 없기 때문에, 하나의 요청 안에 다섯 개의 질문을 담아 보내도 처리가 짧다. Convai Innovations의 Laya 모델을 NVIDIA RTX 4090에서 fp16으로 돌렸을 때, HTTP API를 통한 다섯 질문 요청이 종단 간 약 10밀리초 만에 끝난다고 밝힌다. 여기서 얻는 답은 자유로운 서술이 아니라 미리 정한 타입에 맞춰진(typed) 값이며, 각 답에는 확률이 붙는다. 개발자 입장에서는 이 확률에 임계값을 걸어 자동 처리와 사람 검토를 나누는 식의 파이프라인을 짜기 좋다.
확률의 신뢰도를 보여 주는 지표로 Ollaya는 보정 오차(ECE)를 든다. Laya는 온도 보정(temperature fitting) 이후 ECE가 0.081인 반면, 비교 대상인 Jev의 호스팅 API는 0.246이라고 제시한다. 다만 지연 시간 비교는 성격이 다른 측정을 나란히 놓은 것임을 스스로 인정한다. Ollaya 수치는 로컬 GPU에서의 API 요청 중앙값이고, Jev 수치는 네트워크가 포함된 제3자 벤치마크(AbdelStark/jev-benchmarks, nibzard/decision-model-benchmark)의 호스팅 API 지연 시간 중앙값이다. 환경이 다르므로 정확한 우열이 아니라 자릿수 수준의 비교로만 읽어야 한다.
기존 생태계와의 호환성
새로운 도구가 실무에 들어오는 데 가장 큰 장벽은 기존 코드와의 호환성이다. Ollaya는 /v1/systemone과 /v1/models 엔드포인트를 TypeSafe의 요청·응답 형식 그대로 제공한다고 밝힌다. 덕분에 공식 TypeSafe Python SDK 0.7.1을 코드 수정 없이 로컬 서버에 그대로 물릴 수 있다. 호스팅 API를 쓰던 코드의 엔드포인트만 로컬로 돌려도 동작한다는 뜻이어서, 이미 이 계열 API에 의존하던 팀이라면 전환 부담이 크지 않다.
출발점이 되는 모델은 Convai Innovations의 Laya 계열이다. 영어 전용 모델, 100개 이상 언어를 다루는 모델, 타입이 정해진 결정에 맞춰 파인튜닝된 모델, 그리고 상황에 맞는 모델을 대신 골라 주는 라우터가 함께 제공된다. 앞으로는 von을 비롯해 llama.cpp를 통한 GGUF LLM 기반 결정 모델까지 지원 범위를 넓힐 계획이라고 한다. 실행은 ONNX Runtime 위에서 이뤄지며 CPU만으로도 모든 모델이 돌아간다. NVIDIA GPU가 붙으면 요청 시간이 밀리초대로 줄어드는데, 이때는 드라이버 R580 이상이 필요하고 설치 프로그램이 GPU를 감지했을 때만 CUDA 라이브러리를 내려받는다. 애플, AMD, 인텔 GPU 환경에서는 CPU로 실행된다.
데이터가 있는 자리에서 점수를 매긴다
Ollaya가 겨냥하는 실무 시나리오는 분명하다. 티켓, 이메일, 사용자 메시지처럼 조직이 가진 데이터 중에서도 특히 민감한 것들이 대상이다. 이런 데이터를 외부 API로 보내는 대신, 이미 데이터가 놓여 있는 자리에서 점수를 매긴다는 것이 핵심 주장이다. 서버는 기본적으로 127.0.0.1에서만 수신하므로 외부로 트래픽이 나가지 않는다. 모델 가중치는 원저작자의 Hugging Face 저장소에서 특정 커밋에 고정해 내려받고 sha256으로 검증하며, Ollaya가 이를 재호스팅하지 않는다. 런타임은 Apache-2.0 라이선스다. 사용량 측정이나 API 청구가 없어 하드웨어가 감당하는 만큼 결정을 돌릴 수 있다는 점도 비용 예측이 중요한 팀에 매력적이다.
배포 형태는 macOS·윈도우·리눅스용 데스크톱 앱과 명령줄 도구, 그리고 서버용 도커 이미지로 나뉜다. GPU 가속은 리눅스, WSL 2, 도커 환경의 NVIDIA GPU에서 유효하다. 사용법은 단일 바이너리에 명령 하나, 곧 'ollaya run laya'로 끝난다는 점을 강조한다.
정리하면 Ollaya는 분류·태깅·필터링처럼 정형화된 판단을 대량으로, 그리고 데이터를 밖으로 내보내지 않고 처리해야 하는 업무에 초점을 맞춘 도구다. 반대로 벤치마크가 서로 다른 조건에서 측정됐다는 점, 지원 모델이 아직 Laya 계열 중심이라는 점, GPU 가속의 실질적 이점이 NVIDIA·리눅스 계열에 쏠려 있다는 점은 도입을 검토할 때 함께 따져 봐야 할 한계다. 결국 자유 서술형 생성이 필요 없는 정형 판단 작업이라면, 호스팅 LLM 호출을 로컬 결정 모델로 대체하는 선택지를 저울질해 볼 만하다.