TECH 으로 돌아가기
TECH HACKER NEWS 오늘 7분 읽기 22 READS

기존 LLM을 바이트 단위로 개조하는 '바이트화', 토크나이저의 한계를 넘다

기존 LLM을 바이트 단위로 개조하는 '바이트화', 토크나이저의 한계를 넘다
SOURCE IMAGE · HACKER NEWS

대형 언어 모델(LLM)은 텍스트를 그대로 다루지 않는다. 학습이 시작되기 전에 문장을 '토큰'이라는 이산 단위로 변환하는데, 오늘날 대부분의 모델은 단어나 단어 조각을 토큰으로 쓰는 서브워드 토큰화 방식을 따른다. 겉보기에는 사소한 전처리 과정이지만, 이 선택은 모델이 학습하는 표현과 드러내는 행동을 근본적으로 규정한다. 네이처에 발표된 이번 연구는 서브워드 기반으로 이미 학습된 모델을 비교적 적은 추가 학습만으로 바이트 단위 모델로 개조하는 '바이트화(byteification)' 기법을 제안하며, 오랫동안 이론과 실무 사이에 벌어져 있던 간극을 좁히려 한다.

서브워드 토큰화가 안고 있는 문제

서브워드 방식은 여러 부작용을 낳는다. 우선 글자 단위 이해가 떨어져, 코드나 생물학적 서열처럼 개별 문자나 바이트에 의미가 걸려 있는 과학·기술 데이터에서 특히 취약하다. 또한 프롬프트가 어떻게 토큰으로 쪼개지느냐에 따라 특정 응답으로 치우치는 암묵적 편향이 생기고, 어휘 사전에 담을 수 있는 단어 수가 제한되다 보니 실질적으로 영어 중심으로 기울며, 연산 자원을 비효율적으로 배분하는 문제도 있다. 이런 한계 때문에 텍스트가 인코딩된 UTF-8 바이트 자체를 단위로 삼는 대안이 꾸준히 연구돼 왔다.

문제는 성과가 실무로 이어지지 않았다는 점이다. 여러 바이트 단위 모델이 효율과 성능의 파레토 경계에서 서브워드 모델을 앞선다고 주장해 왔지만, 선도적인 LLM은 여전히 예외 없이 서브워드 토큰화에 의존한다. 연구진은 그 원인을 학습 방식에서 찾는다. 기존 바이트 단위 모델은 대부분 무작위 초기화 상태에서 처음부터 새로 학습한 뒤 역시 처음부터 학습한 서브워드 모델과 비교했는데, 최신 서브워드 LLM은 데이터 큐레이션·아키텍처·사후학습 혁신이 빠르게 쌓이며 진화하고 있어 그 속도를 맨땅에서 따라잡는 것은 현실적으로 불가능에 가깝다는 것이다.

처음부터 학습하지 않고 '개조'한다

바이트화의 핵심 발상은 이미 완성된 서브워드 모델의 역량을 그대로 물려받자는 것이다. 연구진은 일반적인 사전학습 예산의 1% 미만, 총 49.1B(491억) 토큰이라는 적은 비용으로 기존 모델을 바이트 단위로 개조했다. 이렇게 완전 공개 모델인 Olmo 3 7B와 OLMo 2 1B에서 각각 Bolmo 7B·Bolmo 1B를, Qwen3 8B Base에서 Bwen 8B를, Llama 3 8B에서 Blama 8B를 만들어냈다. 바이트화는 서브워드 LLM과 바이트 단위 LLM을 잇는 연결 고리 역할을 하며, 무작위 초기화 학습을 대체한다기보다 보완하는 접근으로 제시된다. 어떤 서브워드 모델이든 값싸게 바이트화할 수 있게 되면, 처음부터 학습할 가치가 있는 유망한 아키텍처를 빠르게 선별하는 수단이 되기 때문이다.

구조적으로 이 모델들은 바이트 스트림을 여러 '패치'로 묶고, 패치 열을 큰 트랜스포머로 처리한 뒤 다시 바이트로 풀어내는 잠재 토크나이저 언어 모델(LTLM) 계열에 속한다. DTP, BLT, H-Net 등이 같은 계열이다. 지역 인코더가 바이트별 표현을 만들면 경계 예측기가 패치 경계를 정하고, 풀링을 거쳐 전역 트랜스포머가 처리한 뒤 다시 바이트 단위로 되돌린다. 연구진은 지역 모델을 얕고 넓게 설계했으며, 높은 처리량에서도 성능을 유지하는 mLSTM 계층을 지역 정보 처리에 사용했다.

미래 1바이트를 보는 경계 예측

이 연구가 기존 LTLM과 갈라지는 지점은 경계 설정 방식이다. 서브워드 토크나이저는 원리상 미래 문맥을 제약 없이 참조할 수 있지만, 과거의 바이트 단위 모델은 다음 바이트를 보기 전에 인과적으로 경계를 정해야 했다. 연구진은 프리필 단계에서 미래 1바이트까지 참조하는 비인과적 경계 예측을 도입해 서브워드 토큰화의 표현력을 복원했다. 예컨대 'the flowerbed' 같은 합성어에서 인과적 예측기는 'the flower'로 시작하는 모든 문장마다 'r' 뒤에 경계를 강제해야 하지만, 미래를 보는 예측기는 뒤이어 오는 글자에 따라 'flowers'와 'flowerbed'를 구분해 더 의미가 일관된 패치를 만들 수 있다. 디코딩 때는 다음 바이트를 미리 볼 수 없으므로, 어휘에 특수 기호 를 추가해 지역 디코더가 패치 끝마다 이를 내보내도록 학습시켰다.

실무적 의미와 한계

성능 면에서 Bolmo 7B는 무작위 초기화로 학습된 BLT 7B 대비 STEM 과제에서 절대 16.5%포인트 향상을 기록했고, 원본 Olmo 3보다 글자 이해에서 크게 앞섰으며 일부 코딩 설정에서도 더 나았다. Bwen 8B는 Bolmo 7B를 능가하며 원본 Qwen에 근접하거나 일부 과제에서는 앞서는 모습을 보였다. 또한 패치당 바이트 비율을 높여 학습하면 추론 속도를 더 끌어올릴 수 있는데, 이는 서브워드 모델에서는 제한적으로만 가능한 특성이다. 기존 모델 생태계의 구성 요소를 추가 학습 비용 없이 재사용할 수 있다는 점도 실무 도입 장벽을 낮춘다.

다만 과장은 경계할 필요가 있다. 연구진의 표현대로 바이트화된 모델은 서브워드 모델의 역량에 '근접'하는 수준이며, 모든 과제에서 일관되게 추월한 것은 아니다. 그럼에도 코드·생물학적 서열처럼 글자 하나하나가 의미를 좌우하는 도메인을 다루는 실무자, 그리고 영어 중심 토큰화가 유발하는 편향을 줄이고 배포 비용을 낮추려는 조직에게는 주목할 만한 방향이다. 바이트 단위로 끝까지 처리하는 end-to-end 언어 모델이 오랫동안 발목을 잡혀 온 성능 장벽을, 처음부터 다시 만들지 않고도 넘어설 수 있음을 보였다는 점이 이번 연구의 가장 실질적인 기여다.

SOURCE · HACKER NEWS
원문 전체 보기 → https://www.nature.com/articles/s41586-026-11111-4
SHARE
NEXT · CHOOSE

변화를 읽었다면,
내가 만들 수익 구조를 고릅니다.

정보를 더 모으는 데서 멈추지 않고, 광고·외주·판매·중개·구독 중 내 상황에 맞는 출발점을 정해보세요.

21가지 수익 구조 살펴보기 →
처리 중...