TECH 으로 돌아가기
TECH HACKER NEWS 오늘 7분 읽기 25 READS

16.9MB짜리 음성인식 모델 ‘Whistle’: 기기에서 바로 돌리는 STT는 얼마나 작아질 수 있을까

음성인식 모델이 사진 몇 장 크기라고요?

Cactus Compute에서 Whistle이라는 음성-텍스트 변환 모델을 공개했어요. STT(Speech to Text), 그러니까 말소리를 글자로 바꿔 주는 모델이에요. 가장 눈에 띄는 숫자는 16.9MB라는 크기인데요. 요즘 스마트폰으로 찍은 고화질 사진 몇 장, 아니면 가벼운 앱 업데이트 한 번 정도의 용량이에요. Cactus는 스마트폰이나 노트북 안에서 AI 모델을 직접 돌리는 온디바이스 AI에 집중해 온 팀이라서, 이번 발표도 그 흐름에서 나온 결과물로 보시면 돼요.

“그게 왜 대단해?” 싶으실 수 있는데요, 비교 대상을 보면 감이 와요. 음성인식에서 사실상 표준처럼 쓰이는 OpenAI의 Whisper는 가장 큰 large 모델이 파라미터가 약 15억 개라 용량이 수 GB나 돼요. 가장 작은 tiny 모델도 파라미터가 약 3,900만 개라서 일반적인 16비트 형식으로 저장하면 70MB가 조금 넘어요. 16.9MB는 그 tiny 모델보다도 한참 작은 크기예요.

왜 굳이 기기 안에서 돌려야 할까?

음성인식을 서버(클라우드)에서 처리하면 편하긴 해요. 큰 모델을 마음껏 쓸 수 있으니까요. 그런데 문제가 세 가지 따라와요.

첫째는 지연 시간이에요. 말한 내용을 서버로 보내고 결과를 받아오는 데 왕복 시간이 생기거든요. 실시간 자막이나 음성 명령처럼 바로 반응해야 하는 기능에서는 이게 꽤 거슬려요. 둘째는 비용인데요, 사용자가 늘면 음성 처리 API 요금도 같이 늘어나요. 셋째는 프라이버시예요. 회의 녹음이나 병원 상담처럼 민감한 음성을 외부 서버로 보내는 것 자체가 부담인 경우가 많죠.

온디바이스로 돌리면 이 세 가지가 한 번에 해결돼요. 네트워크가 없어도 동작하고, 데이터가 기기 밖으로 나가지 않으니까요. 대신 모델이 작아야 한다는 숙제가 생겨요. 앱 용량, 메모리, 배터리를 다 신경 써야 하거든요.

모델을 이렇게 작게 만드는 방법

Whistle의 구체적인 구조는 원문에서 꼭 확인해 보시길 권해요. 일반적으로 모델을 작게 만들 때는 이런 방법들을 많이 써요.

쓸 곳은 생각보다 많아요. 음성 메모 앱, 키오스크 음성 주문, 오프라인 회의록, 웨어러블 기기, 스마트홈 명령어 인식처럼 네트워크가 불안정하거나 데이터를 밖으로 보내기 싫은 곳이라면 어디든 후보가 돼요.

마무리

한 줄 정리: 음성인식이 '서버에서 돌리는 무거운 기능'에서 '앱에 그냥 넣는 가벼운 부품'으로 바뀌고 있어요.

여러분은 온디바이스 STT를 실제 서비스에 넣어 보신 적 있나요? 한국어 인식 품질이 어느 정도 나와야 클라우드 API를 버리고 넘어갈 수 있을지, 각자의 기준이 궁금해요.


🔗 출처: Hacker News

SOURCE · HACKER NEWS
원문 전체 보기 → https://cactuscompute.com/blog/whistle
SHARE
NEXT · CHOOSE

변화를 읽었다면,
내가 만들 수익 구조를 고릅니다.

정보를 더 모으는 데서 멈추지 않고, 광고·외주·판매·중개·구독 중 내 상황에 맞는 출발점을 정해보세요.

21가지 수익 구조 살펴보기 →
처리 중...