TECH 으로 돌아가기
TECH HACKER NEWS 오늘 9분 읽기 28 READS

Gemini 3.8 Live 공개, 실시간 음성 대화에 '생각하는 모델'을 얹는다는 게 무슨 뜻일까

Gemini 3.8 Live 공개, 실시간 음성 대화에 '생각하는 모델'을 얹는다는 게 무슨 뜻일까
SOURCE IMAGE · HACKER NEWS
Gemini 3.8 Live 공개, 실시간 음성 대화에 '생각하는 모델'을 얹는다는 게 무슨 뜻일까

무슨 일이 있었냐면

구글이 Gemini의 실시간 음성 대화용 모델 두 개를 새로 내놨어요. 이름은 Gemini 3.8 LiveGemini 3.8 Live Extended Thinking이에요. 이름에 들어간 단어를 하나씩 뜯어보면 이 발표가 뭘 말하는지 대충 감이 오는데요. "Live"는 텍스트로 주고받는 채팅이 아니라, 사람이 말하면 AI가 목소리로 바로 대답하는 실시간 음성 대화 모드를 뜻해요. Gemini 앱에서 마이크 버튼 누르고 통화하듯 이야기하는 그 기능이고, 개발자용으로는 Live API라는 이름으로 열려 있어요. 그리고 "Extended Thinking"은 대답하기 전에 모델이 속으로 한참 생각하는, 요즘 말로 추론 모델의 기능을 말해요.

그러니까 이번 발표를 한 줄로 풀면 "음성으로 대화하는 모델을 새 세대로 올렸고, 그중 하나는 대답하기 전에 깊게 생각할 줄 안다"는 거예요. 텍스트 쪽에서는 이미 익숙한 "생각하는 모델"이 실시간 음성 대화로 넘어왔다는 점이 핵심이에요. 구체적인 벤치마크 수치나 가격, 지원 언어 목록 같은 세부 사항은 구글 공식 블로그와 API 문서에서 확인하시고, 이 글에서는 이게 기술적으로 왜 어려운 문제이고 어떤 의미가 있는지를 풀어볼게요.

음성 AI가 어떻게 만들어지는지부터

예전 방식의 음성 비서는 세 개의 부품을 줄줄이 이어 붙인 구조였어요. 먼저 음성 인식(STT)이 사람 말을 글자로 바꾸고, 그 글자를 언어 모델이 읽고 답을 글자로 쓰고, 마지막에 음성 합성(TTS)이 그 글자를 목소리로 읽어주는 식이죠. 이걸 캐스케이드 방식이라고 불러요. 단순하고 각 부품을 따로 고를 수 있어서 좋은데, 문제가 두 가지 있어요. 하나는 세 단계를 거치니 느리다는 거고, 다른 하나는 글자로 바꾸는 순간 목소리에 담긴 정보가 다 날아간다는 거예요. 말끝을 흐리는지, 웃으면서 말하는지, 화가 났는지 같은 건 글자에 안 남거든요.

그래서 요즘 Live 계열 모델은 네이티브 오디오 방식이에요. 이게 뭐냐면, 소리를 글자로 바꾸지 않고 소리 그 자체를 모델에 넣고, 모델이 소리를 직접 뱉어내는 구조예요. 중간 단계가 없으니 반응이 빠르고, 억양이나 감정, 말 겹침 같은 대화의 결이 살아남아요. 사람이 말하는 도중에 끼어들면 모델이 말을 멈추는 것도 이 구조라서 자연스럽게 되고요. 개발자 입장에서는 WebSocket 같은 양방향 연결을 열어두고 마이크 소리를 잘게 잘라 계속 흘려보내면, 모델이 오디오 조각을 계속 돌려주는 식으로 동작해요. 중간에 함수 호출로 외부 데이터를 가져오거나 화면 공유 영상을 함께 보내는 것도 가능하죠.

그런데 왜 '생각하는 음성 모델'이 어려운 문제냐면

여기서 딜레마가 생겨요. 사람끼리 대화할 때 상대가 대답하기까지 걸리는 시간은 보통 0.2초에서 0.5초 정도예요. 이걸 넘어가면 "얘가 못 들었나?" 싶어져요. 그런데 추론 모델은 대답 전에 속으로 긴 생각을 하고, 그게 몇 초에서 수십 초까지 걸리기도 하잖아요. 텍스트 채팅에서는 "생각 중..." 표시를 보며 기다리면 되지만, 음성 통화에서 5초 침묵은 고장난 것처럼 느껴져요.

그래서 "Live"와 "Extended Thinking"을 한 모델 이름에 나란히 넣었다는 건, 이 딜레마를 어떻게든 다뤘다는 뜻이에요. 생각할 수 있는 접근은 몇 가지가 있어요. 사람이 말하는 동안 미리 생각을 시작해서 말이 끝날 때쯤엔 답이 준비되어 있게 하는 방법, "음, 그건요..." 같은 짧은 반응을 먼저 내보내서 침묵을 메우고 그 사이에 생각하는 방법, 질문의 난이도에 따라 생각의 양을 조절하는 방법 같은 거요. 사람도 어려운 질문을 받으면 "잠깐만요" 하고 생각하잖아요. 그걸 모델이 자연스럽게 흉내 내는 게 목표인 셈이에요.

두 모델로 나눠서 낸 이유도 여기서 나와요. 일상 대화나 간단한 안내처럼 빠른 반응이 최우선인 상황에는 기본 Live 모델이 맞고, 수학 문제를 말로 풀어달라거나 복잡한 상담을 음성으로 해야 하는 상황에는 조금 느려도 정확한 Extended Thinking 모델이 맞아요. 개발자가 용도에 따라 고르라는 거죠. 이건 텍스트 모델에서 빠른 모델과 추론 모델을 따로 두는 것과 같은 흐름이에요.

업계에서 이 발표의 위치

실시간 음성 모델 경쟁은 이미 뜨거워요. OpenAI는 Realtime API로 네이티브 음성 모델을 먼저 밀어붙였고, ChatGPT의 고급 음성 모드가 그 위에 올라가 있죠. 오픈소스 쪽에서는 프랑스 Kyutai의 Moshi처럼 듣기와 말하기를 동시에 하는 실험적인 모델이 나왔고, 작은 스타트업들도 감정 표현이 풍부한 대화 모델을 내놓고 있어요. 텍스트에서 시작된 추론 모델 붐이 이제 음성으로 번지는 중이고, 구글의 이번 발표는 그 흐름을 대형 모델 회사 차원에서 공식화한 거라고 볼 수 있어요.

구글이 유리한 지점은 배포망이에요. 안드로이드, 픽셀, Gemini 앱, 그리고 구글 홈 같은 기기에 바로 실릴 수 있으니까요. 음성 모델은 결국 "어디서 얼마나 자주 쓰이느냐"가 데이터와 품질을 만들기 때문에, 이 규모는 무시 못 할 무기예요. 반대로 개발자 입장에서는 OpenAI와 구글 사이에서 지연 시간, 한국어 품질, 가격을 저울질할 선택지가 하나 더 생긴 거고요.

한국 개발자 입장에서는

먼저 한국어 음성 품질을 직접 확인하셔야 해요. 영어 데모가 아무리 매끄러워도 한국어 억양, 존댓말 처리, 빠른 말 속도에서 어떻게 나오는지는 써봐야 알아요. 특히 Extended Thinking 모델이 생각하는 동안 한국어로 어떤 식으로 시간을 버는지, 그게 자연스러운지 살펴볼 만해요.

쓸 만한 곳은 꽤 많아요. 콜센터 자동 응대, 영어 회화 튜터, 키오스크 음성 안내, 운전 중 쓰는 음성 도우미 같은 곳이죠. 이 중에서 "규정을 확인하고 정확히 답해야 하는" 상담 업무는 Extended Thinking 쪽이, "빠르게 받아치는" 회화 연습은 기본 Live 쪽이 어울려요. 처음 써보신다면 Live API 문서에서 WebSocket 연결 예제를 따라 마이크 입력을 스트리밍하는 작은 데모부터 만들어보세요. 함수 호출로 우리 서비스의 API를 붙이는 것까지 해보면 감이 잡혀요.

비용은 꼭 챙기세요. 오디오는 텍스트보다 토큰이 훨씬 많이 들고, 생각하는 모델은 생각 토큰까지 더해져서 통화 한 번의 비용이 생각보다 커질 수 있어요. 지연 시간도 서울에서 직접 측정해보셔야 해요. 서버 위치에 따라 왕복 시간이 달라지고, 그게 대화의 자연스러움을 좌우하거든요.

정리하면

텍스트에서 익숙해진 "생각하는 모델"이 실시간 음성 대화로 들어왔고, 구글은 빠른 모델과 깊게 생각하는 모델을 나눠서 골라 쓰게 했어요. 침묵 없이 생각하는 게 진짜 되는지가 관전 포인트예요.

여러분은 음성 AI가 "잠깐만요, 생각 좀 해볼게요" 하고 몇 초 뜸을 들이는 걸 받아들일 수 있으세요? 아니면 조금 틀려도 즉답이 더 중요할까요? 만들고 계신 서비스 기준으로 어느 쪽인지 궁금해요.


🔗 출처: Hacker News

SOURCE · HACKER NEWS
원문 전체 보기 → https://blog.google/innovation-and-ai/models-and-research/ge...
SHARE
NEXT · CHOOSE

변화를 읽었다면,
내가 만들 수익 구조를 고릅니다.

정보를 더 모으는 데서 멈추지 않고, 광고·외주·판매·중개·구독 중 내 상황에 맞는 출발점을 정해보세요.

21가지 수익 구조 살펴보기
처리 중...