TECH 으로 돌아가기
TECH HACKER NEWS 오늘 8분 읽기 27 READS

화면 없는 증강현실, '오디오 AR'이 조용히 다가온다

화면 없는 증강현실, '오디오 AR'이 조용히 다가온다
SOURCE IMAGE · HACKER NEWS

한동안 기술 업계의 다음 물결로 지목됐던 것은 가상현실(VR)과 증강현실(AR)이었다. 메타는 오큘러스 연구개발에 매년 수십억 달러를 쏟아붓고 사명까지 바꿨고, 마이크로소프트 홀로렌즈와 매직리프가 주목받았으며 애플의 헤드셋 소문도 무성했다. 그러나 오큘러스는 아직 킬러 앱을 찾지 못했고, 애플 비전 프로 역시 명확한 쓰임새를 찾는 중이다. 그 사이 챗GPT가 등장하며 AI가 화두를 가져갔고, 정작 메타조차 요즘은 AR보다 LLaMA를 더 자주 입에 올린다. 그런데 이 소란과는 별개로, 다른 형태의 AR을 위한 조각들이 조용히 맞춰지고 있다. 바로 소리를 중심에 둔 '오디오 증강현실(Audio AR)'이다.

개념은 낡았지만 기술이 없었다

오디오 AR 자체가 새로운 발상은 아니다. 마이크로소프트의 사운드스케이프(Soundscape)는 시각장애인 접근성 도구로 개발돼, 사용자가 도시를 걸을 때 주변 세탁소나 식당 같은 관심 지점을 공간 음향 알림으로 알려줬다. 위치 기반 알림과 공간 음향의 가능성을 보여줬지만, 밀집한 도심에서는 소리가 뒤엉켜 정신없었고 교외에서는 지나치게 성겨 쓸모가 적었다. 포스퀘어의 마스봇(MarsBot)은 방대한 장소 데이터와 평점, 리뷰를 활용해 흥미로울 만한 곳을 예측·추천하는 개인화 접근을 택했다. 하지만 뉴욕처럼 밀도 높은 곳에서만 힘을 발휘했고, 진정한 '수동적' 경험이 되지 못한 채 무관한 알림을 걸러내느라 사용자의 주의를 지나치게 요구했다. 두 실험 모두 중요한 길을 텄지만, 마땅한 기반 기술이 없어 아이디어는 몇 년간 잠들어 있었다.

네 가지 기술이 판을 바꿨다

최근 몇 년 사이 상황을 바꾼 것은 네 가지 기술의 성숙이다. 첫째, 에어팟 같은 무선 스마트 이어폰이 대중화되며 손을 쓰지 않는 상시 오디오 인터페이스가 귀에 자리 잡았고, 개발자는 볼륨·머리 움직임·생체 정보 같은 센서 데이터에 접근할 수 있게 됐다. 둘째, 음성 인식은 노이즈 캔슬링과 온디바이스 연산 덕에 네트워크 없이도 빠르고 정확해졌으며, 말투를 굳이 다듬지 않아도 자연스럽게 대화할 수 있는 수준에 이르렀다. 셋째, 음성 합성(TTS)은 짧은 대화에서 사람과 구분하기 어려울 만큼 자연스러운 억양을 낸다. 넷째, 대형언어모델(LLM)은 불완전한 음성 명령을 프로그램적 동작으로 옮기고, 어떤 정보를 언제 꺼내 보일지 판단하는 결정 엔진 역할까지 한다. 여기에 장소·날씨·교통·일정 같은 풍부한 맥락 데이터가 더해지면, 사용자가 하루를 보내는 동안 딱 맞는 정보를 적시에 전달하는 그림이 완성된다. 이제 과제는 기반 기술이 아니라 사용자 경험(UX) 설계로 넘어갔다.

'푸시'와 '풀' 사이의 딜레마

오디오 AR의 핵심 난제는 '적절한 정보를 적절한 시점에' 전하는 일이다. 무관한 정보가 많으면 피로하고, 너무 적으면 쓸모가 없다. 그 사이의 균형점이 좁다. 원문 필자는 벨기에 겐트에서 이용한 보이스맵(VoiceMap) 오디오 투어를 이상적 사례로 든다. GPS로 특정 지점에 도착하면 해설이 재생되고, 카페에 들어가 멈추면 다음 안내가 재생되지 않다가 다시 걸으면 이어졌다. 인터페이스라고는 이어폰과 위치뿐이었다. 다만 이는 게임 용어로 '레일 위(on rails)'에 놓인 경험이다. 사용자가 투어를 구매하고 시작했기에 앱이 목적지와 원하는 정보를 이미 알고 있었던 것이다. 도시 전체에 콘텐츠를 깔고 어디로든 걷게 하려면, 위치뿐 아니라 시간대·일정·과거 이동 기록까지 고려해야 하며 난도가 급격히 높아진다.

포스퀘어 창업자 데니스 크롤리는 마스봇의 후신 격인 비봇(BeeBot)에서 LLM으로 콘텐츠 생성과 알림 시점을 판단하는, 여전히 '푸시' 방식을 택했다. 무엇을 보낼지에 더해 언제 보낼지까지 풀어야 하는 어려운 길이다. 반면 메타는 정반대를 택했다. 레이밴 웨이페어러를 닮은 메타의 스마트 선글라스는 공간 음향 스피커와 카메라, 그리고 베타 프로그램의 음성 멀티모달 AI를 결합했다. "헤이 메타"라고 부른 뒤 물어야만 답하는 '풀' 방식이라, 언제 콘텐츠를 밀어낼지에 대한 추측을 아예 제거했다. 대신 위치와 카메라 시야 같은 맥락은 응답에 반영하되 타이밍의 주도권은 사용자에게 둔다. 어시스턴트가 여러 질문에 답을 거부하거나 틀리고, 인터페이스가 보이지 않아 시행착오를 강요하는 거친 구석이 남아 있지만, 제대로 맞물릴 때는 미래의 단면을 보여준다.

실무자에게 남는 힌트와 한계

주목할 만한 절충안은 사용자가 능동적으로 켜는 '세션형' 맥락이다. 애플 피트니스가 좋은 예다. 에어팟을 끼고 운동을 시작하면 페이스와 심박 피드백이 한쪽 귀로 흘러들어오는데, 사용자가 특정 맥락에 들어온 만큼 푸시 알림이 모두 관련성을 갖는다. 이 패턴은 요리 앱의 조리 안내와 타이머, 매장에서 상품을 집을 때 순위·리뷰를 띄우는 쇼핑 앱 등으로 확장할 수 있다. 사용자가 켰을 때만 마음껏 푸시하므로, 개발자는 좁은 범위의 맥락 데이터와 제한된 알림 트리거에만 집중하면 된다. 이는 오디오 AR의 난제를 조금씩 깎아내는 현실적 진입 전략이다.

다만 세 사례는 공통적으로 맥락 데이터 접근의 벽에 부딪힌다. 보이스맵은 정해진 투어 경로를 벗어나면 할 말이 없고, 메타 선글라스는 일정이나 메시지에 접근하지 못하며 그 데이터를 다루는 시리는 안경에서 호출되지 않는다. 피트니스는 곧 비가 오거나 회의가 있어도 귀가를 권하지 못한다. 데이터는 존재하나 각 앱이 신경 쓰는 맥락 영역이 분절돼 있기 때문이다. 필자는 이를 도구들이 서로 대화하게 만든 API의 대폭발 직전, 웹 2.0 초기와 비슷한 상황으로 본다. 어시스턴트 인터페이스는 방대한 능력을 가진 듯 자신을 내세우지만, 다른 플랫폼의 무언가가 필요한 순간 넘어진다. 결국 오디오 AR의 성패는 더 화려한 하드웨어가 아니라, 흩어진 맥락을 '보이지 않는 인터페이스'로 엮어낼 데이터 연결과 그 위의 UX 설계에 달려 있는 셈이다.

SOURCE · HACKER NEWS
원문 전체 보기 → https://www.dbreunig.com/2024/04/10/the_rise_of_audio_ar.htm...
SHARE
NEXT · CHOOSE

변화를 읽었다면,
내가 만들 수익 구조를 고릅니다.

정보를 더 모으는 데서 멈추지 않고, 광고·외주·판매·중개·구독 중 내 상황에 맞는 출발점을 정해보세요.

21가지 수익 구조 살펴보기 →
처리 중...