TECH 으로 돌아가기
TECH HACKER NEWS 오늘 7분 읽기 26 READS

구글 EmbeddingGemma 2 공개: 텍스트와 이미지를 한 공간에 담는 가벼운 오픈 임베딩 모델

구글 EmbeddingGemma 2 공개: 텍스트와 이미지를 한 공간에 담는 가벼운 오픈 임베딩 모델
SOURCE IMAGE · HACKER NEWS
구글 EmbeddingGemma 2 공개: 텍스트와 이미지를 한 공간에 담는 가벼운 오픈 임베딩 모델

무슨 일이 있었나요?

구글이 오픈 임베딩 모델 EmbeddingGemma의 후속작 EmbeddingGemma 2를 공개했어요. 이번 버전의 키워드는 오픈(open), 가벼움(lightweight), 멀티모달(multimodal) 세 가지예요.

작년에 나온 1세대 EmbeddingGemma는 파라미터가 약 3억 개인 텍스트 전용 모델이었어요. 100개가 넘는 언어를 지원했고, 양자화(숫자 정밀도를 낮춰 모델을 압축하는 기법)를 하면 200MB도 안 되는 메모리에서 돌아갔어요. 그래서 노트북이나 스마트폰 안에서 검색이나 RAG를 직접 돌리려는 개발자들이 많이 찾았거든요. 2세대에서 가장 크게 바뀐 점은 텍스트가 아닌 데이터도 이해하게 됐다는 거예요.

잠깐, 임베딩이 뭐였더라?

임베딩은 쉽게 말해 의미를 숫자 좌표로 바꾸는 일이에요. '강아지 산책시키기'와 '반려견이랑 걷기'는 글자는 다르지만 뜻은 비슷하잖아요? 임베딩 모델은 이런 문장을 수백 개의 숫자로 된 배열(벡터)로 바꾸는데, 뜻이 비슷하면 좌표도 가깝게 찍히도록 학습돼 있어요. 지도에서 이웃 동네끼리 붙어 있는 것과 비슷해요.

이게 중요한 이유는 요즘 많이 만드는 RAG(검색 증강 생성) 시스템이 임베딩에서 시작하기 때문이에요. 사내 문서를 전부 벡터로 바꿔 벡터 DB에 넣어 두고, 질문이 들어오면 질문도 벡터로 바꿔 가장 가까운 문서를 찾아 LLM에게 넘겨주는 구조예요. 키워드가 정확히 일치하지 않아도 뜻으로 찾을 수 있다는 게 핵심이에요.

멀티모달 임베딩은 뭐가 다른가요?

멀티모달 임베딩은 텍스트와 이미지처럼 종류가 다른 데이터를 같은 좌표 공간에 올려놓는 것이에요. '바닷가에서 뛰노는 골든 리트리버'라는 문장과 실제로 그런 사진이 서로 가까운 곳에 찍히는 거죠. 그래서 글로 사진을 찾을 수도 있고, 사진으로 비슷한 사진이나 관련 문서를 찾을 수도 있어요.

이 분야를 연 모델은 OpenAI의 CLIP이고, 구글도 SigLIP 같은 이미지-텍스트 모델을 낸 적이 있어요. 그런데 CLIP 계열은 텍스트 이해력이 상대적으로 약해서, 긴 문서까지 검색하려면 텍스트 임베딩 모델을 따로 붙이는 경우가 많았어요. 이미지용과 문서용 모델 두 개를 운영하고 결과를 합쳐야 하니 번거로웠죠. 텍스트 임베딩에서 출발한 EmbeddingGemma가 멀티모달로 넓어졌다는 건, 이 두 역할을 작은 모델 하나로 해결해 보려는 시도로 볼 수 있어요.

1세대에서 호평받은 마트료시카 표현 학습(MRL)도 눈여겨볼 만해요. 러시아 인형처럼 큰 벡터 안에 작은 벡터가 들어 있는 구조예요. 768차원 벡터의 앞부분만 잘라 256차원이나 128차원으로 써도 성능이 크게 떨어지지 않도록 학습시키는 기법이에요. 저장 공간과 검색 속도를 상황에 맞춰 조절할 수 있어서 실무에서 정말 쓸모가 많아요. 2세대가 정확히 어떤 차원과 입력 형식을 지원하는지, 벤치마크 수치는 어떤지는 공식 블로그와 모델 카드에서 꼭 직접 확인해 보세요.

경쟁 구도는 어떻게 되나요?

멀티모달 임베딩 시장에는 이미 선수가 많아요. API로 쓰는 쪽에는 Cohere Embed v4, Voyage의 멀티모달 모델, 구글 Vertex AI의 멀티모달 임베딩 등이 있어요. 오픈 모델 쪽에는 Jina CLIP, Nomic Embed Vision 같은 멀티모달 모델이 있고, 텍스트 임베딩에서는 Qwen과 BGE 계열 모델들이 강세예요.

그중에서 EmbeddingGemma 2가 노리는 자리는 분명해요. 최고 성능보다는 어디서든 돌아가는 작고 쓸 만한 모델이에요. 큰 임베딩 모델은 벤치마크 점수는 높지만 GPU 서버가 필요하고, 문서 수백만 건을 인덱싱하면 비용도 만만치 않거든요. 작은 모델은 CPU나 모바일 기기에서도 돌아가서, 데이터를 밖으로 보내지 않는 온디바이스 검색이나 비용에 민감한 서비스에 잘 맞아요.

한국 개발자에게 주는 시사점

첫째, 한국어 RAG를 로컬에서 돌려보고 싶은 분께 좋은 실험 대상이에요. 1세대부터 다국어 지원을 강조한 모델이라, 스크린샷이 잔뜩 들어간 사내 위키나 매뉴얼처럼 한국어 문서와 이미지가 섞인 자료로 테스트해 보기 좋아요. 다만 다국어 모델은 언어마다 성능 차이가 크니, 꼭 우리 데이터로 직접 평가해 보세요.

둘째, 보안 때문에 외부 API를 쓸 수 없는 환경이에요. 금융, 공공, 의료처럼 데이터 반출이 까다로운 곳에서는 사내 서버나 단말에서 돌아가는 오픈 모델이 사실상 유일한 선택지인 경우가 많아요.

셋째, 커머스와 콘텐츠 서비스예요. '이 사진이랑 비슷한 옷 찾아줘' 같은 이미지 검색이나, 상품 이미지와 설명을 함께 보는 추천 기능을 작은 모델로 빠르게 프로토타이핑해 볼 수 있어요.

실무 팁도 하나 드릴게요. 임베딩 모델을 바꾸면 기존 벡터를 전부 다시 만들어야 해요. 모델마다 좌표계가 달라서 서로 호환되지 않거든요. 갈아타기 전에 일부 데이터로 검색 품질부터 비교해 보는 게 안전해요.

마무리

한 줄 정리: EmbeddingGemma 2는 텍스트와 이미지를 작은 모델 하나로 처리해서, 온디바이스 검색을 시작하기 더 쉽게 만들려는 시도예요.

여러분은 지금 RAG나 검색 시스템에 어떤 임베딩 모델을 쓰고 계신가요? 이미지까지 같이 검색해야 했던 적이 있는지, 작은 오픈 모델로 갈아탈 생각이 있는지 경험을 나눠주세요!


🔗 출처: Hacker News

SOURCE · HACKER NEWS
원문 전체 보기 → https://blog.google/innovation-and-ai/technology/developers-...
SHARE
NEXT · CHOOSE

변화를 읽었다면,
내가 만들 수익 구조를 고릅니다.

정보를 더 모으는 데서 멈추지 않고, 광고·외주·판매·중개·구독 중 내 상황에 맞는 출발점을 정해보세요.

21가지 수익 구조 살펴보기 →
처리 중...