TECH 으로 돌아가기
TECH HACKER NEWS 오늘 6분 읽기 29 READS

“빨간 우산 든 사람”으로 영상 속 장면까지 찾는다, macOS용 AI 미디어 검색 도구 SCM

“빨간 우산 든 사람”으로 영상 속 장면까지 찾는다, macOS용 AI 미디어 검색 도구 SCM
SOURCE IMAGE · HACKER NEWS
“빨간 우산 든 사람”으로 영상 속 장면까지 찾는다, macOS용 AI 미디어 검색 도구 SCM

무슨 일이 있었나

맥에 쌓인 사진과 영상에서 원하는 장면 하나 찾는 거, 생각보다 고통스럽죠. 파일 이름은 대부분 IMG_4821.MOV 같은 의미 없는 숫자예요. 폴더 정리를 아무리 열심히 해도 “작년 회식 때 누가 케이크 들고 있던 장면”을 찾으려면 결국 영상을 하나하나 열어서 돌려봐야 하거든요.

이번에 깃허브에 공개된 SCM은 바로 이 문제를 겨냥한 macOS용 도구예요. 사진은 물론 영상의 모든 프레임까지 AI로 색인해두고, 자연어 문장으로 검색할 수 있게 해준다는 게 핵심이에요. 사진 검색이야 이미 여러 앱에 있지만, 영상 내부를 장면 단위까지 파고든다는 점이 눈에 띄어요.

이런 검색은 어떻게 동작할까

이런 도구의 뼈대는 대부분 멀티모달 임베딩이라는 기술이에요. 이게 뭐냐면, 이미지와 텍스트를 같은 ‘의미 공간’ 안의 좌표(숫자 벡터)로 바꿔주는 거예요. 강아지 사진과 “공원에서 뛰노는 강아지”라는 문장이 서로 가까운 좌표에 찍히도록 학습된 모델을 쓰는 거죠. OpenAI가 공개한 CLIP이 대표적이고, 애플도 모바일 기기에서 돌릴 수 있게 가볍게 만든 MobileCLIP을 공개했어요.

전체 흐름은 대략 이래요.

1. 색인 단계: 사진마다 임베딩 벡터를 계산해서 저장해요. 영상은 일정한 간격(예: 1초에 한 장)으로 프레임을 뽑아서 각각 벡터로 만들고, 프레임의 타임스탬프도 같이 기록해요.
2. 검색 단계: 사용자가 입력한 문장도 같은 모델로 벡터로 바꿔요.
3. 유사도 비교: 저장된 벡터 중에서 검색어 벡터와 가장 가까운 것을 찾아 보여줘요. 영상이라면 그 장면이 있는 시간 위치로 바로 이동할 수 있고요.

영상이 까다로운 건 양 때문이에요. 10분짜리 영상 하나에만 프레임이 1만 장 넘게 들어 있거든요. 모든 프레임을 다 처리하면 색인에 엄청난 시간이 걸리니까, 장면이 바뀌는 지점만 골라내거나 비슷한 연속 프레임을 하나로 묶는 최적화가 성능을 좌우해요. 벡터가 수십만~수백만 개로 늘어나면 비슷한 벡터를 빠르게 찾아주는 벡터 인덱스(근사 최근접 이웃 검색, ANN)도 필요해지고요.

애플 실리콘 맥은 이런 작업에 꽤 유리한 환경이에요. CPU와 GPU가 메모리를 공유하는 통합 메모리 구조인 데다 머신러닝 전용 칩인 뉴럴 엔진까지 있어요. 그래서 Core ML이나 MLX 같은 프레임워크로 로컬 추론을 꽤 빠르게 돌릴 수 있거든요.

비슷한 도구들과 비교하면

사실 “자연어로 사진 찾기”는 이미 익숙한 기능이에요. 구글 포토나 애플 사진 앱에서도 “바다”, “생일 케이크” 같은 검색이 되죠. 하지만 이런 앱들은 자기 라이브러리에 들어간 미디어에서만 동작해요. 데스크톱 폴더나 외장 SSD에 흩어진 파일까지는 다루지 못하고요.

셀프 호스팅 쪽에서는 Immich가 CLIP 기반 스마트 검색을 제공해요. 터미널에서 쓰는 rclip 같은 작은 오픈소스 도구도 있고요. 다만 대부분 사진 중심이라 영상은 썸네일 정도만 다루는 경우가 많아요. SCM의 차별점은 영상 프레임 단위 검색을 맥에 있는 파일에 바로 적용했다는 데 있어요.

한국 개발자에게 주는 시사점

개인적으로 바로 써볼 만한 사람은 유튜브나 숏폼 영상을 만드는 분들, 그리고 촬영 소스가 많은 디자이너와 마케터예요. “그 장면 어디 있었지?”를 찾는 시간만 줄어도 체감 효과가 크거든요.

다만 설치하기 전에 꼭 확인할 게 있어요. 분석이 정말 맥 안에서만 이뤄지는지, 아니면 이미지를 외부 API로 보내는지예요. 개인 사진과 영상은 민감한 데이터라서 README나 코드를 직접 확인해보는 게 좋아요. 한국어 검색어가 잘 먹히는지도 봐야 해요. CLIP 계열 모델은 영어 위주로 학습된 경우가 많아서, 한국어로 검색하면 정확도가 확 떨어질 수 있거든요.

개발자에게는 좋은 학습 교재이기도 해요. 임베딩을 만들고, 벡터를 저장하고, 유사도로 검색하는 구조는 RAG(검색 증강 생성) 시스템의 검색 단계와 거의 같아요. 텍스트 대신 이미지를 다루는 RAG 검색기의 축소판이라고 보면 돼요. 사내 디자인 에셋 검색이나 CCTV 영상 검색 같은 서비스로 응용할 수도 있고요.

마무리

한줄 정리: 멀티모달 임베딩 덕분에 파일 이름이 아니라 내용으로, 영상 속 장면까지 찾는 검색을 개인 PC에서 쓸 수 있게 됐어요.

여러분이라면 이런 미디어 검색을 어떤 데이터에 적용해보고 싶으신가요? 그리고 개인 사진을 AI로 분석하는 데 어디까지가 허용 가능한 선이라고 생각하시나요?


🔗 출처: Hacker News

SOURCE · HACKER NEWS
원문 전체 보기 → https://github.com/allenv0/SCM
SHARE
NEXT · CHOOSE

변화를 읽었다면,
내가 만들 수익 구조를 고릅니다.

정보를 더 모으는 데서 멈추지 않고, 광고·외주·판매·중개·구독 중 내 상황에 맞는 출발점을 정해보세요.

21가지 수익 구조 살펴보기 →
처리 중...