핵심 내용

Google DeepMind는 10월 6일 open-weight multimodal embedding 모델 EmbeddingGemma 2를 공개했다. 모델은 text, image, video frame, audio를 하나의 embedding space로 매핑하며 총 740M parameter 규모다. 출처

Google Pixel 11 Pro 기준 text-only encoder는 약 191MB active RAM, 전체 multimodal 모델은 약 567MB active RAM으로 동작한다고 Google은 설명한다. 여러 개의 captioning, STT, text embedding 모델을 연속 호출하지 않고 하나의 모델로 로컬 멀티모달 검색을 구현하는 것이 목표다. 출처

별도 fine-tuning 없이 입력을 classification label과 직접 비교해 millisecond 단위의 zero-shot intent routing에도 사용할 수 있다. Google AI Edge Gallery에서는 로컬 사진·영상 자연어 검색과 영상 속 특정 장면 찾기 demo를 제공하며, Mac용 AI Edge Foresight에서는 회의음성·문서·메모를 로컬에서 index해 검색하는 예시를 제공한다. 출처

향후 Android ML Kit service로 제공하고 NPU acceleration도 지원할 계획이다. 현재 성능·메모리 수치는 Google이 특정 Pixel 환경에서 공개한 값이므로 다른 Android·iOS·PC에서 같은 footprint와 latency가 보장되는 것은 아니다.

배경

RAG와 semantic search는 보통 클라우드 embedding API를 호출하거나 이미지·음성을 먼저 텍스트로 변환한 뒤 text embedding을 생성했다. 하지만 모바일·개인정보 민감 앱에서는 network latency와 데이터 외부전송이 제약이다. 소형 multimodal embedding 모델은 생성형 LLM 전체를 단말에 올리지 않고도 검색·분류·routing 기능을 로컬화할 수 있다.

산업·시장에 미치는 영향

온디바이스 AI 시장에서 대형 generative model뿐 아니라 embedding·reranking·intent classification 같은 작은 모델 계층이 중요해질 수 있다. 민감 데이터를 cloud로 올리지 않으면서 개인 사진, 녹음, 파일을 semantic search하는 기능을 앱 개발자가 직접 제공하기 쉬워진다.

실무에서 바로 활용할 수 있는 시사점

모바일 RAG나 개인검색을 만들 때 모든 질의를 cloud LLM으로 보내기 전에 EmbeddingGemma 2 같은 로컬 embedding으로 후보를 좁히고 필요한 경우에만 cloud reasoning을 호출하는 hybrid 구조가 비용과 privacy를 동시에 개선할 수 있다. 실제 기기에서는 index 생성시간, battery drain, storage 크기와 recall을 함께 측정해야 한다.

출처

Google Developers Blog — Bring multimodal semantic search to the edge with EmbeddingGemma 2