핵심 내용

GeekNews 최신 글에서 확인한 NobodyWho는 앱과 게임 안에서 클라우드 API 없이 LLM을 직접 실행하기 위한 오픈소스 inference engine이다. 원본 GitHub 저장소를 확인하면 Rust core 위에 llama.cpp와 ONNX Runtime을 결합하고, Kotlin, Swift, React Native/Expo, Flutter, Python, Godot binding을 제공한다.

LLM text generation뿐 아니라 image·audio 입력, structured tool calling, Whisper 기반 speech-to-text, 여러 TTS backend, Silero 기반 Voice Activity Detection까지 하나의 로컬 runtime에 묶는다. GGUF 형식의 Gemma, Qwen, Mistral 등 다양한 모델을 사용할 수 있으며 Hugging Face나 URL에서 모델을 받아 local cache에 저장할 수 있다.

하드웨어에서는 macOS의 Metal과 Linux·Windows의 Vulkan을 활용하며 GPU 메모리에 들어가는 만큼 layer를 offload하고 나머지는 CPU에서 처리한다. 저장소가 제시하는 대략적인 권장조건은 데스크톱에서 모델 파일 크기의 약 1.5배 정도의 여유 RAM이며, 모바일에서는 모델 파일 크기의 약 2배 수준이다. iOS는 iPhone 11 이후와 4GB 이상 RAM, Android는 Snapdragon 855/Adreno 640/6GB RAM 이상을 기준으로 제시한다. 이는 프로젝트 권장치이며 실제 속도는 모델과 기기에 크게 좌우된다.

배경

클라우드 LLM의 가격이 내려가고 있지만 게임·오프라인 앱·개인정보 민감 서비스에서는 network latency, API 비용, 인터넷 연결, 데이터 전송이 계속 제약이다. 소형 open-weight 모델 품질이 좋아지면서 일부 대화·NPC·음성·분류 workload는 사용자 기기에서 처리할 수 있는 범위가 넓어지고 있다.

산업·시장에 미치는 영향

앱 개발자는 AI 기능을 추가하기 위해 반드시 특정 모델 API 사업자와 장기 연결될 필요가 줄어들 수 있다. 특히 게임 NPC, 개인 메모, 음성 인터페이스처럼 대량 호출이 발생하는 기능에서는 한번 모델을 내려받은 뒤 반복 사용하는 구조가 비용과 개인정보 측면에서 유리할 수 있다.

반면 단말별 RAM·GPU 성능 차이, 모델 다운로드 크기, 배터리, 발열, 업데이트 관리가 개발팀의 책임이 되기 때문에 cloud API보다 운영 복잡성이 높아질 수 있다.

실무에서 바로 활용할 수 있는 시사점

온디바이스 AI를 검토한다면 가장 작은 모델부터 실제 목표기기에서 p50/p95 latency, RAM peak, battery drain, 앱 크기와 품질을 측정하는 것이 좋다. 고난도 reasoning은 cloud로 보내고 개인정보 민감·반복적·지연 민감 task는 local로 처리하는 hybrid routing도 현실적인 구조다.

출처

GeekNews — 최신 글
GitHub — nobodywho-ooo/nobodywho