GeekNews 최신글에 약 23시간 전 올라온 프로젝트입니다. NVIDIA 공식 GitHub까지 확인했습니다. (GeekNews)
PAIR는 같은 네트워크에 있는 여러 PC를 자동으로 발견하고 독립적인 inference 요청을 여유가 있는 컴퓨터로 분산합니다.
지원 환경은 Windows 11·Linux·macOS이며, 서로 다른 OS끼리도 cluster를 구성할 수 있습니다. 현재 inference engine은 Ollama와 LM Studio를 지원합니다. 애플리케이션에는 OpenAI-compatible 또는 Ollama-compatible endpoint를 제공하므로 기존 프로그램 변경도 비교적 작습니다. (GitHub)
NVIDIA 공식 자료 기준 beta는:
GeForce RTX 20 시리즈 이상 / RTX PRO / DGX Spark / Apple M4 이상
을 지원합니다. (NVIDIA Blog)
예를 들어 여러 subagent를 동시에 실행할 경우:
Agent A ──→ PC 1 GPU
Agent B ──→ PC 2 GPU
Agent C ──→ PC 3 GPU
형태로 분산합니다. 하나의 거대한 모델을 여러 GPU에 tensor parallel하는 시스템이라기보다는 서로 독립적인 요청을 여러 컴퓨터에 scheduling하는 구조라고 이해하는 게 정확합니다. (GitHub)
로컬 Agent를 여러 개 병렬 실행하는 흐름이 커지면서 개인 PC도 작은 inference cluster처럼 사용하는 방향이 나오고 있다는 점에서 볼 가치가 있습니다.