Apple은 8월 25일 M5 Max와 M5 Ultra를 탑재한 새 Mac Studio를 발표했습니다. 이번 발표에서 Apple이 제품 설명 전면에 내세운 용도 중 하나가 바로 온디바이스 AI와 AI 코딩 에이전트입니다. apple.com
M5 Ultra 구성은 최대 512GB unified memory와 1.2TB/s 메모리 대역폭을 지원합니다. Apple은 이 정도 메모리로 대규모 오픈웨이트 LLM을 완전히 로컬에서 실행할 수 있다고 설명합니다. 여러 Mac Studio를 Thunderbolt 5 + RDMA로 연결하면 메모리를 공유할 수 있고, 4대 클러스터에서 단일 시스템보다 최대 3배 높은 분산 AI 추론 성능을 제공한다고 Apple은 밝혔습니다. 역시 Apple 자체 테스트 기준입니다. apple.com
Apple은 동시에 M6 또는 M5 Pro를 탑재한 새로운 Mac mini도 공개했습니다. Reuters는 Mac mini가 최근 항상 켜 두는 로컬 AI agent host 용도로 수요가 높아졌다는 점을 이번 제품의 주요 배경 가운데 하나로 짚었습니다. reuters.com
산업·시장 영향
로컬 AI가 점점 별도의 하드웨어 카테고리가 되고 있습니다.
이전에는 로컬 LLM이 주로:
RTX GPU가 있는 개발자 PC
영역이었다면 지금은 Apple도 공식적으로:
“Local LLM / AI coding agent / AI researcher workstation”
을 Mac 판매 포인트로 사용하고 있습니다. apple.com
512GB unified memory의 장점은 GPU VRAM을 넘어서는 거대한 모델을 메모리에 올릴 수 있다는 것입니다. 반면 discrete GPU 서버보다 inference throughput이 반드시 빠른 것은 아니고 가격 역시 상당하기 때문에 로컬 실행의 주된 가치는 비용보다는 데이터 통제·대형 메모리·개발 편의성에서 나올 가능성이 큽니다.
실무 시사점
로컬 AI 장비를 검토할 때는 단순 모델 크기보다:
모델 메모리 요구량 / memory bandwidth / prefill speed / decode speed / 하루 사용량 / cloud API 비용
을 같이 비교하는 게 좋습니다.
민감한 코드나 문서를 다루는 Agent는 로컬에 두고, 최고난도 추론만 클라우드 frontier model에 넘기는 Hybrid Agent Architecture가 점점 현실적인 선택지가 되고 있습니다.