핵심 내용
Apple은 9월 22일부터 M6 기반 Mac mini와 M5 Max·M5 Ultra 기반 Mac Studio 판매를 시작했다. Mac mini M6는 미국 기준 899달러부터, Mac Studio M5 Ultra는 5,499달러부터 시작하며, 512GB unified memory 옵션의 Mac Studio는 10월 말부터 공급될 예정이다. Apple은 M6 Mac mini가 이전 M4 세대 대비 AI 성능이 최대 4배, M5 Ultra Mac Studio는 이전 세대 대비 최대 4.3배 향상됐다고 주장한다. 이 수치는 Apple 자체 테스트 기준이다.
이번 출시에서 더 중요한 점은 Apple이 기업 고객에게 클라우드 토큰을 계속 사는 대신 AI 머신을 책상 위에 소유하라는 경제성을 직접 내세우기 시작했다는 것이다. Reuters 취재에 따르면 Apple은 네 대의 Mac Studio를 Thunderbolt 기반 RDMA로 연결해 약 1조 파라미터 규모 모델을 구동하고 그래픽 코드 오류를 찾아 수정하는 데모를 보였다. 회사는 이 구성이 한 개의 일반 벽면 전원에서 작동한다고 설명했다.
Mac의 unified memory 구조는 CPU·GPU가 대용량 메모리를 공유하기 때문에 quantized LLM, 코드 에이전트, 로컬 RAG 같은 workload에서 전통적 PC보다 큰 모델을 한 시스템에 올리기 쉽다는 장점이 있다. 다만 Reuters가 인용한 IDC 기준 Apple의 기업용 PC 시장 점유율은 약 4.6%로 Windows의 91.3%와 큰 차이가 있어, 기업 표준 플랫폼을 바꾸는 것은 별개의 문제다.
배경
AI 비용이 커지면서 Microsoft는 on-device AI를 unmetered intelligence라는 표현으로 밀고 있고 Nvidia도 개인·기업용 AI workstation 시장을 확대하고 있다. Apple 역시 그동안 크리에이터용으로 포지셔닝했던 Mac Studio를 코딩 Agent와 대형 로컬 모델 실행용 장비로 넓히고 있다. 클라우드 API와 로컬 inference 사이의 선택이 개인정보 문제뿐 아니라 반복 workload의 자본비용 문제로 바뀌는 흐름이다.
산업·시장에 미치는 영향
고정적으로 반복되는 inference workload는 일정 utilization 이상이면 API보다 로컬 하드웨어가 경제적일 수 있다. 특히 소스코드·내부문서·민감데이터를 외부 모델에 보내기 어려운 기업에서 로컬 workstation과 사내 inference cluster의 수요가 늘 수 있다. 반대로 최고급 reasoning 모델이나 대규모 동시접속이 필요한 서비스에서는 여전히 cloud가 유리하므로 hybrid routing이 일반적인 구조가 될 가능성이 높다.
실무에서 바로 활용할 수 있는 시사점
로컬 AI를 검토할 때 기기 가격만 보지 말고 3년 감가상각 + 전력 + 관리시간 + 실제 utilization을 계산한 뒤 같은 workload의 API 비용과 비교하는 것이 좋다. 512GB unified memory는 큰 모델을 올리는 데 유리하지만 실제 token/s, quantization 품질, 여러 Agent 동시 실행 시 memory bandwidth를 POC로 확인해야 한다. 코드·문서처럼 민감한 작업은 local-first, 최신 지식이나 최고 성능 reasoning만 cloud로 보내는 구조가 현실적인 선택이 될 수 있다.
출처: Apple — The new Mac mini and Mac Studio are available today, Reuters — With new Macs, Apple aims to take on Microsoft, Nvidia in a rush to lower AI costs