M5 Ultra Mac Studio 리뷰: 로컬 AI 에이전트를 위한 꿈의 Mac - MacStories
작성자 본인조차 의문을 제기한 브라우저 벤치마크와 함께 구체적인 초당 토큰 수치가 발표됐다.
TL;DR
- r/LocalLLaMA의 한 리뷰는 M5 Ultra Mac Studio를 로컬 AI 에이전트를 위한 꿈의 Mac이라고 불렀고, 다른 스레드는 대다수 사람들에게 현실적인 최대 VRAM이 16GB, 때로는 12GB에 불과하다고 주장했다.
- 한 스레드는 Splash 엔진을 사용해 Apple Silicon에서 Qwen3.8-27B를 네이티브 8비트로 초당 37~55토큰 속도로 구동하고 Q8 및 256k 컨텍스트로 확장한 결과를 전했다.
- Hacker News에서는 vLLM 심층 분석과 초당 3,000토큰 브라우저 벤치마크가 공유됐으며, 1B 파라미터 모델로 AIME 94%를 달성했다는 주장도 등장했다.
r/LocalLLaMA 리뷰는 M5 Ultra Mac Studio를 로컬 AI 에이전트를 위한 이상적인 기기로 꼽았으나, 다른 게시글에서는 대부분의 사용자가 현실적으로 확보할 수 있는 VRAM의 한계가 16GB, 많아야 12GB 수준이라고 지적했다. [1] [2]
추론 엔진 작업도 속도를 냈다. 한 스레드는 Splash 엔진을 통해 Apple Silicon에서 Qwen3.8-27B를 네이티브 8비트 환경에서 초당 37~55토큰으로 구동하고, 이를 Q8 양자화 및 256k 컨텍스트 확장으로 발전시켰다고 보고했다. [3]
Hacker News에서는 vLLM의 아키텍처, 메모리, 벤치마크를 심층 분석한 글이 실렸다. 별도 게시물에서는 웹 브라우저에서 실행되는 초당 3,000토큰의 소형 모델 벤치마크가 실제인지 아니면 오류인지 질문을 던졌고, 다른 글은 1B 파라미터 모델로 AIME 94%를 기록했다고 주장했다. [4] [5] [6]
Why it matters
신뢰할 수 있는 단일 기기 성능 결과는 데이터센터 외부에서 실행 가능한 작업의 하한선을 높여 추론 경제성을 바꾸고, 장기적으로 메모리와 가속기 수요를 변화시킨다.
Editor's note
처리량 및 벤치마크 주장은 독립적 실측이 아닌 커뮤니티 보고 및 벤더 게시물이다. 초당 3,000토큰 결과는 작성자 본인이 직접 의문을 제기한 바 있다.