Skip to content
AI DATA 2 sources · 4 min · cluster 2 · updated 22:10 UTC

16개 GB10 클러스터에서 Kimi K3(2.8T) 가속: 코딩 30 t/s, 동시 처리 최대 136 t/s

당일 커뮤니티 보고는 16개 GPU Kimi 클러스터, 7,000 TPS를 내는 가상의 1,000달러 Qwen3.8 칩, 단일 3090 3주 가동 보고, 메모리 대역폭 오버클럭을 아울렀다.

TL;DR

  1. 16개 GB10 GPU 클러스터에서 2.8T 파라미터의 Kimi K3를 구동해 코딩 처리량 30 tokens/s, 최대 동시 처리량 136 tokens/s를 기록했다는 보고가 나왔다.
  2. 별도 스레드에서는 7,000 TPS 성능의 1,000달러 Qwen3.8-27B 전용 칩 논의가 제기됐고, 단일 RTX 3090에서 Qwen 3.8 27B를 3주간 가동한 사례도 보고됐다.
  3. 중국 CXMT는 신규 메모리 칩 플랫폼 양산 돌입을 밝혔으며 한 개인 사용자는 오버클럭된 CMP 170hx에서 1.89 TB/s 메모리 대역폭을 보고했다.

장시간 구동 및 대형 모델 서빙이 오늘의 로컬 추론 보고를 주도했다. 16개 GB10 GPU 클러스터에서 2.8T 파라미터 모델인 Kimi K3를 구동해 코딩 처리량 30 tokens/s, 동시 처리 최대 136 tokens/s를 기록했다는 소식과 함께, 단일 RTX 3090에서 Qwen 3.8 27B를 3주 동안 연속 사용한 보고가 올라왔다. [1] [3]

하드웨어 전망과 도구 개발도 함께 진행됐다. 한 스레드는 7,000 TPS로 동작 가능한 1,000달러 수준의 Qwen3.8-27B Taalas 칩 구매 의향을 물었고, 다른 스레드는 Flash-Next 모델용으로 ExllamaV3를 추천했다. Hacker News 게시물에서는 LocalAI, exo, GPUStack, vLLM 등 자체 호스팅 추론 오케스트레이터를 비교했다. [2] [4] [8]

소비자용 그래픽카드 벤치마크도 수치로 제시됐다. 한 사용자는 RTX 3060 12GB 환경에서 9개 LLM에 동일한 웹 개발 프롬프트를 약 8시간 동안 테스트했고, 단일 RTX 3090에서 8개 시각 언어모델을 테스트한 결과가 Hacker News에 공유됐다. [5] [6]

기저의 물리적 제약은 여전히 메모리였다. 오버클럭된 CMP 170hx에서 1.89 TB/s 메모리 대역폭을 달성했다는 스레드가 올라왔고, 중국 CXMT가 새 메모리 칩 플랫폼 양산에 들어갔다는 소식도 전해졌다. 두 항목 모두 단일 출처이거나 헤드라인 수준이며 통제된 방법론을 갖추지 못했다. [7] [9]

Why it matters

단일 머신 보고서는 오픈 모델 구동에 실제로 필요한 사양을 가장 빠르게 파악할 수 있는 공개 자료다. 대형 모델 환경의 실용성은 헤드라인 디코드 속도가 아니라 프리필과 메모리 대역폭에 의해 좌우되며 공급 열쇠는 메모리 제조사가 쥐고 있다.

Editor's note

모든 수치는 통일된 방법론 없이 개인 머신에서 보고된 커뮤니티 데이터이며 CXMT 항목은 헤드라인 수준이다. 보고된 수치는 원문 주장 그대로 전달한다.

Type to search

↑↓ navigate ↵ open esc close