Mercury 2.5 LLM, 초당 770토큰 달성
추론 속도에 관한 주장이 AMD 하드웨어, vLLM, KV 캐시 연구를 아우르는 서빙 및 메모리 효율화 연구 클러스터를 이끌었다.
TL;DR
- Hacker News에 공유된 Artificial Analysis 페이지는 Mercury 2.5의 속도를 초당 770토큰으로 기록했다.
- Nunchux는 AMD MI355X에서 5초 분량 MiniMax-H3 비디오를 1.3초 만에 생성했다고 밝혔고 PyTorch 글은 vLLM의 하드웨어 중립적 모델을 설명했다.
- 두 편의 arXiv 논문은 KV 캐시를 목표로 삼아 글로벌 KV 공유와 계층별 로컬 히스토리 결합, 메모리 예산 대신 위험 목표 기반 축출을 제안했다.
Artificial Analysis를 인용한 Hacker News 게시물에 따르면 Mercury 2.5 LLM이 초당 770토큰을 달성했다고 보고됐다. [1]
하드웨어 이식성 또한 함께 부각된 주제였다. Nunchux는 AMD MI355X 가속기에서 5초 분량의 MiniMax-H3 비디오를 1.3초 만에 제작했다고 밝혔으며, PyTorch 공식 블로그는 vLLM의 하드웨어 비종속적 모델 구조를 설명했다. [2] [3]
연구 측면에서는 새로운 arXiv 논문들이 계층별 로컬 이력을 결합한 공유 글로벌 KV 캐시 구조와, 메모리 예산 중심에서 벗어나 위험 목표를 기준으로 하는 위험 제어형 KV 캐시 퇴출 방식을 제안했다. [4] [5]
Why it matters
경쟁의 축이 서빙 비용으로 이동하고 있다. 초당 토큰 수 향상, 신뢰할 수 있는 비Nvidia 대안, 효율적인 KV 캐시는 모두 추론 비용을 낮추고 단일 칩 공급업체에 대한 의존도를 완화한다.
Editor's note
초당 770토큰 수치는 서드파티 벤치마크 페이지의 기록으로 직접 재현되지 않았으며 AMD 결과는 벤더 블로그의 주장이다. arXiv 항목은 제목 수준에서 인용됐다.