Skip to content
AI DEEP 3 sources · 4 min · cluster 3 · updated 22:03 UTC

GLM 5.3, Mistral에서 호스팅

중국과 러시아의 AI 연구소들이 유능한 오픈 가중치 모델을 출시하는 가운데 DeepSeek은 더 거대한 학습 세션을 예고했다.

TL;DR

  1. Hacker News에는 GLM 5.3이 Mistral에 의해 호스팅되고 있다는 소식이 올라왔다.
  2. r/LocalLLaMA 스레드는 Hugging Face에 공개된 Xiaomi의 MiMo-V2.6-Flash-RL을 조명하고, DeepSeek이 2T 모델을 학습 중이며 8T 모델을 계획 중이라고 전했으며, Yandex의 AliceAI-Foundation-80B를 Qwen 35B 및 DeepSeek V4 Flash의 경쟁자로 지목했다.
  3. Two Minute Papers는 DeepSeek의 신규 아키텍처를 다뤘고, 한 스레드는 8GB VRAM 노트북에서 배치 1 데이터 스트림으로 처음부터 학습된 530M 파라미터 모델 mini-AGI를 소개했다.

Hacker News에는 GLM 5.3이 Mistral에서 호스팅되고 있다는 내용의 글이 올라왔다. [1]

중국과 러시아 연구소들의 오픈 가중치 출시는 계속됐다. r/LocalLLaMA 스레드는 Hugging Face에 올라온 Xiaomi의 MiMo-V2.6-Flash-RL을 가리켰고, 다른 스레드는 DeepSeek이 2T 모델을 학습 중이며 8T 모델을 계획하고 있다고 전했다. 세 번째 스레드는 Qwen 35B와 DeepSeek V4 Flash에 맞서는 러시아 개발 모델로 Yandex의 AliceAI-Foundation-80B-A3B-Base를 강조했다. [2] [3] [4]

영상 매체에서도 효율성이 핵심 주제였다. Two Minute Papers는 DeepSeek의 신규 아키텍처를 소개했고, 별도 스레드는 8GB VRAM 노트북 환경에서 배치 1 스트림으로 처음부터 학습된 530M 파라미터의 동적 성장형 연속학습 모델 mini-AGI를 다뤘다. [5] [6]

Why it matters

오픈 가중치 프론티어는 이제 소비자용 하드웨어에서 실행 가능한 유능한 모델을 내놓는 중국 및 러시아 연구소들에 의해 확장되고 있다. 이는 폐쇄형 연구소와의 격차를 좁히고 기술적 해자를 유통, 도구 생태계, 신뢰성 쪽으로 이동시킨다.

Editor's note

모델 성능 주장은 커뮤니티 게시물과 프로젝트 페이지에 기반하며 독립적인 벤치마크를 거치지 않았다. DeepSeek의 학습 규모 주장은 커뮤니티 스레드에 보고된 내용이다.

Type to search

↑↓ navigate ↵ open esc close