중국발 오픈웨이트 모델 릴리스 러시와 오픈 대 클로즈드 경쟁 구도

중국발 오픈웨이트 러시: Kimi K3 이후 7주간의 지형 변화

2주 전 이 블로그에서 Thinking Machines Lab의 Inkling을 다뤘습니다. 975B MoE 오픈웨이트 한 건을 아키텍처 관점에서 뜯어보는 글이었습니다. 그 글을 쓰던 시점에는 개별 출시로 보였던 사건이, 지금 돌아보면 훨씬 빠른 흐름의 한 지점이었습니다. 6월 중순부터 8월 초까지 7주 동안 대형 모델이 연달아 나왔습니다. Z.ai의 GLM-5.2, Moonshot AI의 Kimi K3, DeepSeek의 V4-Flash-0731, Alibaba의 Qwen3.8-Max. 네 건 모두 중국 기업입니다. 앞의 세 건은 가중치를 지금 내려받을 수 있고, Qwen3.8-Max는 공개를 예고한 상태입니다. Kimi K3는 2.8조 파라미터로 세계 최대 오픈웨이트 모델 자리를 가져갔습니다. ...

2026년 8월 8일 · 10 분 · Jesam Kim
Inkling 975B MoE 오픈웨이트 아키텍처 해부

Inkling 해부: 975B MoE 오픈웨이트가 노리는 '기업 커스터마이징'

오픈웨이트 모델 출시 발표문에서 개발사가 “이건 현존 최강 모델이 아닙니다"라고 먼저 말하는 건 흔한 순서가 아닙니다. Thinking Machines Lab이 2026년 7월 15일 공개한 Inkling의 발표문은 그렇게 시작합니다. 오픈이든 클로즈드든 최고 성능 모델은 아니고, 대신 커스터마이징하기 좋은 오픈웨이트 베이스를 목표로 했다는 자기규정입니다. 이 포지셔닝이 진심인지 마케팅 수사인지는 벤치마크 표만 봐도 알기 어렵습니다. 그래서 아키텍처를 봅니다. 975B 파라미터 중 token당 41B만 활성화하는 Mixture-of-Experts, 66개 decoder layer 중 55개를 512-token 창으로 제한한 attention, RoPE를 걷어내고 학습된 상대위치 bias를 넣은 선택. 리더보드 점수를 몇 %p 끌어올리는 종류의 튜닝과는 결이 다른 결정들이고, 긴 컨텍스트 처리 비용을 구조로 낮추는 쪽을 향합니다. ...

2026년 7월 25일 · 8 분 · Jesam Kim
분산학습 Part 4 - Tensor/Hybrid Parallelism과 MoE

분산학습의 이해 Part 4 - Tensor/Hybrid Parallelism과 MoE

이전 글에서 Pipeline Parallelism(PP)이 모델을 레이어 단위로 잘라 여러 GPU에 배치하는 방식을 분석했습니다. PP 덕분에 GPU 한 장에 들어가지 않는 모델도 학습할 수 있게 되었고, bubble을 줄이는 방향으로 GPipe, 1F1B, ZBH가 진화해왔습니다. 그런데 PP의 분할 단위는 레이어입니다. 레이어 하나가 GPU 메모리를 초과하면 어떻게 할까요? 또, 하나의 병렬화 기법만으로는 수천 개 GPU를 효율적으로 활용하기 어렵습니다. 모델 용량은 키우면서 연산량은 유지하고 싶다면요? 이 글에서는 이 세 가지 질문에 대한 답을 다룹니다. Tensor Parallelism, Hybrid Parallelism, 그리고 MoE + Expert Parallelism입니다. ...

2026년 4월 15일 · 8 분 · Jesam Kim
Mistral Small 4 cover

Mistral Small 4: 119B MoE 모델이 추론, 비전, 코딩을 하나로 통합한 방법

1. 여러 모델을 운영하는 비용 프로덕션 환경에서 LLM을 운영하는 팀이라면, 한 가지 모델로 모든 작업을 처리하기 어렵다는 점을 잘 알고 있을 것입니다. 빠른 채팅 응답에는 경량 Instruct 모델을, 복잡한 수학 문제에는 추론 특화 모델을, 이미지 분석에는 멀티모달 모델을, 코드 생성에는 코딩 특화 모델을 각각 배포해야 합니다. 모델마다 별도의 엔드포인트, 라우팅 로직, GPU 할당이 필요하고, 운영 복잡도는 모델 수에 비례해 증가합니다. 2026년 3월 16일, Mistral AI가 공개한 Mistral Small 4는 이 문제에 정면으로 답합니다. 기존에 별도로 존재하던 Instruct(Small 3.2), 추론(Magistral), 비전(Pixtral), 코딩(Devstral) 네 가지 모델 계열을 하나의 MoE 모델로 통합했습니다. 119B 파라미터 규모이지만, 토큰당 실제 연산에 참여하는 파라미터는 6.5B에 불과합니다. Apache 2.0 라이선스로 상업적 사용과 파인튜닝에 제한이 없습니다. ...

2026년 3월 29일 · 5 분 · Jesam Kim
Some illustrations are generated using Amazon Bedrock image generation models (Nova 2 Omni, SD3.5 Large, Nova Canvas).