Inkling 975B MoE 오픈웨이트 아키텍처 해부

Inkling 해부: 975B MoE 오픈웨이트가 노리는 '기업 커스터마이징'

오픈웨이트 모델 출시 발표문에서 개발사가 “이건 현존 최강 모델이 아닙니다"라고 먼저 말하는 건 흔한 순서가 아닙니다. Thinking Machines Lab이 2026년 7월 15일 공개한 Inkling의 발표문은 그렇게 시작합니다. 오픈이든 클로즈드든 최고 성능 모델은 아니고, 대신 커스터마이징하기 좋은 오픈웨이트 베이스를 목표로 했다는 자기규정입니다. 이 포지셔닝이 진심인지 마케팅 수사인지는 벤치마크 표만 봐도 알기 어렵습니다. 그래서 아키텍처를 봅니다. 975B 파라미터 중 token당 41B만 활성화하는 Mixture-of-Experts, 66개 decoder layer 중 55개를 512-token 창으로 제한한 attention, RoPE를 걷어내고 학습된 상대위치 bias를 넣은 선택. 리더보드 점수를 몇 %p 끌어올리는 종류의 튜닝과는 결이 다른 결정들이고, 긴 컨텍스트 처리 비용을 구조로 낮추는 쪽을 향합니다. ...

2026년 7월 25일 · 8 분 · Jesam Kim

오픈소스 VLM 파인튜닝 실전 - LoRA/QLoRA로 나만의 도메인 특화 비전 모델 만들기

1. 왜 VLM 파인튜닝인가 Vision Language Model(VLM)은 이미지를 보고 텍스트로 대답하는 멀티모달 AI입니다. GPT-4o, Claude Sonnet 4.6 Vision, Gemini Pro Vision 같은 범용 모델들이 일반적인 질문에는 잘 답하지만, 특정 도메인에서는 한계가 있습니다. 범용 VLM의 한계 건설 현장 안전 관리 시스템을 설계한다고 가정해봅시다. 범용 VLM에게 현장 사진을 보여주고 “안전모를 착용하지 않은 작업자가 있나요?“라고 물으면 일반적인 안전모는 감지하지만, 해당 건설사의 특정 안전 규정(색상별 직급 구분, 반사띠 부착 여부, 턱끈 체결 상태)까지는 판단하지 못합니다. ...

2026년 3월 12일 · 10 분 · Jesam Kim

파인튜닝의 딜레마: Catastrophic Forgetting에서 Nova Forge까지

📌 이 글에서 다루는 Nova Forge SFT 실험의 전체 코드와 데이터셋은 GitHub 레포에서 확인할 수 있습니다. 1. 왜 Fine-tuning인가: RAG vs Fine-tuning 판단 기준 대규모 언어 모델을 특정 도메인이나 태스크에 맞추려 할 때, 두 가지 주요 접근법이 있습니다. Retrieval-Augmented Generation(RAG)과 Fine-tuning입니다. RAG가 적합한 경우 최신 정보나 사실 지식이 필요한 경우 (예: 제품 카탈로그, 법률 문서) 지식이 자주 변경되는 경우 출처 추적이 중요한 경우 (환각 방지) 프롬프트만으로 해결 가능한 경우 Fine-tuning이 적합한 경우 일관된 스타일이나 포맷을 학습해야 하는 경우 (예: 브랜드 톤, 응답 구조) 복잡한 추론 패턴을 학습해야 하는 경우 새로운 행동 양식을 학습해야 하는 경우 (예: 코드 생성 스타일) 레이턴시가 중요한 경우 (RAG의 검색 오버헤드 제거) 간단히 말하면, 무엇을 아는가(knowledge)의 문제라면 RAG를, 어떻게 행동하는가(behavior)의 문제라면 Fine-tuning을 선택하는 것이 일반적입니다. ...

2026년 3월 11일 · 21 분 · Jesam Kim
Some illustrations are generated using Amazon Bedrock image generation models (Nova 2 Omni, SD3.5 Large, Nova Canvas).