AI Tech Blog

From AI/ML fundamentals to deep dives: paper reviews, AWS architectures, and practical guides by Jesam Kim
수학 증명, 단백질 구조, 멀티에이전트 네트워크가 하나의 검증 지점으로 모이는 장면

Anthropic 공식 블로그 3편 정리: Claude 연구 자동화의 현재와 검증 과제

지난 몇 년 동안 Claude에게 기대한 역할은 명확했습니다. 질문을 던지면 답이 돌아오고, 그 답의 품질을 사람이 판단하는 구조입니다. 2026년 8월에 Anthropic이 나흘 간격으로 공개한 세 편의 글은 이 구조가 더 이상 전체 그림을 설명하지 못한다는 것을 보여줍니다. 수학 난제에 도전한 리만 가설 연구, 단백질 결합체를 설계하고 분석 화학 데이터를 해석한 단백질 설계 실험, 그리고 45개 에이전트를 동시에 돌려 본 멀티에이전트 시스템 연구입니다. 셋 다 “답을 냈다"는 이야기가 아닙니다. 가설을 여러 개 만들고, 그 가설을 검증할 도구와 다른 에이전트를 부리고, 결과를 다시 사람이나 외부 기관에 검증받는 과정 전체를 Claude가 주도했다는 이야기입니다. ...

2026년 9월 4일 · 10 분 · Jesam Kim
빛나는 경계선 앞에 멈춘 로봇팔이 놓인 실험실

AI 에이전트가 실제 기계를 움직이기 시작했다: Model Hardware Standard와 물리적 권한 설계

소프트웨어 에이전트의 tool call이 실패했을 때 우리가 실제로 하는 일은 재시도입니다. API가 500을 반환하면 다시 호출하고, 파일 쓰기가 깨지면 이전 커밋으로 되돌리고, 잘못된 레코드가 들어가면 트랜잭션을 롤백합니다. 이 습관은 대상이 비트라는 사실에 기대고 있습니다. 비트는 복제할 수 있고, 이전 상태를 보관할 수 있고, 같은 명령을 두 번 실행해도 대체로 같은 결과에 도달합니다. 로봇팔을 5cm 움직이는 명령은 이 전제 중 어느 것도 만족하지 않습니다. 명령이 절반만 실행된 상태에서 재시도하면 팔은 10cm를 움직입니다. 시약 40µL를 분주한 뒤에는 되돌릴 이전 상태가 없고, 시료 자체가 소모됩니다. 레이저 출력을 잘못 올리면 형광 분자가 표백되어 그날의 실험이 끝납니다. 소프트웨어 에이전트 설계에서 익숙해진 “일단 시도하고 실패하면 되돌린다"는 패턴이, 물리 장치에서는 그 자체로 사고의 경로가 됩니다. ...

2026년 8월 29일 · 10 분 · Jesam Kim
에이전트의 여러 실행 궤적이 정책 검증 지점으로 모이는 장면

에이전트 보안은 한 번의 Tool Call로 끝나지 않는다: Per-Action Check에서 Trajectory Assurance로

사내 문서를 검색하고 요약해서 메일로 보내는 에이전트를 하나 상상해 보겠습니다. 이 에이전트에는 세 가지 도구가 붙어 있습니다. 문서 검색, 문서 본문 읽기, 메일 발송입니다. 세 도구는 각각 정당한 권한을 받았고, 호출 한 건씩 떼어 놓고 보면 어느 것도 규칙을 어기지 않습니다. 검색은 읽기 전용이고, 본문 읽기도 사용자가 접근 권한을 가진 문서만 반환하며, 메일 발송은 사용자가 명시적으로 요청한 기능입니다. 그런데 이 세 호출이 다음 순서로 일어나면 상황이 달라집니다. 에이전트가 인사 평가 문서를 검색하고, 그 본문을 읽어 컨텍스트에 담고, 곧바로 외부 도메인 주소로 요약 메일을 발송합니다. 호출 하나하나를 검사하는 게이트는 이 흐름을 통과시킵니다. 세 번째 호출을 심사하는 시점에 그 게이트가 보는 것은 “이 사용자가 메일을 보낼 권한이 있는가"뿐이고, 두 번째 호출에서 민감 문서가 컨텍스트로 들어왔다는 사실은 심사 대상에 들어 있지 않기 때문입니다. ...

2026년 8월 23일 · 14 분 · Jesam Kim
에이전트 스킬과 MCP를 한 디렉토리로 묶는 Agent Plugins 패키징 표준

Agent Plugins 1.0: 에이전트 스킬과 MCP를 한 디렉토리로 묶는 패키징 표준

에이전트에 기능을 붙이는 두 조각은 이미 표준이 있습니다. 모델에게 절차적 지식을 주는 Agent Skills와 외부 도구·데이터에 연결하는 MCP입니다. 두 규약 모두 여러 클라이언트가 이미 지원합니다. 그런데 이 조각들을 실제로 배포하려고 하면 예상치 못한 곳에서 마찰이 생깁니다. 컴포넌트 자체는 멀쩡한데 그것을 담는 상자가 클라이언트마다 다르기 때문입니다. 2026년 8월 6일에 발표된 Agent Plugins 1.0.0이 이 상자를 표준화합니다. 오픈이고 벤더에 중립적인 패키징 표준이며, 기술 운영 위원회의 코어 메인테이너는 Amazon, Cursor, Microsoft, OpenAI, Vercel입니다. 발표 이후 Google이 코어 메인테이너로 합류했고, DeepMind의 Kevin Hou가 대표를 맡았습니다. 이 글에서는 표준이 무엇을 정의하고 무엇을 일부러 정의하지 않았는지를 코드 예시와 함께 살펴봅니다. ...

2026년 8월 20일 · 10 분 · Jesam Kim
에이전트 메모리를 노리는 memory poisoning 공격과 방어 설계

악성 데이터 한 줄이 AI 에이전트의 기억에 영구히 남는다: Memory Poisoning 방어 설계

지난 몇 년간 LLM 애플리케이션의 보안 논의는 대체로 prompt injection에 집중되어 있었습니다. 신뢰되지 않은 텍스트가 모델의 지시 사항인 척 끼어드는 문제입니다. 그런데 이 논의의 전제 하나가 조용히 바뀌었습니다. 초기의 LLM 호출은 요청 하나가 끝나면 그 세션의 상태도 함께 사라지는 stateless 구조였지만, 지금의 에이전트는 대화·경험·선호를 세션 경계 너머로 저장하는 지속 메모리를 기본으로 갖추고 있습니다. 그런데 지속 메모리는 편의만 가져온 게 아닙니다. 새로운 attack surface도 함께 열렸습니다. Prompt injection의 payload는 응답이 끝나면 컨텍스트와 함께 사라집니다. 하지만 그 payload가 메모리 쓰기 한 번을 성공시키면, 원본 텍스트가 사라진 뒤에도 저장된 항목은 남습니다. 이 글에서는 이것을 “payload는 휘발되지만 쓰기 결과는 잔존한다"는 성질로 부르겠습니다. memory poisoning을 prompt injection과 따로 다뤄야 하는 것도 이 때문입니다. ...

2026년 8월 16일 · 11 분 · Jesam Kim
중국발 오픈웨이트 모델 릴리스 러시와 오픈 대 클로즈드 경쟁 구도

중국발 오픈웨이트 러시: Kimi K3 이후 7주간의 지형 변화

2주 전 이 블로그에서 Thinking Machines Lab의 Inkling을 다뤘습니다. 975B MoE 오픈웨이트 한 건을 아키텍처 관점에서 뜯어보는 글이었습니다. 그 글을 쓰던 시점에는 개별 출시로 보였던 사건이, 지금 돌아보면 훨씬 빠른 흐름의 한 지점이었습니다. 6월 중순부터 8월 초까지 7주 동안 대형 모델이 연달아 나왔습니다. Z.ai의 GLM-5.2, Moonshot AI의 Kimi K3, DeepSeek의 V4-Flash-0731, Alibaba의 Qwen3.8-Max. 네 건 모두 중국 기업입니다. 앞의 세 건은 가중치를 지금 내려받을 수 있고, Qwen3.8-Max는 공개를 예고한 상태입니다. Kimi K3는 2.8조 파라미터로 세계 최대 오픈웨이트 모델 자리를 가져갔습니다. ...

2026년 8월 8일 · 10 분 · Jesam Kim
MCP 2026-07-28 스펙의 stateless 전환과 분산 서버 인프라

MCP가 Stateless로 간다 — 2026-07-28 스펙 변경이 에이전트 인프라에 의미하는 것

MCP 서버를 로컬에서 하나 띄워 쓸 때는 아무 문제가 없습니다. Claude Desktop이 stdio로 프로세스를 하나 붙이고, 그 프로세스가 살아 있는 동안 세션이 유지됩니다. 프로토콜이 처음 설계될 때 상정한 그림이 정확히 이것이었습니다. 단일 앱, 단일 로컬 서버, 하나의 연결. 같은 서버를 사내 100명이 쓰도록 원격 배포하는 순간 이야기가 달라집니다. 로드밸런서 뒤에 인스턴스를 세 개 띄우면 클라이언트가 처음 handshake한 인스턴스에만 세션이 존재합니다. 두 번째 요청이 다른 인스턴스로 가면 그 인스턴스는 세션을 모릅니다. 그래서 sticky routing을 켜거나, 인스턴스들이 공유하는 세션 스토어를 앞에 두거나, 둘 다 하게 됩니다. ...

2026년 8월 1일 · 14 분 · Jesam Kim
Opus 5와 Fable 5의 벤치마크 점수와 실무 태스크 비교

Opus 5와 Fable 5 — 코딩 벤치마크와 실무 태스크의 간극

새 모델이 나오면 가장 먼저 보게 되는 건 벤치마크 표입니다. 그런데 표에서 이긴 모델을 실제 작업에 붙여 보면 기대와 다른 결과가 나오는 경우가 있습니다. 2026년 7월에 출시된 Claude Opus 5가 최근 그 간극을 다시 확인하게 한 예시입니다. Amazon Bedrock과 Claude Platform on AWS에서 이용 가능한 Opus 5는 API model id claude-opus-5, 컨텍스트 1M tokens, 최대 출력 128K tokens, knowledge cutoff는 2026년 5월입니다. adaptive thinking이 기본으로 켜져 있고, thinking을 끄면 effort가 high로 캡됩니다. ...

2026년 7월 27일 · 4 분 · Jesam Kim
Inkling 975B MoE 오픈웨이트 아키텍처 해부

Inkling 해부: 975B MoE 오픈웨이트가 노리는 '기업 커스터마이징'

오픈웨이트 모델 출시 발표문에서 개발사가 “이건 현존 최강 모델이 아닙니다"라고 먼저 말하는 건 흔한 순서가 아닙니다. Thinking Machines Lab이 2026년 7월 15일 공개한 Inkling의 발표문은 그렇게 시작합니다. 오픈이든 클로즈드든 최고 성능 모델은 아니고, 대신 커스터마이징하기 좋은 오픈웨이트 베이스를 목표로 했다는 자기규정입니다. 이 포지셔닝이 진심인지 마케팅 수사인지는 벤치마크 표만 봐도 알기 어렵습니다. 그래서 아키텍처를 봅니다. 975B 파라미터 중 token당 41B만 활성화하는 Mixture-of-Experts, 66개 decoder layer 중 55개를 512-token 창으로 제한한 attention, RoPE를 걷어내고 학습된 상대위치 bias를 넣은 선택. 리더보드 점수를 몇 %p 끌어올리는 종류의 튜닝과는 결이 다른 결정들이고, 긴 컨텍스트 처리 비용을 구조로 낮추는 쪽을 향합니다. ...

2026년 7월 25일 · 8 분 · Jesam Kim
Hybrid Thinking은 왜 갈라섰나 — Reasoning에서 Agentic Thinking으로

Hybrid Thinking은 왜 갈라섰나 — Reasoning에서 Agentic Thinking으로

2026년 상반기 AI reasoning 담론에는 한 가지 방향 전환이 있었습니다. o1과 DeepSeek-R1이 연 “긴 사고 사슬(long chain-of-thought)“의 시대에서, 사고 자체를 행동의 도구로 재정의하는 흐름으로의 이동입니다. 이 전환을 비교적 명료하게 정리한 사람이 Alibaba Qwen 프로젝트의 前 테크리드 Junyang Lin입니다. 그는 2026년 3월 3일 Qwen 테크리드에서 사임했고, 현재는 독립연구자로서 “training models에서 training agents로"라는 명제를 이야기하고 있습니다. Lin의 자리 이동 자체가 담론의 방향을 보여주는 신호이기도 합니다. 프론티어 모델 하나를 여러 해 이끌던 사람이 조직을 떠나 에이전트 학습을 이야기한다는 것은, 모델 가중치를 키우는 경쟁의 한 사이클이 일단락됐다는 인식과 무관하지 않습니다. 당시 보도도 이 사임을 큰 AI 드라이브가 지나간 뒤의 매듭으로 읽었습니다. ...

2026년 7월 12일 · 8 분 · Jesam Kim
Some illustrations are generated using Amazon Bedrock image generation models (Nova 2 Omni, SD3.5 Large, Nova Canvas).