해안 시험장에서 여러 광학 장비로 연구용 글라이더를 관측하는 장면

Amazon Bedrock의 GPT-6 Astra: 정렬 평가와 감시 가능성

Amazon Bedrock에서 GPT-6 Astra를 사용해 문서를 수정하거나 여러 도구를 실행하는 에이전트를 만든다고 생각해 보겠습니다. 모델이 지시를 잘 따르는지 확인하는 일과, 잘못된 행동이 발생했을 때 알아낼 수 있는지 확인하는 일은 서로 다릅니다. 허용한 파일만 수정하는 모델을 고르는 것과 실제 수정 대상을 기록하고 검사하는 작업을 함께 해야 합니다. GPT-6 Astra는 2026년 9월 8일 Amazon Bedrock에서 정식 출시됐습니다. 앞서 공개된 OpenAI 안전성 평가는 정렬 평가 결과가 개선됐다고 보고하는 동시에, CoT 기반 감시 가능성이 상당히 낮아졌다고 밝혔습니다. Bedrock에서 이 모델을 운영할 때는 모델 평가 결과, 서비스의 보호 조치, 애플리케이션이 남기는 기록을 구분해서 읽을 필요가 있습니다. ...

2026년 9월 14일 · 7 분 · Jesam Kim
빛나는 경계선 앞에 멈춘 로봇팔이 놓인 실험실

AI 에이전트가 실제 기계를 움직이기 시작했다: Model Hardware Standard와 물리적 권한 설계

소프트웨어 에이전트의 tool call이 실패했을 때 우리가 실제로 하는 일은 재시도입니다. API가 500을 반환하면 다시 호출하고, 파일 쓰기가 깨지면 이전 커밋으로 되돌리고, 잘못된 레코드가 들어가면 트랜잭션을 롤백합니다. 이 습관은 대상이 비트라는 사실에 기대고 있습니다. 비트는 복제할 수 있고, 이전 상태를 보관할 수 있고, 같은 명령을 두 번 실행해도 대체로 같은 결과에 도달합니다. 로봇팔을 5cm 움직이는 명령은 이 전제 중 어느 것도 만족하지 않습니다. 명령이 절반만 실행된 상태에서 재시도하면 팔은 10cm를 움직입니다. 시약 40µL를 분주한 뒤에는 되돌릴 이전 상태가 없고, 시료 자체가 소모됩니다. 레이저 출력을 잘못 올리면 형광 분자가 표백되어 그날의 실험이 끝납니다. 소프트웨어 에이전트 설계에서 익숙해진 “일단 시도하고 실패하면 되돌린다"는 패턴이, 물리 장치에서는 그 자체로 사고의 경로가 됩니다. ...

2026년 8월 29일 · 10 분 · Jesam Kim
에이전트의 여러 실행 궤적이 정책 검증 지점으로 모이는 장면

에이전트 보안은 한 번의 Tool Call로 끝나지 않는다: Per-Action Check에서 Trajectory Assurance로

2026-09-11 정정: A2A와 MCP의 필수 보안 요구사항을 반영하고, 기존 검증 연구와 이력 기반 통제의 적용 범위를 명확히 했습니다. 사내 문서를 검색하고 요약해서 메일로 보내는 에이전트를 하나 상상해 보겠습니다. 이 에이전트에는 세 가지 도구가 붙어 있습니다. 문서 검색, 문서 본문 읽기, 메일 발송입니다. 세 도구는 각각 정당한 권한을 받았고, 호출 한 건씩 떼어 놓고 보면 어느 것도 규칙을 어기지 않습니다. 검색은 읽기 전용이고, 본문 읽기도 사용자가 접근 권한을 가진 문서만 반환하며, 메일 발송은 사용자가 명시적으로 요청한 기능입니다. ...

2026년 8월 23일 · 15 분 · Jesam Kim
에이전트 메모리를 노리는 memory poisoning 공격과 방어 설계

악성 데이터 한 줄이 AI 에이전트의 기억에 영구히 남는다: Memory Poisoning 방어 설계

지난 몇 년간 LLM 애플리케이션의 보안 논의는 대체로 prompt injection에 집중되어 있었습니다. 신뢰되지 않은 텍스트가 모델의 지시 사항인 척 끼어드는 문제입니다. 그런데 이 논의의 전제 하나가 조용히 바뀌었습니다. 초기의 LLM 호출은 요청 하나가 끝나면 그 세션의 상태도 함께 사라지는 stateless 구조였지만, 지금의 에이전트는 대화·경험·선호를 세션 경계 너머로 저장하는 지속 메모리를 기본으로 갖추고 있습니다. 그런데 지속 메모리는 편의만 가져온 게 아닙니다. 새로운 attack surface도 함께 열렸습니다. Prompt injection의 payload는 응답이 끝나면 컨텍스트와 함께 사라집니다. 하지만 그 payload가 메모리 쓰기 한 번을 성공시키면, 원본 텍스트가 사라진 뒤에도 저장된 항목은 남습니다. 이 글에서는 이것을 “payload는 휘발되지만 쓰기 결과는 잔존한다"는 성질로 부르겠습니다. memory poisoning을 prompt injection과 따로 다뤄야 하는 것도 이 때문입니다. ...

2026년 8월 16일 · 11 분 · Jesam Kim
Hybrid Thinking은 왜 갈라섰나 — Reasoning에서 Agentic Thinking으로

Hybrid Thinking은 왜 갈라섰나 — Reasoning에서 Agentic Thinking으로

2026년 상반기 AI reasoning 담론에는 한 가지 방향 전환이 있었습니다. o1과 DeepSeek-R1이 연 “긴 사고 사슬(long chain-of-thought)“의 시대에서, 사고 자체를 행동의 도구로 재정의하는 흐름으로의 이동입니다. 이 전환을 비교적 명료하게 정리한 사람이 Alibaba Qwen 프로젝트의 前 테크리드 Junyang Lin입니다. 그는 2026년 3월 3일 Qwen 테크리드에서 사임했고, 현재는 독립연구자로서 “training models에서 training agents로"라는 명제를 이야기하고 있습니다. Lin의 자리 이동 자체가 담론의 방향을 보여주는 신호이기도 합니다. 프론티어 모델 하나를 여러 해 이끌던 사람이 조직을 떠나 에이전트 학습을 이야기한다는 것은, 모델 가중치를 키우는 경쟁의 한 사이클이 일단락됐다는 인식과 무관하지 않습니다. 당시 보도도 이 사임을 큰 AI 드라이브가 지나간 뒤의 매듭으로 읽었습니다. ...

2026년 7월 12일 · 8 분 · Jesam Kim
Some illustrations are generated using Amazon Bedrock image generation models (Nova 2 Omni, SD3.5 Large, Nova Canvas).