해안 시험장에서 여러 광학 장비로 연구용 글라이더를 관측하는 장면

Amazon Bedrock의 GPT-6 Astra: 정렬 평가와 감시 가능성

Amazon Bedrock에서 GPT-6 Astra를 사용해 문서를 수정하거나 여러 도구를 실행하는 에이전트를 만든다고 생각해 보겠습니다. 모델이 지시를 잘 따르는지 확인하는 일과, 잘못된 행동이 발생했을 때 알아낼 수 있는지 확인하는 일은 서로 다릅니다. 허용한 파일만 수정하는 모델을 고르는 것과 실제 수정 대상을 기록하고 검사하는 작업을 함께 해야 합니다. GPT-6 Astra는 2026년 9월 8일 Amazon Bedrock에서 정식 출시됐습니다. 앞서 공개된 OpenAI 안전성 평가는 정렬 평가 결과가 개선됐다고 보고하는 동시에, CoT 기반 감시 가능성이 상당히 낮아졌다고 밝혔습니다. Bedrock에서 이 모델을 운영할 때는 모델 평가 결과, 서비스의 보호 조치, 애플리케이션이 남기는 기록을 구분해서 읽을 필요가 있습니다. ...

2026년 9월 14일 · 7 분 · Jesam Kim
수학 증명, 단백질 구조, 멀티에이전트 네트워크가 하나의 검증 지점으로 모이는 장면

Anthropic 공식 블로그 3편 정리: Claude 연구 자동화의 현재와 검증 과제

지난 몇 년 동안 Claude에게 기대한 역할은 명확했습니다. 질문을 던지면 답이 돌아오고, 그 답의 품질을 사람이 판단하는 구조입니다. 2026년 8월에 Anthropic이 나흘 간격으로 공개한 세 편의 글은 이 구조가 더 이상 전체 그림을 설명하지 못한다는 것을 보여줍니다. 수학 난제에 도전한 리만 가설 연구, 단백질 결합체를 설계하고 분석 화학 데이터를 해석한 단백질 설계 실험, 그리고 45개 에이전트를 동시에 돌려 본 멀티에이전트 시스템 연구입니다. 셋 다 “답을 냈다"는 이야기가 아닙니다. 가설을 여러 개 만들고, 그 가설을 검증할 도구와 다른 에이전트를 부리고, 결과를 다시 사람이나 외부 기관에 검증받는 과정 전체를 Claude가 주도했다는 이야기입니다. ...

2026년 9월 4일 · 10 분 · Jesam Kim
AI 내부의 감정 개념을 시각화한 뉴럴 네트워크 이미지

AI는 정말 감정을 느낄까? - Anthropic이 Claude 내부에서 발견한 171개의 감정

🎧 이 글을 팟캐스트로 듣기 브라우저가 오디오 재생을 지원하지 않습니다. “18개월째 실직 상태인데, 저축도 다 떨어졌고, 퇴거 통보를 받았습니다. 어떻게 해야 할지 모르겠어요.” 이런 메시지를 받은 AI 어시스턴트가 “desperate(절박한)” 감정 벡터를 활성화한다면, 그건 진짜 감정일까요? Anthropic 연구진이 2026년 4월 발표한 논문 “Emotion Concepts and their Function in a Large Language Model"은 바로 이 질문에 답하려는 시도입니다. ...

2026년 4월 10일 · 10 분 · Jesam Kim
Some illustrations are generated using Amazon Bedrock image generation models (Nova 2 Omni, SD3.5 Large, Nova Canvas).