Opus 5와 Fable 5의 벤치마크 점수와 실무 태스크 비교

Opus 5와 Fable 5 — 코딩 벤치마크와 실무 태스크의 간극

새 모델이 나오면 가장 먼저 보게 되는 건 벤치마크 표입니다. 그런데 표에서 이긴 모델을 실제 작업에 붙여 보면 기대와 다른 결과가 나오는 경우가 있습니다. 2026년 7월에 출시된 Claude Opus 5가 최근 그 간극을 다시 확인하게 한 예시입니다. Amazon Bedrock과 Claude Platform on AWS에서 이용 가능한 Opus 5는 API model id claude-opus-5, 컨텍스트 1M tokens, 최대 출력 128K tokens, knowledge cutoff는 2026년 5월입니다. adaptive thinking이 기본으로 켜져 있고, thinking을 끄면 effort가 high로 캡됩니다. ...

2026년 7월 27일 · 4 분 · Jesam Kim
Stanford AI Index 2026

Stanford AI Index 2026 심층 해부: 숫자로 읽는 2026년 AI 지형

Stanford HAI가 2017년부터 매년 발간하는 AI Index Report는 AI 분야의 현황을 수치로 고정시키는 몇 안 되는 기준점입니다. 기술 성능, 투자 흐름, 연구 출판, 일자리 변화, 대중 인식을 한 곳에서 다루는 보고서는 거의 없습니다. 올해로 아홉 번째를 맞은 2026년판은 4월 13일 공개되었습니다. 2026년 리포트는 성능 지표와 사회적 지표가 반대 방향으로 움직이는 한 해를 기록합니다. 2026년 리포트가 던지는 핵심 메시지는 세 방향으로 정리됩니다. 첫째, 성능의 폭발입니다. 지난 1년 사이 AI 에이전트가 소프트웨어 엔지니어링, 사이버보안, 수학 올림피아드 문제를 다루는 성공률이 10퍼센트대에서 90퍼센트대로 뛰었습니다. 벤치마크가 포화되는 속도가 너무 빠르다 보니 측정 도구 자체가 따라가지 못하는 상황이 되었습니다. 둘째, 미중 격차 소멸입니다. 2025년 2월 DeepSeek-R1이 미국 최상위 모델과 일시적으로 동률을 이뤘고, 2026년 3월 기준 Anthropic의 최상위 모델이 앞서는 폭은 단 2.7%입니다. 셋째, 투명성과 신뢰의 붕괴입니다. Foundation Model Transparency Index 평균 점수가 58점에서 40점으로 떨어졌고, 미국에서 AI 규제를 신뢰한다는 응답은 31%로 조사 대상국 중 최하를 기록했습니다. ...

2026년 4월 18일 · 9 분 · Jesam Kim
Some illustrations are generated using Amazon Bedrock image generation models (Nova 2 Omni, SD3.5 Large, Nova Canvas).