같은 모양의 메시지 캡슐을 하나의 보관소로 모으고 일부는 다른 보관소로 보내는 우주 정거장

캐시를 켰는데도 LLM이 느린 이유: Prefix-aware Routing의 원리

LLM 서버에서 prefix caching을 켰습니다. 같은 시스템 프롬프트를 반복해서 보내면 이미 계산한 부분을 재사용할 수 있습니다. 그런데 서버를 여러 대로 늘린 뒤에는 캐시를 켜기 전과 응답 속도가 크게 다르지 않습니다. 이런 상황을 가정해 보겠습니다. 첫 요청은 서버 A로 들어갔고, 같은 프롬프트로 시작하는 다음 요청은 서버 B로 들어갔습니다. A에 계산 결과가 남아 있어도 B가 그 결과를 사용할 수 없다면, B는 같은 부분을 다시 계산해야 합니다. 캐시 기능과 요청을 보내는 방식이 서로 맞지 않는 상황입니다. ...

2026년 9월 11일 · 6 분 · Jesam Kim
Some illustrations are generated using Amazon Bedrock image generation models (Nova 2 Omni, SD3.5 Large, Nova Canvas).