litellm
글 3편, 메모 0개
LiteLLM CPU 병목 — 단일 워커에 묶인 LLM 게이트웨이
VM에 띄운 LiteLLM이 4코어 서버에서 CPU가 한 코어(약 27.6%)에서 천장을 쳤습니다. LiteLLM은 FastAPI 앱이라 워커 하나가 1코어만 씁니다. VM에선 워커를 늘려 임시로 막고, 이후 EKS로 Helm 마이그레이션해 파드 수평 확장으로 정리했습니다.
LLM 게이트웨이 패턴 — 프록시를 두는 이유
서비스마다 OpenAI·Bedrock을 직접 부르면 키가 흩어지고 비용을 못 추적하고 provider를 못 바꿉니다. 프록시 하나를 두면 이게 다 한 곳으로 모입니다.
IRSA 크로스 계정 인증 — EKS Pod의 다른 계정 Bedrock 접근
ServiceAccount에 붙이는 role-arn과 앱 설정에 쓰는 role은 서로 다른 계정의 다른 역할입니다. 액세스 키를 걷어내면서 이 구분이 필요했습니다.