prometheus
글 4편, 메모 0개
LiteLLM CPU 병목 — 단일 워커에 묶인 LLM 게이트웨이
VM에 띄운 LiteLLM이 4코어 서버에서 CPU가 한 코어(약 27.6%)에서 천장을 쳤습니다. LiteLLM은 FastAPI 앱이라 워커 하나가 1코어만 씁니다. VM에선 워커를 늘려 임시로 막고, 이후 EKS로 Helm 마이그레이션해 파드 수평 확장으로 정리했습니다.
PromQL rate() vs irate() — 평균 증가율과 순간 증가율
둘 다 Counter의 초당 증가율인데, rate는 범위 전체의 평균, irate는 마지막 두 샘플의 순간값입니다. 알람엔 rate, 실시간 대시보드엔 irate.
EKS Thanos 배포 트러블슈팅 — StorageClass·IRSA 연쇄 오류
StorageClass 하나 잘못 잡은 게 StatefulSet 재생성으로 번지고, IRSA Trust Policy에 ServiceAccount 하나 빠진 게 컴포넌트마다 Access Denied로 나왔습니다.
Prometheus 설정 리로드 실패 — 단일 파일 bind mount와 inode
prometheus.yml을 고치고 rsync로 올린 뒤 /-/reload를 불렀더니 200에 'reloaded successfully'까지 찍혔는데, 실제로는 옛날 설정이 그대로였습니다. 단일 파일 bind mount가 inode를 고정하고, rsync는 새 inode를 만들기 때문입니다.