GPU 플랫폼을 운영하며 달라진 Kubernetes 관점
GPU AI 플랫폼 운영을 통해, Kubernetes를 워크로드 배포 도구를 넘어 자원·정책·관측의 연결점으로 보게 된 이유입니다.
읽기 →~/brilly/ko
Open source, systems, talks, and things learned the hard way.

GPU AI 플랫폼 운영을 통해, Kubernetes를 워크로드 배포 도구를 넘어 자원·정책·관측의 연결점으로 보게 된 이유입니다.
읽기 →실제 운영 환경의 resolved CrashLoopBackOff incident를 재분석하며, 부족한 증거를 RCA와 Evidence Trail에 남긴 과정을 따라갑니다.
읽기 →Go Backend, FastAPI Agent, React Frontend와 일곱 개의 읽기 전용 collector로 GPU 플랫폼 장애 조사를 구성한 설계를 정리합니다.
읽기 →벤더 지원 과정에서 흩어진 케이스 기록과 기술 문서를, 운영자가 검증 가능한 RCA 조사 흐름으로 연결하는 프로토타입입니다.
읽기 →KubeRCA의 ReAct 조사 흐름과 read-only guardrail을 해외 기술 컨퍼런스 청중에게 설명하며 확인한 발표 설계와 개선점을 정리합니다.
읽기 →Brilly에서 기록하고 싶은 오픈소스, 발표, 개발 경험의 방향을 정리합니다.
읽기 →