GPU 플랫폼을 운영하며 달라진 Kubernetes 관점
GPU AI 플랫폼 운영을 통해, Kubernetes를 워크로드 배포 도구를 넘어 자원·정책·관측의 연결점으로 보게 된 이유입니다.
읽기 →GPU AI 플랫폼 운영을 통해, Kubernetes를 워크로드 배포 도구를 넘어 자원·정책·관측의 연결점으로 보게 된 이유입니다.
읽기 →Go Backend, FastAPI Agent, React Frontend와 일곱 개의 읽기 전용 collector로 GPU 플랫폼 장애 조사를 구성한 설계를 정리합니다.
읽기 →KubeRCA의 ReAct 조사 흐름과 read-only guardrail을 해외 기술 컨퍼런스 청중에게 설명하며 확인한 발표 설계와 개선점을 정리합니다.
읽기 →KubeRCA의 Frontend·Backend·Analysis Agent·PostgreSQL 경계와, RCA 검토·재분석·피드백을 제품 흐름에 넣은 방법을 정리합니다.
읽기 →Kubernetes 알림 뒤에 반복되는 조사 준비와 인수인계를 줄이기 위해 KubeRCA를 시작한 문제 정의, OOMKilled 데모와 제품 기준입니다.
읽기 →