From bd760287a8af42ccd6c39479bc78b1a725e1b7ae Mon Sep 17 00:00:00 2001 From: sirius0xdev Date: Wed, 29 Apr 2026 16:01:03 +0000 Subject: [PATCH] fix(rtx6000): enable scale-to-zero with 20min cooldown + wake-up route - Set replicas.min: 0 for scale-to-zero when idle - Add config.cooldownPeriod: 1200 to KEDA HTTP add-on HelmRelease (20 min buffer before scaling down from 1 replica) - Add external HTTPRoute at brain.siriusdevops.com for manual wake-up via curl from Hermes/Telegram --- .../base/keda/release-http-add-on.yaml | 3 +++ .../gpus/base/keda-gpu-scaling/keda-vllm.yaml | 2 +- .../base/keda-gpu-scaling/kustomization.yaml | 1 + .../base/keda-gpu-scaling/vllm-route.yaml | 19 +++++++++++++++++++ 4 files changed, 24 insertions(+), 1 deletion(-) create mode 100644 infrastructure/gpus/base/keda-gpu-scaling/vllm-route.yaml diff --git a/infrastructure/controllers/base/keda/release-http-add-on.yaml b/infrastructure/controllers/base/keda/release-http-add-on.yaml index a57959a..3f01b7c 100644 --- a/infrastructure/controllers/base/keda/release-http-add-on.yaml +++ b/infrastructure/controllers/base/keda/release-http-add-on.yaml @@ -19,3 +19,6 @@ spec: crds: CreateReplace dependsOn: - name: keda + values: + config: + cooldownPeriod: 1200 diff --git a/infrastructure/gpus/base/keda-gpu-scaling/keda-vllm.yaml b/infrastructure/gpus/base/keda-gpu-scaling/keda-vllm.yaml index 34dea56..ef7278d 100644 --- a/infrastructure/gpus/base/keda-gpu-scaling/keda-vllm.yaml +++ b/infrastructure/gpus/base/keda-gpu-scaling/keda-vllm.yaml @@ -13,6 +13,6 @@ spec: service: rtx6000-brain-service port: 8000 replicas: - min: 1 + min: 0 max: 1 diff --git a/infrastructure/gpus/base/keda-gpu-scaling/kustomization.yaml b/infrastructure/gpus/base/keda-gpu-scaling/kustomization.yaml index b1a2fcc..abd516b 100644 --- a/infrastructure/gpus/base/keda-gpu-scaling/kustomization.yaml +++ b/infrastructure/gpus/base/keda-gpu-scaling/kustomization.yaml @@ -3,4 +3,5 @@ apiVersion: kustomize.config.k8s.io/v1beta1 kind: Kustomization resources: - keda-vllm.yaml + - vllm-route.yaml diff --git a/infrastructure/gpus/base/keda-gpu-scaling/vllm-route.yaml b/infrastructure/gpus/base/keda-gpu-scaling/vllm-route.yaml new file mode 100644 index 0000000..a4faefb --- /dev/null +++ b/infrastructure/gpus/base/keda-gpu-scaling/vllm-route.yaml @@ -0,0 +1,19 @@ + +apiVersion: gateway.networking.k8s.io/v1 +kind: HTTPRoute +metadata: + name: rtx6000-brain-route + namespace: customer1 +spec: + parentRefs: + - name: external-http-gateway + hostnames: + - brain.siriusdevops.com + rules: + - matches: + - path: + type: PathPrefix + value: / + backendRefs: + - name: rtx6000-brain-service + port: 8000