From 240620c3a4728d1faa04cd1e2d449884e39bcf19 Mon Sep 17 00:00:00 2001 From: Sirius Claw Date: Wed, 22 Apr 2026 17:07:05 +0000 Subject: [PATCH] feat: add KEDA scaling for A100 vLLM - Scale to 0 when idle (saves money) - 15 min cooldown before scale-down - Triggers on 3+ pending HTTP requests - Targets openclaw-brain-vllm deployment --- apps/base/customer1/openclaw/keda-vllm.yaml | 21 +++++++++++++++++++++ 1 file changed, 21 insertions(+) create mode 100644 apps/base/customer1/openclaw/keda-vllm.yaml diff --git a/apps/base/customer1/openclaw/keda-vllm.yaml b/apps/base/customer1/openclaw/keda-vllm.yaml new file mode 100644 index 0000000..09dadc2 --- /dev/null +++ b/apps/base/customer1/openclaw/keda-vllm.yaml @@ -0,0 +1,21 @@ +apiVersion: keda.sh/v1alpha1 +kind: ScaledObject +metadata: + name: openclaw-brain-a100-scaling + namespace: customer1 +spec: + scaleTargetRef: + name: openclaw-brain-vllm + kind: Deployment + service: + name: openclaw-brain-service + port: 8000 + minReplicaCount: 0 + maxReplicaCount: 1 + cooldownPeriod: 900 # 15 minutes idle before scale-down + triggers: + - type: http + metadata: + path: "/v1/models" + host: "openclaw-brain-service.customer1.svc.cluster.local" + requestCount: "3" # Scale up when 3+ requests pending