From 240620c3a4728d1faa04cd1e2d449884e39bcf19 Mon Sep 17 00:00:00 2001 From: Sirius Claw Date: Wed, 22 Apr 2026 17:07:05 +0000 Subject: [PATCH 1/2] feat: add KEDA scaling for A100 vLLM - Scale to 0 when idle (saves money) - 15 min cooldown before scale-down - Triggers on 3+ pending HTTP requests - Targets openclaw-brain-vllm deployment --- apps/base/customer1/openclaw/keda-vllm.yaml | 21 +++++++++++++++++++++ 1 file changed, 21 insertions(+) create mode 100644 apps/base/customer1/openclaw/keda-vllm.yaml diff --git a/apps/base/customer1/openclaw/keda-vllm.yaml b/apps/base/customer1/openclaw/keda-vllm.yaml new file mode 100644 index 0000000..09dadc2 --- /dev/null +++ b/apps/base/customer1/openclaw/keda-vllm.yaml @@ -0,0 +1,21 @@ +apiVersion: keda.sh/v1alpha1 +kind: ScaledObject +metadata: + name: openclaw-brain-a100-scaling + namespace: customer1 +spec: + scaleTargetRef: + name: openclaw-brain-vllm + kind: Deployment + service: + name: openclaw-brain-service + port: 8000 + minReplicaCount: 0 + maxReplicaCount: 1 + cooldownPeriod: 900 # 15 minutes idle before scale-down + triggers: + - type: http + metadata: + path: "/v1/models" + host: "openclaw-brain-service.customer1.svc.cluster.local" + requestCount: "3" # Scale up when 3+ requests pending From 9673b76fc74f04281235a56d098b1cfd1d5ec2c4 Mon Sep 17 00:00:00 2001 From: Sirius Claw Date: Wed, 22 Apr 2026 17:22:22 +0000 Subject: [PATCH 2/2] fix: trigger KEDA scale-up on 1 request instead of 3 - Wake script handles cold start, so scale immediately on first request - Reduces latency for /wake command and manual requests --- apps/base/customer1/openclaw/keda-vllm.yaml | 2 +- 1 file changed, 1 insertion(+), 1 deletion(-) diff --git a/apps/base/customer1/openclaw/keda-vllm.yaml b/apps/base/customer1/openclaw/keda-vllm.yaml index 09dadc2..c26cf69 100644 --- a/apps/base/customer1/openclaw/keda-vllm.yaml +++ b/apps/base/customer1/openclaw/keda-vllm.yaml @@ -18,4 +18,4 @@ spec: metadata: path: "/v1/models" host: "openclaw-brain-service.customer1.svc.cluster.local" - requestCount: "3" # Scale up when 3+ requests pending + requestCount: "1" # Scale up on 1+ request (wake script handles cold start)