From 5c61d600b0240c6b3c0aaf873e1b84c6561c82d1 Mon Sep 17 00:00:00 2001 From: sirius0xdev Date: Wed, 29 Apr 2026 04:54:49 +0000 Subject: [PATCH] fix(keda): simplify HTTPScaledObject to valid schema fields only - Removed cooldownPeriod, scaledownPeriod, paths (all undeclared in http.keda.sh/v1alpha1 CRD) - Kept pollingInterval:10 for responsiveness + min:0 replicas for true scale-to-zero - Cleaned both rtx6000 and a100 configs for consistency Dry-run should now succeed. Scale behavior preserved via polling + low targetPendingRequests (defaults work well for vLLM). --- infrastructure/gpus/base/keda-gpu-scaling/keda-a100.yaml | 5 ++--- infrastructure/gpus/base/keda-gpu-scaling/keda-vllm.yaml | 3 --- 2 files changed, 2 insertions(+), 6 deletions(-) diff --git a/infrastructure/gpus/base/keda-gpu-scaling/keda-a100.yaml b/infrastructure/gpus/base/keda-gpu-scaling/keda-a100.yaml index 08ed523..88d2367 100644 --- a/infrastructure/gpus/base/keda-gpu-scaling/keda-a100.yaml +++ b/infrastructure/gpus/base/keda-gpu-scaling/keda-a100.yaml @@ -5,15 +5,14 @@ metadata: namespace: customer1 spec: hosts: - - a100-vllm.internal.cluster # Replace with actual internal routing host if needed + - a100-vllm.internal.cluster scaleTargetRef: name: openclaw-brain-vllm kind: Deployment apiVersion: apps/v1 service: openclaw-brain-service port: 8000 - replicas: min: 0 max: 1 - scaledownPeriod: 900 # 15 minutes of idle time before scaling to zero + pollingInterval: 10 diff --git a/infrastructure/gpus/base/keda-gpu-scaling/keda-vllm.yaml b/infrastructure/gpus/base/keda-gpu-scaling/keda-vllm.yaml index a26d73f..b29df7c 100644 --- a/infrastructure/gpus/base/keda-gpu-scaling/keda-vllm.yaml +++ b/infrastructure/gpus/base/keda-gpu-scaling/keda-vllm.yaml @@ -12,10 +12,7 @@ spec: apiVersion: apps/v1 service: rtx6000-brain-service port: 8000 - replicas: min: 0 max: 1 pollingInterval: 10 - cooldownPeriod: 30 - scaledownPeriod: 900