diff --git a/infrastructure/gpus/base/keda-gpu-scaling/keda-a100.yaml b/infrastructure/gpus/base/keda-gpu-scaling/keda-a100.yaml index 08ed523..88d2367 100644 --- a/infrastructure/gpus/base/keda-gpu-scaling/keda-a100.yaml +++ b/infrastructure/gpus/base/keda-gpu-scaling/keda-a100.yaml @@ -5,15 +5,14 @@ metadata: namespace: customer1 spec: hosts: - - a100-vllm.internal.cluster # Replace with actual internal routing host if needed + - a100-vllm.internal.cluster scaleTargetRef: name: openclaw-brain-vllm kind: Deployment apiVersion: apps/v1 service: openclaw-brain-service port: 8000 - replicas: min: 0 max: 1 - scaledownPeriod: 900 # 15 minutes of idle time before scaling to zero + pollingInterval: 10 diff --git a/infrastructure/gpus/base/keda-gpu-scaling/keda-vllm.yaml b/infrastructure/gpus/base/keda-gpu-scaling/keda-vllm.yaml index a26d73f..b29df7c 100644 --- a/infrastructure/gpus/base/keda-gpu-scaling/keda-vllm.yaml +++ b/infrastructure/gpus/base/keda-gpu-scaling/keda-vllm.yaml @@ -12,10 +12,7 @@ spec: apiVersion: apps/v1 service: rtx6000-brain-service port: 8000 - replicas: min: 0 max: 1 pollingInterval: 10 - cooldownPeriod: 30 - scaledownPeriod: 900