diff --git a/infrastructure/gpus/base/keda-gpu-scaling/keda-vllm.yaml b/infrastructure/gpus/base/keda-gpu-scaling/keda-vllm.yaml index c675bdd..1669e1c 100644 --- a/infrastructure/gpus/base/keda-gpu-scaling/keda-vllm.yaml +++ b/infrastructure/gpus/base/keda-gpu-scaling/keda-vllm.yaml @@ -1,17 +1,22 @@ -apiVersion: keda.sh/v1alpha1 -kind: ScaledObject +apiVersion: http.keda.sh/v1alpha1 +kind: HTTPScaledObject metadata: name: rtx6000-scaling namespace: customer1 spec: + hosts: + - rtx6000-brain-service.customer1.svc.cluster.local scaleTargetRef: name: rtx6000-brain-vllm kind: Deployment apiVersion: apps/v1 - hosts: - - rtx6000-brain-service.customer1.svc.cluster.local + service: rtx6000-brain-service + port: 8000 + paths: + - path: "^/v1/(chat/)?completions" replicas: min: 0 max: 1 - targetPendingRequests: 1 + pollingInterval: 10 + cooldownPeriod: 30 scaledownPeriod: 900 diff --git a/infrastructure/gpus/base/vllm-servers/rtx6000-vllm.yaml b/infrastructure/gpus/base/vllm-servers/rtx6000-vllm.yaml index 2e60c16..d5ccbbc 100644 --- a/infrastructure/gpus/base/vllm-servers/rtx6000-vllm.yaml +++ b/infrastructure/gpus/base/vllm-servers/rtx6000-vllm.yaml @@ -2,12 +2,12 @@ apiVersion: apps/v1 kind: Deployment metadata: - name: openclaw-brain-vllm + name: rtx6000-brain-vllm namespace: customer1 labels: app: rtx6000-brain spec: - replicas: 1 + replicas: 0 selector: matchLabels: app: rtx6000-brain