gcloud-lab/infrastructure/gpus/base/keda-gpu-scaling/keda-vllm.yaml

19 lines
381 B
YAML
Raw Normal View History

apiVersion: http.keda.sh/v1alpha1
kind: HTTPScaledObject
metadata:
2026-04-28 23:58:26 -04:00
name: rtx6000-scaling
namespace: customer1
spec:
hosts:
- rtx6000-brain-service.customer1.svc.cluster.local
scaleTargetRef:
2026-04-28 23:58:26 -04:00
name: rtx6000-brain-vllm
kind: Deployment
apiVersion: apps/v1
service: rtx6000-brain-service
port: 8000
2026-04-23 01:37:09 +00:00
replicas:
min: 0
max: 1
pollingInterval: 10