- Rename deployment to rtx6000-brain-vllm to match scaler target ref - Set deployment replicas to 0 (KEDA controlled) - Add pollingInterval: 10s and cooldownPeriod: 30s for faster response This enables scale-to-zero when idle and quick scale-up on first request. See https://github.com/sirius0xdev/gcloud-lab/tree/master/infrastructure%2Fgpus%2Fbase |
||
|---|---|---|
| .. | ||
| a100-vllm.yaml | ||
| kustomization.yaml | ||
| rtx6000-vllm.yaml | ||
| vllm-gemma.yaml | ||
| vllm-l4.yaml | ||