gcloud-lab/infrastructure/gpus/base/keda-gpu-scaling/vllm-route.yaml
sirius0xdev bd760287a8 fix(rtx6000): enable scale-to-zero with 20min cooldown + wake-up route
- Set replicas.min: 0 for scale-to-zero when idle
- Add config.cooldownPeriod: 1200 to KEDA HTTP add-on HelmRelease
  (20 min buffer before scaling down from 1 replica)
- Add external HTTPRoute at brain.siriusdevops.com for manual wake-up
  via curl from Hermes/Telegram
2026-04-29 16:01:03 +00:00

19 lines
355 B
YAML

apiVersion: gateway.networking.k8s.io/v1
kind: HTTPRoute
metadata:
name: rtx6000-brain-route
namespace: customer1
spec:
parentRefs:
- name: external-http-gateway
hostnames:
- brain.siriusdevops.com
rules:
- matches:
- path:
type: PathPrefix
value: /
backendRefs:
- name: rtx6000-brain-service
port: 8000