Commit graph

12 commits

Author SHA1 Message Date
sirius0xdev
9a7904c219
Update rtx6000-vllm.yaml 2026-05-02 08:36:04 -04:00
sirius0xdev
864cfd2cc9
Update rtx6000-vllm.yaml 2026-05-02 08:26:09 -04:00
sirius0xdev
08e9998019
Update rtx6000-vllm.yaml 2026-05-02 08:24:21 -04:00
sirius0xdev
17f46261e0
Update rtx6000-vllm.yaml 2026-04-29 11:21:02 -04:00
sirius0xdev
24fee8f4a2
Update rtx6000-vllm.yaml 2026-04-29 09:41:48 -04:00
sirius0xdev
dd34e21f76
Update rtx6000-vllm.yaml 2026-04-29 01:22:41 -04:00
sirius0xdev
d08bf5844a feat: optimize RTX6000 vLLM KEDA scaling
- Rename deployment to rtx6000-brain-vllm to match scaler target ref
- Set deployment replicas to 0 (KEDA controlled)
- Add pollingInterval: 10s and cooldownPeriod: 30s for faster response

This enables scale-to-zero when idle and quick scale-up on first request.

See https://github.com/sirius0xdev/gcloud-lab/tree/master/infrastructure%2Fgpus%2Fbase
2026-04-29 04:12:36 +00:00
sirius0xdev
5622e6c49c
Update rtx6000-vllm.yaml 2026-04-28 23:55:29 -04:00
sirius0xdev
7b33f57cab add storage class 2026-04-29 02:07:21 +00:00
sirius0xdev
79942eeb5e fix disk type 2026-04-29 00:04:47 +00:00
sirius0xdev
bb7dcd5651 fix node selector for 6000pro 2026-04-28 23:16:51 +00:00
sirius0xdev
9f5d1fb723 clean up and add routes to paas site 2026-04-28 03:31:52 +00:00