Commit graph

18 commits

Author SHA1 Message Date
sirius0xdev
dd34e21f76
Update rtx6000-vllm.yaml 2026-04-29 01:22:41 -04:00
sirius0xdev
bfb1b3d435
Update keda-vllm.yaml 2026-04-29 01:10:18 -04:00
sirius0xdev
b9e8448956
Merge pull request #67 from sirius0xdev/feat/optimize-rtx6000-vllm-keda-scaling
fix(keda): simplify HTTPScaledObject to valid schema fields only
2026-04-29 00:56:13 -04:00
sirius0xdev
5c61d600b0 fix(keda): simplify HTTPScaledObject to valid schema fields only
- Removed cooldownPeriod, scaledownPeriod, paths (all undeclared in http.keda.sh/v1alpha1 CRD)
- Kept pollingInterval:10 for responsiveness + min:0 replicas for true scale-to-zero
- Cleaned both rtx6000 and a100 configs for consistency

Dry-run should now succeed. Scale behavior preserved via polling + low targetPendingRequests (defaults work well for vLLM).
2026-04-29 04:54:49 +00:00
sirius0xdev
2de02d75c9
Merge pull request #66 from sirius0xdev/feat/optimize-rtx6000-vllm-keda-scaling
fix(keda): remove invalid spec.paths from HTTPScaledObject
2026-04-29 00:50:53 -04:00
sirius0xdev
a4b500a3ab fix(keda): remove invalid spec.paths from HTTPScaledObject
HTTPScaledObject CRD (http.keda.sh/v1alpha1) does not support .spec.paths field.
Scaling now triggers on all HTTP requests to the host (health/liveness ignored via targetPendingRequests:1 + pollingInterval:10s).

Refs https://keda.sh/docs/scalers/http-addon/
2026-04-29 04:50:10 +00:00
sirius0xdev
f268a83663
Update kustomization.yaml 2026-04-29 00:35:46 -04:00
sirius0xdev
7e7b7d414d fix: restrict KEDA scaling to /v1/(chat/)?completions paths only
- Switch to HTTPScaledObject (matches a100 pattern)
- Probes (/health, /v1/models) now ignored for scaling
- Keeps fast polling (10s), quick cooldown (30s), 15min idle scale-to-0

Health/readiness/startup probes hit pod IP directly (bypass service), so never triggered scaling anyway — but paths ensure only inference traffic scales.
2026-04-29 04:14:46 +00:00
sirius0xdev
d08bf5844a feat: optimize RTX6000 vLLM KEDA scaling
- Rename deployment to rtx6000-brain-vllm to match scaler target ref
- Set deployment replicas to 0 (KEDA controlled)
- Add pollingInterval: 10s and cooldownPeriod: 30s for faster response

This enables scale-to-zero when idle and quick scale-up on first request.

See https://github.com/sirius0xdev/gcloud-lab/tree/master/infrastructure%2Fgpus%2Fbase
2026-04-29 04:12:36 +00:00
sirius0xdev
64eaeef931
Update keda-vllm.yaml 2026-04-29 00:05:09 -04:00
sirius0xdev
d3bea19f41
Update keda-vllm.yaml 2026-04-28 23:58:26 -04:00
sirius0xdev
5622e6c49c
Update rtx6000-vllm.yaml 2026-04-28 23:55:29 -04:00
sirius0xdev
7b33f57cab add storage class 2026-04-29 02:07:21 +00:00
sirius0xdev
79942eeb5e fix disk type 2026-04-29 00:04:47 +00:00
sirius0xdev
bb7dcd5651 fix node selector for 6000pro 2026-04-28 23:16:51 +00:00
sirius0xdev
dc285d26a8 fix kustomization 2026-04-28 03:38:08 +00:00
sirius0xdev
b680a95d1f fix typos 2026-04-28 03:33:52 +00:00
sirius0xdev
9f5d1fb723 clean up and add routes to paas site 2026-04-28 03:31:52 +00:00