Commit graph

887 commits

Author SHA1 Message Date
sirius0xdev
0b5867a501
Update kustomization.yaml 2026-04-29 21:41:52 -04:00
sirius0xdev
1366590721
Update kustomization.yaml 2026-04-29 13:49:49 -04:00
sirius0xdev
862c8c0f19
Update deployment.yaml 2026-04-29 12:59:21 -04:00
sirius0xdev
ae8e51cc79
Update kustomization.yaml 2026-04-29 12:58:32 -04:00
sirius0xdev
de39eb1053
Update kustomization.yaml 2026-04-29 12:58:05 -04:00
sirius0xdev
bb0d8f8513
Merge pull request #72 from sirius0xdev/fix/hermes-vllm-provider-config-type
fix(hermes-agent): add type: openai to vLLM providers for model listing
2026-04-29 12:21:34 -04:00
sirius0xdev
2548bccfc6 fix(hermes-agent): add type: openai to vLLM providers for model listing
Enables /v1/models endpoint query for custom providers (fixes qwen model not showing under qwen-vllm).

Changes:
- Added `type: openai` to `rtx6000-brain` and `qwen-vllm` providers
- Standardized base_url to full FQDN: \*.customer1.svc.cluster.local
- Added context_length to qwen-vllm provider
- Updated models.qwen-vllm base_url and context_length for consistency
2026-04-29 16:18:35 +00:00
sirius0xdev
a742d583dd
Merge pull request #71 from sirius0xdev/fix/rtx6000-scale-to-zero-with-cooldown
fix(rtx6000): enable scale-to-zero with 20min cooldown + wake-up route
2026-04-29 12:10:43 -04:00
sirius0xdev
bd760287a8 fix(rtx6000): enable scale-to-zero with 20min cooldown + wake-up route
- Set replicas.min: 0 for scale-to-zero when idle
- Add config.cooldownPeriod: 1200 to KEDA HTTP add-on HelmRelease
  (20 min buffer before scaling down from 1 replica)
- Add external HTTPRoute at brain.siriusdevops.com for manual wake-up
  via curl from Hermes/Telegram
2026-04-29 16:01:03 +00:00
sirius0xdev
17f46261e0
Update rtx6000-vllm.yaml 2026-04-29 11:21:02 -04:00
sirius0xdev
24fee8f4a2
Update rtx6000-vllm.yaml 2026-04-29 09:41:48 -04:00
sirius0xdev
37a4179f96
Update deployment.yaml 2026-04-29 09:22:34 -04:00
sirius0xdev
ae9758727c
Merge pull request #70 from sirius0xdev/feat/add-rtx6000-brain-vllm-provider
feat: add rtx6000-brain and qwen-vllm custom vLLM providers to Hermes…
2026-04-29 08:54:04 -04:00
sirius0xdev
ec41b38f1a feat: add rtx6000-brain and qwen-vllm custom vLLM providers to Hermes ConfigMap
- Makes rtx6000-brain selectable in the /model provider picker (preferred name)
- Uses short Kubernetes service names (optimal for same-namespace)
- Keeps existing models: section for CLI compatibility
- Will appear as provider options after ArgoCD/Helm rollout + /restart
2026-04-29 12:52:00 +00:00
sirius0xdev
8c1c55dd80
Update kustomization.yaml 2026-04-29 08:23:18 -04:00
sirius0xdev
13db3d4a3d
Update kustomization.yaml 2026-04-29 08:22:58 -04:00
sirius0xdev
b55539eac4
Merge pull request #69 from sirius0xdev/fix/rtx6000-scaling-prevent-thrashing
fix(rtx6000-scaling): set minReplicas to 1 to prevent transient scale…
2026-04-29 07:26:48 -04:00
sirius0xdev
53fde83544 fix(rtx6000-scaling): set minReplicas to 1 to prevent transient scale-up/down thrashing from periodic health checks
Prevents the watcher cron (every 5m) from causing unnecessary spot pod churn. Keeps 1 ready pod always (KEDA overrides deployment replicas).
2026-04-29 11:20:45 +00:00
sirius0xdev
9a64ed8889
Merge pull request #68 from sirius0xdev/feat/hermes-configmap
Feat/hermes configmap
2026-04-29 01:52:24 -04:00
sirius0xdev
6989b18f37 feat(hermes-config): add clean 'vllm' provider for the existing rtx6000-brain-service
- Primary 'vllm' entry for easy /model vllm usage
- Uses model from the rtx6000 deployment
- Kept existing qwen-vllm, rtx6000-vllm, and rtx6000-brain for compatibility
2026-04-29 05:50:54 +00:00
sirius0xdev
58451ccca5 feat(hermes-config): add rtx6000-brain provider using model from vLLM deployment
Added rtx6000-brain alongside the existing rtx6000-vllm entry.
Uses the exact model name from rtx6000-vllm Deployment and the correct ClusterIP service endpoint.
2026-04-29 05:42:31 +00:00
sirius0xdev
dd34e21f76
Update rtx6000-vllm.yaml 2026-04-29 01:22:41 -04:00
sirius0xdev
bfb1b3d435
Update keda-vllm.yaml 2026-04-29 01:10:18 -04:00
sirius0xdev
aed7084b0e
Merge pull request #65 from sirius0xdev/feat/hermes-configmap
feat(hermes-agent): add hermes-config ConfigMap and mount to deployment
2026-04-29 01:02:59 -04:00
sirius0xdev
b9e8448956
Merge pull request #67 from sirius0xdev/feat/optimize-rtx6000-vllm-keda-scaling
fix(keda): simplify HTTPScaledObject to valid schema fields only
2026-04-29 00:56:13 -04:00
sirius0xdev
5c61d600b0 fix(keda): simplify HTTPScaledObject to valid schema fields only
- Removed cooldownPeriod, scaledownPeriod, paths (all undeclared in http.keda.sh/v1alpha1 CRD)
- Kept pollingInterval:10 for responsiveness + min:0 replicas for true scale-to-zero
- Cleaned both rtx6000 and a100 configs for consistency

Dry-run should now succeed. Scale behavior preserved via polling + low targetPendingRequests (defaults work well for vLLM).
2026-04-29 04:54:49 +00:00
sirius0xdev
2de02d75c9
Merge pull request #66 from sirius0xdev/feat/optimize-rtx6000-vllm-keda-scaling
fix(keda): remove invalid spec.paths from HTTPScaledObject
2026-04-29 00:50:53 -04:00
sirius0xdev
a4b500a3ab fix(keda): remove invalid spec.paths from HTTPScaledObject
HTTPScaledObject CRD (http.keda.sh/v1alpha1) does not support .spec.paths field.
Scaling now triggers on all HTTP requests to the host (health/liveness ignored via targetPendingRequests:1 + pollingInterval:10s).

Refs https://keda.sh/docs/scalers/http-addon/
2026-04-29 04:50:10 +00:00
sirius0xdev
9e5eea2cd1 feat(hermes-agent): add hermes-config ConfigMap and mount to deployment
- hermes-config::ConfigMap with current /opt/data/config.yaml (models incl. vLLM, agent/tool settings)
- deployment.yaml: volume + subPath mountPath=/opt/data/config.yaml (overrides PVC)
- kustomization.yaml: include configmap.yaml

Standardizes Hermes config via K8s ConfigMap for easier management.
2026-04-29 04:45:18 +00:00
sirius0xdev
f268a83663
Update kustomization.yaml 2026-04-29 00:35:46 -04:00
sirius0xdev
9ea9d08f2d
Merge pull request #64 from sirius0xdev/feat/optimize-rtx6000-vllm-keda-scaling
feat: optimize RTX6000 vLLM KEDA scaling
2026-04-29 00:18:40 -04:00
sirius0xdev
7e7b7d414d fix: restrict KEDA scaling to /v1/(chat/)?completions paths only
- Switch to HTTPScaledObject (matches a100 pattern)
- Probes (/health, /v1/models) now ignored for scaling
- Keeps fast polling (10s), quick cooldown (30s), 15min idle scale-to-0

Health/readiness/startup probes hit pod IP directly (bypass service), so never triggered scaling anyway — but paths ensure only inference traffic scales.
2026-04-29 04:14:46 +00:00
sirius0xdev
d08bf5844a feat: optimize RTX6000 vLLM KEDA scaling
- Rename deployment to rtx6000-brain-vllm to match scaler target ref
- Set deployment replicas to 0 (KEDA controlled)
- Add pollingInterval: 10s and cooldownPeriod: 30s for faster response

This enables scale-to-zero when idle and quick scale-up on first request.

See https://github.com/sirius0xdev/gcloud-lab/tree/master/infrastructure%2Fgpus%2Fbase
2026-04-29 04:12:36 +00:00
sirius0xdev
64eaeef931
Update keda-vllm.yaml 2026-04-29 00:05:09 -04:00
sirius0xdev
d3bea19f41
Update keda-vllm.yaml 2026-04-28 23:58:26 -04:00
sirius0xdev
5622e6c49c
Update rtx6000-vllm.yaml 2026-04-28 23:55:29 -04:00
sirius0xdev
12acba27d7
Update kustomization.yaml 2026-04-28 23:51:19 -04:00
sirius0xdev
7b33f57cab add storage class 2026-04-29 02:07:21 +00:00
sirius0xdev
79942eeb5e fix disk type 2026-04-29 00:04:47 +00:00
sirius0xdev
c2f42f067d Merge branch 'master' of github.com:sirius0xdev/gcloud-lab
C
jk#
2026-04-28 23:17:01 +00:00
sirius0xdev
bb7dcd5651 fix node selector for 6000pro 2026-04-28 23:16:51 +00:00
sirius0xdev
94811c019d
Update route.yaml 2026-04-28 13:18:34 -04:00
sirius0xdev
d9048a7014 remove hostname from gateway 2026-04-28 05:00:57 +00:00
sirius0xdev
d309141ea1 fix health check 2026-04-28 04:49:09 +00:00
sirius0xdev
d61f2a2e3b health check for paaas 2026-04-28 04:44:20 +00:00
sirius0xdev
205c43f7c2 add health check for paaas 2026-04-28 04:42:42 +00:00
sirius0xdev
aca1298f64 fix route 2026-04-28 04:30:14 +00:00
sirius0xdev
3c233b0916 fix hostname 2026-04-28 04:18:33 +00:00
sirius0xdev
e9e2e02a34 fix certs apigateway 2026-04-28 04:16:38 +00:00
sirius0xdev
f2d1badae4 fix typo 2026-04-28 04:07:36 +00:00