From 6c60731177d89525247be525d5502da56e8e63c3 Mon Sep 17 00:00:00 2001 From: sirius0xdev Date: Mon, 4 May 2026 22:53:56 -0400 Subject: [PATCH 1/2] Update kustomization.yaml --- infrastructure/gpus/staging/kustomization.yaml | 2 +- 1 file changed, 1 insertion(+), 1 deletion(-) diff --git a/infrastructure/gpus/staging/kustomization.yaml b/infrastructure/gpus/staging/kustomization.yaml index adcabb6..f4cd94d 100644 --- a/infrastructure/gpus/staging/kustomization.yaml +++ b/infrastructure/gpus/staging/kustomization.yaml @@ -1,5 +1,5 @@ apiVersion: kustomize.config.k8s.io/v1beta1 kind: Kustomization resources: - - ../base/vllm-servers/ + # - ../base/vllm-servers/ # - ../base/keda-gpu-scaling/ From 94565b7c3b081fd7b7c5a6042a2cab067b882f78 Mon Sep 17 00:00:00 2001 From: sirius0xdev Date: Tue, 5 May 2026 20:44:49 -0400 Subject: [PATCH 2/2] Update rtx6000-vllm.yaml --- infrastructure/gpus/base/vllm-servers/rtx6000-vllm.yaml | 2 +- 1 file changed, 1 insertion(+), 1 deletion(-) diff --git a/infrastructure/gpus/base/vllm-servers/rtx6000-vllm.yaml b/infrastructure/gpus/base/vllm-servers/rtx6000-vllm.yaml index fd254c3..fd5f81b 100644 --- a/infrastructure/gpus/base/vllm-servers/rtx6000-vllm.yaml +++ b/infrastructure/gpus/base/vllm-servers/rtx6000-vllm.yaml @@ -39,7 +39,7 @@ spec: - --tensor-parallel-size=1 - --tokenizer-mode=hf - --gpu-memory-utilization=0.98 - - --max-model-len=262144 + - --max-model-len=auto - --enable-auto-tool-choice - --max-num-batched-tokens=65536