From ad30b9524f8ba57394d659db0615d20c95ebdb37 Mon Sep 17 00:00:00 2001 From: sirius0xdev Date: Sun, 10 May 2026 02:20:42 +0000 Subject: [PATCH] numseq lower --- infrastructure/gpus/base/vllm-servers/rtx6000-vllm.yaml | 4 ++-- 1 file changed, 2 insertions(+), 2 deletions(-) diff --git a/infrastructure/gpus/base/vllm-servers/rtx6000-vllm.yaml b/infrastructure/gpus/base/vllm-servers/rtx6000-vllm.yaml index c3d58d7..6e105d6 100644 --- a/infrastructure/gpus/base/vllm-servers/rtx6000-vllm.yaml +++ b/infrastructure/gpus/base/vllm-servers/rtx6000-vllm.yaml @@ -37,12 +37,12 @@ spec: - --port=8000 - --tensor-parallel-size=1 - --tokenizer-mode=hf - - --gpu-memory-utilization=0.90 + - --gpu-memory-utilization=0.95 - --max-model-len=65536 - --enable-auto-tool-choice - --kv-cache-dtype=fp8 - --max-num-batched-tokens=65536 - - --max-num-seqs=64 + - --max-num-seqs=32 - --enable-chunked-prefill - --trust-remote-code - --dtype=auto