From 43eb51d5b765cd16615e250c4d714f14c8561793 Mon Sep 17 00:00:00 2001 From: Sirius Claw Date: Mon, 20 Apr 2026 05:38:36 +0000 Subject: [PATCH] feat: optimize cost via L4 spot instances and vLLM performance tuning --- apps/base/customer1/openclaw/vllm-gemma.yaml | 4 +++- apps/base/customer1/openclaw/vllm-l4.yaml | 2 +- modules/nodepool-gpu.tf | 2 +- 3 files changed, 5 insertions(+), 3 deletions(-) diff --git a/apps/base/customer1/openclaw/vllm-gemma.yaml b/apps/base/customer1/openclaw/vllm-gemma.yaml index 5392bb4..02e7397 100644 --- a/apps/base/customer1/openclaw/vllm-gemma.yaml +++ b/apps/base/customer1/openclaw/vllm-gemma.yaml @@ -24,7 +24,7 @@ spec: effect: "NoSchedule" containers: - name: vllm-brain - image: vllm/vllm-openai:latest + image: vllm/vllm-openai:v0.4.2 command: ["python3", "-m", "vllm.entrypoints.openai.api_server"] env: - name: HF_TOKEN @@ -44,6 +44,8 @@ spec: - --tool-call-parser=qwen3_coder - --reasoning-parser=qwen3 - --enable-prefix-caching + - --enable-chunked-prefill + - --kv-cache-dtype=fp8 ##- --limit-mm-per-prompt='{"image"=1, "video"=0}' # Optional: limit vision if not heavily using images yet ports: - containerPort: 8000 diff --git a/apps/base/customer1/openclaw/vllm-l4.yaml b/apps/base/customer1/openclaw/vllm-l4.yaml index 4e78e9a..7296c14 100644 --- a/apps/base/customer1/openclaw/vllm-l4.yaml +++ b/apps/base/customer1/openclaw/vllm-l4.yaml @@ -24,7 +24,7 @@ spec: effect: "NoSchedule" containers: - name: vllm-brain-l4 - image: vllm/vllm-openai:latest + image: vllm/vllm-openai:v0.4.2 command: ["python3", "-m", "vllm.entrypoints.openai.api_server"] env: - name: HF_TOKEN diff --git a/modules/nodepool-gpu.tf b/modules/nodepool-gpu.tf index 92aa8be..5389f8d 100644 --- a/modules/nodepool-gpu.tf +++ b/modules/nodepool-gpu.tf @@ -23,7 +23,7 @@ resource "google_container_node_pool" "gpu_pool" { } - spot = false + spot = true oauth_scopes = [ "https://www.googleapis.com/auth/cloud-platform"