diff --git a/apps/base/customer1/openclaw/vllm-gemma.yaml b/apps/base/customer1/openclaw/vllm-gemma.yaml index 5392bb4..02e7397 100644 --- a/apps/base/customer1/openclaw/vllm-gemma.yaml +++ b/apps/base/customer1/openclaw/vllm-gemma.yaml @@ -24,7 +24,7 @@ spec: effect: "NoSchedule" containers: - name: vllm-brain - image: vllm/vllm-openai:latest + image: vllm/vllm-openai:v0.4.2 command: ["python3", "-m", "vllm.entrypoints.openai.api_server"] env: - name: HF_TOKEN @@ -44,6 +44,8 @@ spec: - --tool-call-parser=qwen3_coder - --reasoning-parser=qwen3 - --enable-prefix-caching + - --enable-chunked-prefill + - --kv-cache-dtype=fp8 ##- --limit-mm-per-prompt='{"image"=1, "video"=0}' # Optional: limit vision if not heavily using images yet ports: - containerPort: 8000 diff --git a/apps/base/customer1/openclaw/vllm-l4.yaml b/apps/base/customer1/openclaw/vllm-l4.yaml index 4e78e9a..7296c14 100644 --- a/apps/base/customer1/openclaw/vllm-l4.yaml +++ b/apps/base/customer1/openclaw/vllm-l4.yaml @@ -24,7 +24,7 @@ spec: effect: "NoSchedule" containers: - name: vllm-brain-l4 - image: vllm/vllm-openai:latest + image: vllm/vllm-openai:v0.4.2 command: ["python3", "-m", "vllm.entrypoints.openai.api_server"] env: - name: HF_TOKEN diff --git a/modules/nodepool-gpu.tf b/modules/nodepool-gpu.tf index 92aa8be..5389f8d 100644 --- a/modules/nodepool-gpu.tf +++ b/modules/nodepool-gpu.tf @@ -23,7 +23,7 @@ resource "google_container_node_pool" "gpu_pool" { } - spot = false + spot = true oauth_scopes = [ "https://www.googleapis.com/auth/cloud-platform"