Commit graph

174 commits

Author SHA1 Message Date
sirius0xdev
25fc06accf fix vllm error 2026-04-21 01:49:00 +00:00
sirius0xdev
d109eba378
Update kustomization.yaml 2026-04-20 20:23:05 -04:00
Sirius Claw
29f57b48a0 Fix A100 crashloop by cleaning up invalid vllm args 2026-04-20 23:45:43 +00:00
Sirius Claw
e1cf661692 Switch L4 vLLM to Dolphin Qwen2 7B AWQ for speed and uncensored compliance 2026-04-20 20:47:30 +00:00
sirius0xdev
2f163fab36
Merge pull request #46 from sirius0xdev/feature/maximize-l4-context
Maximize L4 vLLM context window
2026-04-20 12:29:03 -04:00
Sirius Claw
fb951600d7 chore: maximize vllm max_model_len on L4 to 32768 2026-04-20 16:14:27 +00:00
Sirius Claw
687d61f626 fix: pin vLLM to v0.9.1 and use pythonic tool call parser 2026-04-20 07:23:43 +00:00
Sirius Claw
baa88975b5 fix: revert vLLM image to latest to support qwen3_coder tool parser 2026-04-20 07:16:42 +00:00
Sirius Claw
35dc7f01ac fix: bump pinned vLLM version to v0.7.3 to support tool calling arguments 2026-04-20 06:58:13 +00:00
Sirius Claw
43eb51d5b7 feat: optimize cost via L4 spot instances and vLLM performance tuning 2026-04-20 05:38:36 +00:00
Sirius Claw
7d34b3f649 fix: match vllm-l4 deployment nodeSelector and tolerations to nodepool labels/taints 2026-04-20 05:11:55 +00:00
Sirius Claw
83efcbf745 chore: point OpenClaw to the new L4 vLLM dispatcher 2026-04-20 03:14:10 +00:00
sirius0xdev
34b17f77b0
Merge pull request #28 from sirius0xdev/feat-l4-and-keda
feat: Add L4 vLLM deployment and KEDA scale-to-zero for A100
2026-04-19 23:13:28 -04:00
Sirius Claw
8041f71063 feat: Switch L4 deployment to Qwen2.5-Coder-7B-Instruct-heretic 2026-04-20 02:32:01 +00:00
Sirius Claw
7a0d33f042 feat: Add L4 vLLM deployment and KEDA scale-to-zero for A100 2026-04-20 02:20:08 +00:00
Sirius Claw
cecd14123e chore: optimize vLLM parameters for A100 by removing artificial limits 2026-04-20 02:09:15 +00:00
sirius0xdev
46f576dcda dial in vllm 2026-04-20 02:04:04 +00:00
sirius0xdev
7c72d229ac switch back claw image 2026-04-20 01:52:50 +00:00
sirius0xdev
0dbf223df0 fix vllm config 2026-04-20 01:49:36 +00:00
sirius0xdev
33495a40d0 arch_claw image 2026-04-19 23:43:50 +00:00
sirius0xdev
ee3cf7c7ee dial in vllm settings 2026-04-19 23:41:15 +00:00
sirius0xdev
28e701e27f add tools to vllm 2026-04-19 23:33:43 +00:00
sirius0xdev
2d8e4b9476 fix config map 2026-04-19 22:32:22 +00:00
sirius0xdev
14551d44e3 reconfigure openclaw 2026-04-19 22:18:59 +00:00
sirius0xdev
283e7e92e1 configmap 2026-04-19 07:21:58 +00:00
sirius0xdev
f0a3d3b179 fix oc crash 2026-04-19 07:01:07 +00:00
sirius0xdev
1732e32a78 fix configmap 2026-04-19 06:51:09 +00:00
sirius0xdev
64ebcaba60 fix typo 2026-04-19 06:45:33 +00:00
sirius0xdev
e40a804d85 fix gateway 2026-04-19 06:41:34 +00:00
sirius0xdev
5139ece7ec fix configmap 2026-04-19 05:58:32 +00:00
sirius0xdev
5ecd7a66be fix config map 2026-04-19 05:51:42 +00:00
sirius0xdev
98da1db5fd Merge branch 'master' of github.com:sirius0xdev/gcloud-lab
Call me
2026-04-19 05:47:02 +00:00
sirius0xdev
4f3093d0f8 fix openclaw.json 2026-04-19 05:46:49 +00:00
sirius0xdev
e17a96f43d
Update configmap.yaml 2026-04-18 20:29:16 -04:00
SiriusClaw
9b15b09eed feat: sync openclaw and proxy bot configs to use new qwen3.5-27b-heretic model 2026-04-18 22:48:48 +00:00
sirius0xdev
d3d18ab28a model switch 2026-04-18 22:29:44 +00:00
sirius0xdev
8aad1555a5 try new model 2026-04-18 22:25:26 +00:00
sirius0xdev
8ec068c841 vllm errors 2026-04-18 22:12:29 +00:00
sirius0xdev
3a924b4a10 fix vllm args 2026-04-18 22:08:56 +00:00
sirius0xdev
2fbd6bdf81 change resource limits 2026-04-18 22:04:41 +00:00
sirius0xdev
741a07bbc4 vllm errors models size might be too big 2026-04-18 21:58:39 +00:00
sirius0xdev
197212aacb fix vllm errors 2026-04-18 21:53:00 +00:00
SiriusClaw
1ebab4f6e5 fix: enforce eager execution to stop gemma 2 CUDA graph crash 2026-04-18 21:32:03 +00:00
SiriusClaw
603465033b feat: switch infrastructure to supergemma4-26b-abliterated-multimodal 2026-04-18 21:17:29 +00:00
SiriusClaw
1cc2d8e112 fix: remove XFORMERS attention backend override to fix Venice gibberish 2026-04-18 20:52:26 +00:00
sirius0xdev
73a4ee6408
Merge pull request #18 from sirius0xdev/fix/vllm-trust-remote-code-tokenizer
fix: revert tokenizer mode to auto
2026-04-18 16:35:51 -04:00
SiriusClaw
6df1e12ab0 fix: revert tokenizer mode to auto 2026-04-18 20:34:15 +00:00
sirius0xdev
518127c711
Merge pull request #17 from sirius0xdev/fix/vllm-mistral-regex
fix: enforce mistral tokenizer mode
2026-04-18 16:11:01 -04:00
SiriusClaw
0f5d0b17e5 fix: enforce mistral tokenizer mode to bypass regex corruption bug 2026-04-18 20:09:35 +00:00
SiriusClaw
9b7fc44ab2 feat: attach persistent volume claim to vLLM to cache HuggingFace weights 2026-04-18 20:07:30 +00:00