From 063de544582518057832e06d74eb9e568ea7088a Mon Sep 17 00:00:00 2001 From: "renovate[bot]" <29139614+renovate[bot]@users.noreply.github.com> Date: Sun, 6 Sep 2026 11:17:14 +0000 Subject: [PATCH] =?UTF-8?q?fix(container):=20update=20image=20ghcr.io/ggml?= =?UTF-8?q?-org/llama.cpp=20(f862c90=20=E2=9E=94=209b67d4b)?= MIME-Version: 1.0 Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 8bit --- kubernetes/apps/ai/llmkube/models/qwen3-embedding.yaml | 2 +- kubernetes/apps/ai/llmkube/models/qwen35-2b.yaml | 2 +- kubernetes/apps/ai/llmkube/models/vmcp-embedding.yaml | 2 +- 3 files changed, 3 insertions(+), 3 deletions(-) diff --git a/kubernetes/apps/ai/llmkube/models/qwen3-embedding.yaml b/kubernetes/apps/ai/llmkube/models/qwen3-embedding.yaml index 4f95e1fb9..24bf2df0d 100644 --- a/kubernetes/apps/ai/llmkube/models/qwen3-embedding.yaml +++ b/kubernetes/apps/ai/llmkube/models/qwen3-embedding.yaml @@ -36,7 +36,7 @@ spec: # Native upstream GTT-leak mitigation in LLMKube >=0.9.10; lifetime includes # startup and model load before this Vulkan embedder is recycled. maxPodLifetimeSeconds: 86400 - image: ghcr.io/ggml-org/llama.cpp:server-vulkan@sha256:f862c901a0089bc3dc326bd24f208bfcd147839783328d252e911a004c94ff3c + image: ghcr.io/ggml-org/llama.cpp:server-vulkan@sha256:9b67d4b09614453f5511e655aa6a7792ddb16e93ae9116134c910bb1951da645 # Two slots are the Vulkan-safe floor; more interleaving did not improve # throughput on this compute-bound iGPU. VMCP has its own embedder now. parallelSlots: 2 # Vulkan warmup hangs at parallel=1 (llama.cpp #24307) diff --git a/kubernetes/apps/ai/llmkube/models/qwen35-2b.yaml b/kubernetes/apps/ai/llmkube/models/qwen35-2b.yaml index 64c2db191..55f9fab20 100644 --- a/kubernetes/apps/ai/llmkube/models/qwen35-2b.yaml +++ b/kubernetes/apps/ai/llmkube/models/qwen35-2b.yaml @@ -33,7 +33,7 @@ spec: modelRef: qwen35-2b # Must be recent enough for Qwen3.5's GDN (Gated Delta Networks) architecture; # verified to load `qwen35` and run GDN fully on Vulkan (no CPU fallback). - image: ghcr.io/ggml-org/llama.cpp:server-vulkan@sha256:f862c901a0089bc3dc326bd24f208bfcd147839783328d252e911a004c94ff3c + image: ghcr.io/ggml-org/llama.cpp:server-vulkan@sha256:9b67d4b09614453f5511e655aa6a7792ddb16e93ae9116134c910bb1951da645 parallelSlots: 2 # Vulkan warmup hangs at parallel=1 (llama.cpp #24307) # llama.cpp splits contextSize across parallelSlots, so 32768/2 = 16384 per slot. # GDN keeps KV tiny, so long ctx is cheap; 16K per slot is plenty for offload. diff --git a/kubernetes/apps/ai/llmkube/models/vmcp-embedding.yaml b/kubernetes/apps/ai/llmkube/models/vmcp-embedding.yaml index 56afd794b..778539a90 100644 --- a/kubernetes/apps/ai/llmkube/models/vmcp-embedding.yaml +++ b/kubernetes/apps/ai/llmkube/models/vmcp-embedding.yaml @@ -48,7 +48,7 @@ spec: # reloading at once on control-3 is the condition behind the podAffinity # deadlock; offsetting the period drops realignment from daily to every 3d. maxPodLifetimeSeconds: 64800 - image: ghcr.io/ggml-org/llama.cpp:server-vulkan@sha256:f862c901a0089bc3dc326bd24f208bfcd147839783328d252e911a004c94ff3c + image: ghcr.io/ggml-org/llama.cpp:server-vulkan@sha256:9b67d4b09614453f5511e655aa6a7792ddb16e93ae9116134c910bb1951da645 # Vulkan floor is 2 — warmup hangs at parallel=1 (llama.cpp #24307). The iGPU # is compute-bound, so more slots add interleave, not throughput. parallelSlots: 2