MSVC+CUDA llama.cpp fork for Windows: KDA/GDN, long-context KV placement, TurboQuant/TCQ when measured, speculative draft. Lab defaults — TriAttention opt-in only, not recommended.
cuda kda kv-cache llama-cpp llm-inference speculative-decoding kimi-linear vram-optimization cuda-13 gated-deltanet turboquant triattention flashkda
-
Updated
Jul 28, 2026 - C++