Running large LLMs on pre-Ampere NVIDIA hardware — Tesla V100 (sm_70), RTX 2080 Ti (sm_75), CMP 170HX. Measured benchmarks, vLLM forks, and the hardware side: NVLink on SXM2 carrier boards, driver traps, cooling, used-kit acceptance.
cuda benchmarks turing volta nvlink awq tensor-parallelism llm gpu-server llama-cpp vllm local-llm llm-inference tesla-v100 rtx-2080ti gpu-hardware cmp-170hx sxm2 ga100
-
Updated
Aug 19, 2026