DeepSeek-V4-Flash-0731 on 8x RTX 3090 (SM86) with vLLM — verified FP8 serving, benchmarks, build guide, and reproducible release.
multi-gpu fp8 vllm llm-inference speculative-decoding rtx-3090 deepseek-v4 deepseek-v4-flash dspark deepseek-v4-flash-0731 nvidia-ampere sm86
-
Updated
Aug 9, 2026 - Python