Heterogeneous prefill/decode for DeepSeek-V4-Flash: CUDA prefill (DGX Spark, vLLM) -> Metal decode (Mac Studio, oMLX) over plain 10GbE
mlx kv-cache apple-silicon vllm llm-inference deepseek dgx-spark omlx prefill-decode heterogeneous-inference
-
Updated
Sep 8, 2026 - Python