如果 MiniMax M2.7 级别的模型能满足你,那么今天 Qwen3.8-27B 的能力就超越了 M2.7 ,还是多模态,你只需要 5090 就可以了,使用 SGLang 的方案在单个 5090 上,结合 NVFP4 和 DSpark ,解码速度达 206.1 tok/s
https://docs.sglang.io/cookbook/autoregressive/Qwen/Qwen3.8-27B ,随着人数的增加来加卡就行。
如果你想要更好的模型能力,那么用 DeepSeek V4 Flash 0731 的 NVFP4 量化也行,RTX Pro 6000 现在涨价厉害可以退一步买 RTX Pro 6000D 这个被砍一刀的卡,2 张有点吃紧但是能跑,4 张就最好,我这里 4 张卡一天跑 20 亿 token 没问题,最大的问题就是这个成本对比买 API 哪一个划算,哪一个符合你们要求。
用多台 DGX-Spark 串联跑,也 ok ,
https://github.com/MiaAI-Lab/DeepSeek-v4-Flash-DSpark-2x-DGX-Spark最好使用 LMCache 来把 KV Cache 转移到内存,这样显存放模型,内存放 KV Cache ,速度也不会慢多少,显存容量的要求也降低,可以让更多的大上下文进来,工程上都是这么玩的。
结合好的 Agent 比如最近的 DeepSeek Harness ,缓存利用率大部分都是 95%~99%,对 prefill 速度友好。