$V2EX
Solana
Give SOL to Copy Address
使用 SOL 向 slowgen 打赏,数额会 100% 进入 slowgen 的钱包。
 slowgen's recent timeline updates
slowgen

slowgen

V2EX member #83209, joined on 2014-11-23 14:34:54 +08:00
PRO
PRO member
Per slowgen's settings, the topics list is only visible after you sign in
Deals info, including closed deals, is not hidden
slowgen's recent replies
unsloth 的 NVFP4 没什么问题,反而是 SGLang 用 RadixArk 的那个 NVFP4 + DSpark 有大问题,给了 85G 显存还会 OOM 。
LMCache 记得用,冷对话的 KV Cache 可以转移到内存,避免时间太久对话被丢掉需要重建 KV Cache ,从而又走一遍 prefill 阶段。

同时今天出 Dflash 2 ,加速效果比 DSpark 还猛,可以继续测了。

我这几天用 DeepSeek Harness 跑 DeepSeek-V4-Flash-0731 和 Qwen3.8 27B ,都是 NVFP4 ,跑了几亿 token 做测试,结果在做 GUI 方面 Qwen3.8 很亮眼,在移植 tabby 项目到 tauri2 + rust 的测试中,有以下难点:
1.我在虚拟机里跑的 Linux Mint ,GPU 是虚拟的,可能用不到加速,运行过程中可能黑屏白屏、帧数低等问题;
2.rust 编程能力的问题
3.e2e 测试的问题,自动化界面点击测试

Qwen3.8 27B 全面领先,毕竟有视觉能力,一路高歌猛进,/goal 设定目标就可以了,虚拟机丢旁边看着它一直推进,SFTP 面板都在做 GUI 的冒烟测试。构建完成后空载内存只有 39MB ,看到原子弹爆炸了。
就是中间有一个 bug ,反馈给它后,它自己用了插桩、探针、前端 SPY 、hook 多种手段来调试,花了 5100w 的 token ,修了一行代码,再次看到原子弹爆炸,xhigh 真就是用电力换能力了。
6 days ago
Replied to a topic by majuzhang Local LLM 公司本地部署开源模型
如果 MiniMax M2.7 级别的模型能满足你,那么今天 Qwen3.8-27B 的能力就超越了 M2.7 ,还是多模态,你只需要 5090 就可以了,使用 SGLang 的方案在单个 5090 上,结合 NVFP4 和 DSpark ,解码速度达 206.1 tok/s https://docs.sglang.io/cookbook/autoregressive/Qwen/Qwen3.8-27B ,随着人数的增加来加卡就行。

如果你想要更好的模型能力,那么用 DeepSeek V4 Flash 0731 的 NVFP4 量化也行,RTX Pro 6000 现在涨价厉害可以退一步买 RTX Pro 6000D 这个被砍一刀的卡,2 张有点吃紧但是能跑,4 张就最好,我这里 4 张卡一天跑 20 亿 token 没问题,最大的问题就是这个成本对比买 API 哪一个划算,哪一个符合你们要求。

用多台 DGX-Spark 串联跑,也 ok ,https://github.com/MiaAI-Lab/DeepSeek-v4-Flash-DSpark-2x-DGX-Spark

最好使用 LMCache 来把 KV Cache 转移到内存,这样显存放模型,内存放 KV Cache ,速度也不会慢多少,显存容量的要求也降低,可以让更多的大上下文进来,工程上都是这么玩的。
结合好的 Agent 比如最近的 DeepSeek Harness ,缓存利用率大部分都是 95%~99%,对 prefill 速度友好。
@davinci21s 迁移动作才占你视频的百分之多少?不都是先做分镜图然后图生视频吗?你可以租个 5090 到 RTX Pro 6000 这个级别的显卡,配合 NVFP4 跑,刷新一下认知。反正我们做 5s 的 720p 视频一个就几十秒
谁告诉你本地模型几秒钟的视频要半小时?你的数据来源都是错的
鸡腿肉丁一样低脂又便宜,口感比鸡胸肉好多了。
光是油这一样就占了很多因素了,饭店的油有点水平都自己调配过,加了增香的料进去炸过
198 一个号,这个价格比很多网游账号的价值都高啊
本地跑大模型还得是 Blackwell 架构的 RTX Pro 6000 ,直接上 NVFP4 量化,真的就一代架构一代神
从 CTO 角度来说难度可能不大,比如用绞杀者模式逐步替换 API ,结合流量镜像方案把生产流量同时导入测试环境的新老系统看数据对比来验证防止翻车等,手段很多。

如果是从培养你角度让你直接参考 https://typescript-is-like-csharp.chrlschn.dev/pages/intro-and-motivation.html 这种方便 TypeScript 熟练工快速学习 C# 的文档两天就能上手读懂项目,渐进式重构问题也不大。

但是选择的方案这么激进,对你来说难度就很大了,起码出一个风险应对方案来,除非业务规模很小,项目也不大。

同样是选择 AI 方案,还不如先让 AI 把当前系统优化好。
Jun 11
Replied to a topic by addou 生活 家里有蛇,怎么办
最好确认是什么蛇,我之前在农村路骑车的时候碰到一条好大的蛇,作死上去拍了点视频,发群里了才知道是剧毒的银环蛇
About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   3994 Online   Highest 6679   ·     Select Language
创意工作者们的社区
World is powered by solitude
VERSION: 3.9.8.5 · 15ms · UTC 00:09 · PVG 08:09 · LAX 17:09 · JFK 20:09
♥ Do have faith in what you're doing.