V2EX = way to explore
V2EX 是一个关于分享和探索的地方
Sign Up Now
For Existing Member  Sign In
V2EX  ›  coefu  ›  全部回复第 1 页 / 共 69 页
回复总数  1378
1  2  3  4  5  6  7  8  9  10 ... 69  
3 小时 17 分钟前
回复了 matters 创建的主题 程序员 Tick 数据和 K 线数据到底差在哪里?
🦀,bro ,你知道多大的盘子才需要 T+1 的 tick 吗?

tick 级别,光存,然后抽,算,没有四分之一个数据中心,起码 20 个柜子的 资源,都不用想。
2 天前
回复了 javalaw2010 创建的主题 职场话题 打算开个舞蹈工作室了
@dododook 羡慕+1
2 天前
回复了 siriusliangcn 创建的主题 程序员 又是一个新的时代
浏览器书签页里十几年的链接,现在也删了。
讲真,你的策略在标准的 OHLCV 里,摸不到这部分的变化,是你自己实力的问题。
@diudiuu 这是大的趋势,就像潮水一样,有涨有落。父母辈还经历 98 下岗潮呢,心态要乐观。
@diudiuu 因为我也经历过,我懂个中滋味。
@diudiuu 🦀,bro ,被开不是结束,是另一种可能的开始。
3 天前
回复了 HetFrame 创建的主题 生活 父母六十了,找不到活干怎么办
作为娘家人的你,就不够硬,但凡你硬一点,你姐要是吃一点亏,你过去凑他一顿,就不会这样。
@diudiuu 哈?时常登陆了来吹水啊。
input/output 才占了单轮 token 量多少,你要关 cot ,cot 产生了那么多 token ,那都是钱啊,cot 才是他们赚钱的大头,厂商会让你砍它收入?
3 天前
回复了 codingerj 创建的主题 职场话题 从未有过的失业危机袭来了,怎么办
典型的 泡沫巅峰进场的,以为世界会一直按照巅峰状态运行。

200x 年代进场,就知道,这 20 年,一直都在变。很多岗位都是从无到有再到无。

以前一个领域没有专人,到巅峰期一个领域细分子领域,子领域出现专职专岗。但是这个专职专岗的存在是依赖于经济环境的;经济环境好企业赚钱了,肯花钱专人专职的把事情做到极致;经济环境下行,赚不到钱了,就得又回到一人身兼多职的情况。
200x 年代,web1.0 ~ 1.5 时代,页面都是后端动态生成的,还没有专职前端,就不用提前端领域细分的那么多技能树。运维都是技术人员兼任。移动端,还是硅谷大厂里的技术人员的尝试。
201x 年代,经济上行,技术蓬勃发展,才有了后面的局面。
202x 年代,LLM coder 动态发展,取缔过去的事物,诞生新的事物,这是太正常不过的。

这就是 道德经里的道可道,非可道,天道循环。不能适应变化,就要被淘汰。
吃力是正常的,吃力久了,就提升了。
4 天前
回复了 zzutmebwd 创建的主题 Local LLM pro6000 部署 Qwen 3.8 flash next nvfp4
@klc 有没有一种可能,你说的这些我都尝试过,或者你不知道的,我也尝试过。😂
@atreus1891832889 🦀,bro 。

你去看李沐之前在上海交大的演讲,他这个水平,也无法预测 5 年,都是看 2 ~ 3 年。大家都一样的,做好眼前的事,走一步看一步。没什么可焦虑的,饭照吃,妞儿照泡,游戏照打。
@klc 🦀,bro 。

我们不在一个频道上。

“比较好奇这个档次的本地智力是属于在原有的应用能力上“聊胜于无,锦上添花”还是发挥了核心的作用。”

我是这个观点的频道上。

GPQA Diamond ,qwen3.5 9B 81.7 。了解一下这个数据集就知道;人类表现:领域人类专家的平均准确率约为 65%,非专家(即使拥有完全的网络访问权限)平均准确率仅为 34% 左右。这里有几个是这 1/34% ?
4 天前
回复了 zzutmebwd 创建的主题 Local LLM pro6000 部署 Qwen 3.8 flash next nvfp4
@catazshadow 我设备不支持 vllm 。只有 llama.cpp 。开 MTP 一样。

你到 200k context 的时候 ,decode 还有多少?如果不用 Q8 的 kvcache ,最早的一些概念,估计它会忘记。
@dakang1 关了记忆好,虽然还是会被收集了做训练。起码不存在一个更了解自己的并不在自己掌控范围内的 ai ,后续让他们做精准广告的成本都提升一点。
4 天前
回复了 coefu 创建的主题 Local LLM mac ultra deepseek harness & qwen3.8-27B 几点经验
muse glimmer 30B Q8 kvcache Q8 ,最新的 llama.cpp 支持 context shift, flash attention 。

极致的内存效率:
通过 -ctk q8_0 -ctv q8_0 ,整整 524K ( 2 个 Slot 各 262K )的 KV Cache 居然只占用了 3.78 GB 显存( 3,536 MiB + 248 MiB )!如果换成 FP16 ,光是 KV Cache 就会暴涨到 15 GB+。

长上下文 Prefill 极速提升:
-fa 1 成功开启后,处理几万到几十万 Token 的超长 Prompt 时,Prefill (首包延迟)速度和内存带宽压力会得到数倍的改善。

Context Shift:llama-server 会自动剔除最早的旧对话 Token ,并将 KV Cache 中的数据整体向前平移,保留初始的 System Prompt (系统提示词)和最新的上下文,无需重新计算全量 KV Cache 。
设置 --keep -1:这意味着服务器会自动识别并完整保留初始化输入的 System Prompt ,只对后面的 User/Assistant 历史对话进行平移和丢弃。

比较癫狂。😂
4 天前
回复了 zhangli2946 创建的主题 程序员 面对越来越贵的 token 我们能做什么
如果厂商为了性能更好,都搞隐式推理,显式的 token 生成就会大大降低量。不过订阅就要从纯 token 模式,换花样了,毕竟在他们模型里多跑几趟,那也是耗算力更多。

只要还用厂商 api ,那么就是砧板上鱼肉。
1  2  3  4  5  6  7  8  9  10 ... 69  
About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Privacy   ·   Solana   ·   916 Online   Highest 6679   ·     Select Language
创意工作者们的社区
World is powered by solitude
VERSION: 3.9.8.5 · 27ms · UTC 20:00 · PVG 04:00 · LAX 13:00 · JFK 16:00
♥ Do have faith in what you're doing.