想知道小模型训练、蒸馏、微调门槛高吗? 端侧模型的训练、微调、蒸馏门槛高吗? 端侧模型在推理上现在最大的障碍是什么呢?
简单描述一个我的判断,针对很对垂直细分领域的模型训练、微调、蒸馏,以及端侧模型的推理应该会有很多真实场景。
也就是说,对于一个业务主导的团队,怎么在没有专业模型训练方面的沉淀,就可以快速上手做自己的小模型。 如果从技术上能打通这个环节,会不会能踩中未来的一个方向呢?
想知道小模型训练、蒸馏、微调门槛高吗? 端侧模型的训练、微调、蒸馏门槛高吗? 端侧模型在推理上现在最大的障碍是什么呢?
简单描述一个我的判断,针对很对垂直细分领域的模型训练、微调、蒸馏,以及端侧模型的推理应该会有很多真实场景。
也就是说,对于一个业务主导的团队,怎么在没有专业模型训练方面的沉淀,就可以快速上手做自己的小模型。 如果从技术上能打通这个环节,会不会能踩中未来的一个方向呢?
1
zhouhuade 18h 53m ago
运行在端侧的门槛是端侧的算力吧
|
2
justNoBody 18h 52m ago
这玩意儿就像 java ,一开始容易,越做越难
|
4
qwzhang01 OP @justNoBody 如果有门槛,那就可以做做试试喽,万一中了就不用担心下一阶段的工作了 -_-
|
5
qwzhang01 OP 现在都在做 agent ,做 tool 治理,做 memory ,做沙箱,RAG,这些技术适合现有的软件工程范式出来的同学。
如果把这些能力打包成一个个垂直的小模型,会不会现在研究的很多 memory 的技术就不需要了呢? 纯粹脑暴,最近想创业快想疯了,想找切入点-_- |
6
Haku 18h 34m ago
算力费用高,而且难,很多地方难以量化效果。
算力是最大的门槛,蒸馏的话,如果是参数蒸馏那一个大模型跑起来当专家模型就会要了算力的命,就算是通过 API 形式做 SFT 后训练,token 费用也是个人难以负担得起的开销。 |
7
XuDongJianSama 18h 9m ago 不要端侧,真好用的话不就被偷了吗。就算自己训练,也租服务器走云端。成本问题的话,如果能力够强成本就不是问题。如果能力不行成本再低也没人用
|
8
catinsides 18h 9m ago
以后大模型上下文长度会越来越大,如果把垂直领域的知识都当做系统提示词一开始就放到上下文中,是不是也不需要做微调了
|
9
Jinnrry 17h 24m ago via iPhone
gpu 已经够用了???你特码在逗我?你连内存和发热问题都不知道,你敢说你 gpu 够用了?你不会以为有两张 5090 就能开始蒸馏训练了吧?
|
10
clemente 17h 0m ago
是推理部署技术栈和资源需求的 3 倍以上
因为反向算子+前向算子+分布式通信库 的算子数 是推理的三倍 这是数字上的对比 |
11
clemente 17h 0m ago
蒸馏其实就是扫 qa 数据然后做后训练
|
12
clemente 16h 59m ago
gpu 也是推理一个同规模模型需求的三倍以上
|
14
COW 16h 57m ago
不训练,直接下载现成的,等出新的了再下载,就跟客户说更新版本了
|
15
zhangli2946 16h 56m ago
一如 自建机房和购买云服务
|
16
clemente 16h 52m ago
1. 模型训练包含前向算子、反向算子以及分布式通信开销,算子数量是推理的 3 倍以上,对应的技术栈与资源需求也高于推理部署。
2. 工程落地里很多蒸馏方案,本质就是遍历 高质量的领先模型的问题回答数据,对基模做后训练。 3. 同规模模型训练所需 GPU 资源远超推理。通常要 8 卡 x16 集群来训练 4. 修正:实际差距可达十几倍。因为线上推理普遍使用量化模型,而训练需要维持 BF16 精度。 |
17
scegg 16h 49m ago
先去电脑城看看现在硬件,尤其是显卡的价格,就知道 GPU 是不是够用。
|
18
coefu 16h 36m ago
"简单描述一个我的判断,针对很对垂直细分领域的模型训练、微调、蒸馏,以及端侧模型的推理应该会有很多真实场景。"
你这个判断不成立,over 。 你先搞清楚参数和智能的关系先,在 ANN 基础上的泛 transformer/mamba 架构,都是一份参数一份智能。端侧参数少,有个毛的场景,你不会以为像 shell 的命令 拼出 shell 脚本 一样,能把多个小参数 搭积木搭出大效果?不存在的。 |
20
xiaohuangya 15h 54m ago
小模型的微调、训练并不难,但是没有办法做到比现有的模型效果更好,这点很重要,在这种情况下很难有客户买单。除非只是自己业务上用,简单的业务用小模型来进行处理,复杂的业务小模型就是没办法。
|
21
iyaozhen 15h 41m ago
"会不会能踩中未来的一个方向呢" 你要是这个目的感觉有点难,你这啥也不知道,纯脑补呀
|
22
NullIsLife PRO 用大模型能解决你的问题吗,如果不能 小模型应该也解决不了
如果能解决,训练小模型 + 部署推理,成本也不低,如果你量不大可能更贵 |
23
wersero 15h 8m ago
有 ai 的帮助,其实还好吧
|
24
zhanying 14h 32m ago
当你问出这个问题的时候,就已经很难了。。。
|
25
dacapoday 13h 52m ago
应该挺高的, 腾讯换人后, 混元跑分就上来了. 换上的是来自 openAI 的人才, 淘汰的是本土瞎琢磨的.
|
26
jtjing 13h 31m ago
如果是做蒸馏感觉成本比较低,我自己通过蒸馏的方式训练了一个浏览器能够运行的小模型,然后产品化了。
https://v2ex.com/t/1244719?p=1#reply13 可以看看我的这个帖子。 训练环境: 阿里云租了一个 gpu 显卡,然后准备了不到百万条数据。总花费不到 100 元。 因为你不是从头训练一个模型,肯定是基于一个小模型开始训练,所以收敛速度非常快的。不需要海量的数据。 可以跳到我帖子里面的产品试用一下,效果还是可以的。 |