为什么大厂搞AI频频翻车,小公司反而能弯道超车?
人类辅助编程?
简单来说,有两套训练AI的方案:
- 让他自己去试错,然后拿到了就有奖励,叫做无监督训练
- 给他各种提示,让他在有经验的情况下去学习,叫做有监督训练
比如说:你拉过来一只猫,然后告诉AI:
- 猫有胡须,有四条腿,有毛皮,会喵喵叫
- 这是喵咪的声音
- 这是喵咪的爪子图片
- 这是喵咪的眼睛图片
然后喂给他数据,然后训练完成,拿出一只猫,问:请问他是猫的概率有多大??
而无监督训练:
- 给他一大堆不知道是什么东西的数据,而且某些数据还是错的
- 给他图片,图片里面是四个人和一只猫
- 有的是猫和狗一起玩闹的图片
- 有的是《猫和老鼠》动画片
让AI自己去猜测:哪些是杂音,哪些是真正要学到的东西。
或者:直接不管不顾,让他自生自灭,设置好奖励函数,然后循环训练次数。 给他非常长的轮次。
聊聊力大砖飞/精细训练
在这个情况下,有两个不同的流派:
- 数量越大,规模越强,数据越多,AI的效果越好
- 标注的越精细,数据质量越高,效果越好
至于谁对谁错,不知道。
训练失败/训练发散
而在训练模型的过程中,会出现训练失败的问题。
举个例子:
- 给你一张答题卡,上面有1000道题,分别是ABCD
- 让AI回答Ai答对了25个,而且全部选了D
这就是训练发散。
数据集中在一侧,给他的奖励函数失效。
AI投毒
Ai投毒的策略,就是在数据里面加料。
比如说,人们发现Ai在训练XX的时候效果非常差,会导致模型训练失败,效果变差。而且这些东西的权重非常非常高,一小块数据就能弄坏一大堆数据。
那太好了,我专门通过程序生成一大堆这样的数据,你要是敢爬我的数据,那你模型就完蛋了。
聊聊“概率模型”
有人认为,概率模型就是完全随机。
这个问题其实非常非常粗糙:
- 通过上下文推导,其中50%返回A内容,30%返回B,那肯定返回A
所以说,如果你的上下文确定,参数确定,各种内容确定,AI返回的内容也是完全一致的。 这也是为什么,AI可以缓存。因为只要上下文是固定的,他的返回也是固定的。所以只需要查询一下用户询问的问题,就代表着命中缓存。
自动上下文注入
而在LLM运行的时候,为了让AI更智能,人们会用辅助编码或者其他方案,自动拼接上下文。但是这个内容是隐形的。
比如说,用户的注册名称叫做青碧凝霜
然后用户问:你好
提示词变成了:
- 用户青碧凝霜在下午4:00进行的询问
- 内容为:今天天气怎么样
Ai回答:青碧凝霜下午好
这也是cursor这种互联网公司的一个标准行为,他会把长上下文输入到提示词中。
- 代码全文
- 提示词,限制
- 各种各样的查询信息
为什么CC启动的时候会烧token??
两个基本的策略:
- 现在的策略提供商,都会提供缓存,而缓存命中就不会走复杂的AI推理逻辑
- 而现在AI都是在启动的时候注入提示词
于是,CC等模型,在启动的时候会将所有的提示词先全量跑一遍。 这时候,用户会观察到:刚开始的时候,会有大量的token被消费。
CC底层模型为什么这么强?
不知道,因为不开源。
从推理上来说:
- 他可能把参数堆到了百亿千亿级别
- 可能底层多头策略做的非常激进
- 可能内部有重试机制
- 可能使用了大小模型混合编排
因为不开源,所以没有办法去抄。
而DS是完全开源的,我们聊一下DS的训练:
- 数据量用的是精选数据,数据量大又质量高,力大砖飞的同时,还保证了训练质量
▼text复制代码1. 预训练阶段:数据与架构创新 海量高质量数据:V4系列在预训练数据量上实现了翻倍,消耗了超过32T到33T的高质量Token。在数据构成上,团队单独策划了长文档数据,优先收录科学论文和技术报告等具有学术价值的长材料。 混合注意力架构:为了支持高达百万(1M)Token的上下文长度并降低计算需求,V4采用了压缩稀疏注意力(CSA)和重度压缩注意力(HCA)的混合架构,并辅以滑动窗口注意力(Sliding Window Attention)来补偿近距离依赖。 Muon优化器:在训练中,DeepSeek摒弃了传统的AdamW,转而大规模使用基于矩阵正交化的Muon优化器。该优化器采用混合Newton-Schulz迭代(10步分两段),将梯度动量正交化,从而实现更快的收敛速度和更高的训练稳定性。 2. 训练稳定性与工程优化 流形约束超连接(mHC):为了解决大规模模型训练中的信号发散问题,DeepSeek引入了mHC技术。它通过将残差映射矩阵约束在双随机矩阵流形上,确保谱范数不超过1,从而保证信号在深层网络中的稳定传播。 应对Loss Spike的“土办法”:在训练万亿参数模型时,团队曾遇到严重的Loss Spike(损失突刺)问题。他们采用了Anticipatory Routing(预期路由)和SwiGLU Clamping(激活值钳制)等工程技巧来维持训练稳定,尽管其底层机理仍是一个开放性问题。 混合精度与硬件协同:训练采用了混合精度策略(专家层采用FP4精度,其余部分采用FP8),并且其架构设计已深度适配国产算力,例如在华为昇腾NPU平台上验证了细粒度专家并行(EP)方案。 3. 后训练阶段:On-Policy Distillation (OPD) DeepSeek在V4的后训练阶段进行了一次重大的方法论替换,用在线策略蒸馏(OPD)完全替代了传统的混合强化学习(Mixed RL)阶段。具体流程分为两步: 培养领域专家:针对数学、代码、Agent(智能体)、指令跟随四个特定领域,分别独立训练专家模型。每个领域先通过监督微调(SFT)打底,再使用GRPO(基于生成奖励的强化学习)进行领域专属强化学习。 统一模型蒸馏:通过On-Policy Distillation,让一个统一的学生模型向上述多个领域专家对齐。学生模型自己进行Rollout(生成),并通过最小化反向KL散度向对应领域的专家学习(例如数学任务向数学专家靠)。为了应对工程上“装不下”多个万亿级Teacher模型的问题,团队采用了权重按需加载和隐藏状态缓存等妥协方案。 4. 强化学习与推理模式 GRPO算法:在特定领域的强化学习中,DeepSeek引入了GRPO(Generative Reward Model),让Actor网络同时具备生成与评判能力,实现联合优化。 多档推理模式:为了适应不同复杂度的任务,V4引入了三档推理努力模式(Reasoning Effort Mode):Non-think(不思考)、Think High(深度思考)和 Think Max(极限思考),每档对应不同的输出长度和推理深度。
人话就是:缝合 + 自研。
为什么把AI训练称为炼丹??
大概几年前,我一直把ai称作炼丹。
举个例子:我有AB不同的药液。配置一款胶水。 那如何实现这个功能:
- A配置1%,B配置99%
- A配置2%,B配置98%
尝试100次,给出最优秀的配比结果。
这种就纯体力活,没有任何技术含量在。 大牛一个小时的产出,给一个实习生相同的工作时间,能产出0.9。
AI就是:
- 有100种不同的方案
- 每个方案都尝试一次
最后,人们发现:XX方案最好。
这就是AI炼丹。
经验公式
当人们通过炼丹发现了一个新的方案以后,人们对着目标画靶子。
- 为什么这个好,原因是因为XXXX
当开一个新的AI模型训练的时候,自动使用这个参数、方案、意见。 至于为啥,没人能解释得清楚。 这就是经验公式。
在土木工程里面,有大量没有经过科学论证,但是通过炼丹获取的经验公式。 而且端端正正的写在大学的课程课本里面。
AI也有大量的经验公式、参数。
我把怎么训练的给你,只需要把参数一改,你就连训练都训练不出来。你怎么调整都调整不出来我这个效果。
在编程届,这个叫做成魔法值。
聊聊AI的问题
很多大厂都进行了AI尝试,但是大部分都失败了。
比如说微软他做了AI项目,但是效果那是相当不理想,市场反馈非常差,用户骂声一片。 至于为啥大家不知道:黄土都快埋了半截了。
而真正做Ai颇有规模的,就是小微公司。比如说cursor,市值才几亿美元。 微软万亿市值,搞AI也没用搞出什么花样来。反而让小微虾米公司骑在头上。
训练成本
训练AI,试错成本非常非常高昂。
- 想要训练GPT5.0这种顶尖的大模型,全量训练一次已经几个亿了,而且可能是美元
