为什么大厂搞AI频频翻车,小公司反而能弯道超车?

人类辅助编程?

简单来说,有两套训练AI的方案:

  • 让他自己去试错,然后拿到了就有奖励,叫做无监督训练
  • 给他各种提示,让他在有经验的情况下去学习,叫做有监督训练

比如说:你拉过来一只猫,然后告诉AI:

  • 猫有胡须,有四条腿,有毛皮,会喵喵叫
  • 这是喵咪的声音
  • 这是喵咪的爪子图片
  • 这是喵咪的眼睛图片

然后喂给他数据,然后训练完成,拿出一只猫,问:请问他是猫的概率有多大??

而无监督训练:

  • 给他一大堆不知道是什么东西的数据,而且某些数据还是错的
  • 给他图片,图片里面是四个人和一只猫
  • 有的是猫和狗一起玩闹的图片
  • 有的是《猫和老鼠》动画片

让AI自己去猜测:哪些是杂音,哪些是真正要学到的东西。

或者:直接不管不顾,让他自生自灭,设置好奖励函数,然后循环训练次数。 给他非常长的轮次。

聊聊力大砖飞/精细训练

在这个情况下,有两个不同的流派:

  • 数量越大,规模越强,数据越多,AI的效果越好
  • 标注的越精细,数据质量越高,效果越好

至于谁对谁错,不知道。

训练失败/训练发散

而在训练模型的过程中,会出现训练失败的问题。

举个例子:

  • 给你一张答题卡,上面有1000道题,分别是ABCD
  • 让AI回答Ai答对了25个,而且全部选了D

这就是训练发散。

数据集中在一侧,给他的奖励函数失效。

AI投毒

Ai投毒的策略,就是在数据里面加料。

比如说,人们发现Ai在训练XX的时候效果非常差,会导致模型训练失败,效果变差。而且这些东西的权重非常非常高,一小块数据就能弄坏一大堆数据。

那太好了,我专门通过程序生成一大堆这样的数据,你要是敢爬我的数据,那你模型就完蛋了。

聊聊“概率模型”

有人认为,概率模型就是完全随机。

这个问题其实非常非常粗糙:

  • 通过上下文推导,其中50%返回A内容,30%返回B,那肯定返回A

所以说,如果你的上下文确定,参数确定,各种内容确定,AI返回的内容也是完全一致的。 这也是为什么,AI可以缓存。因为只要上下文是固定的,他的返回也是固定的。所以只需要查询一下用户询问的问题,就代表着命中缓存。

自动上下文注入

而在LLM运行的时候,为了让AI更智能,人们会用辅助编码或者其他方案,自动拼接上下文。但是这个内容是隐形的。

比如说,用户的注册名称叫做青碧凝霜

然后用户问:你好

提示词变成了:

  • 用户青碧凝霜在下午4:00进行的询问
  • 内容为:今天天气怎么样

Ai回答:青碧凝霜下午好

这也是cursor这种互联网公司的一个标准行为,他会把长上下文输入到提示词中。

  • 代码全文
  • 提示词,限制
  • 各种各样的查询信息

为什么CC启动的时候会烧token??

两个基本的策略:

  • 现在的策略提供商,都会提供缓存,而缓存命中就不会走复杂的AI推理逻辑
  • 而现在AI都是在启动的时候注入提示词

于是,CC等模型,在启动的时候会将所有的提示词先全量跑一遍。 这时候,用户会观察到:刚开始的时候,会有大量的token被消费。

CC底层模型为什么这么强?

不知道,因为不开源。

从推理上来说:

  • 他可能把参数堆到了百亿千亿级别
  • 可能底层多头策略做的非常激进
  • 可能内部有重试机制
  • 可能使用了大小模型混合编排

因为不开源,所以没有办法去抄。

而DS是完全开源的,我们聊一下DS的训练:

  • 数据量用的是精选数据,数据量大又质量高,力大砖飞的同时,还保证了训练质量
text
复制代码
1. 预训练阶段:数据与架构创新 海量高质量数据:V4系列在预训练数据量上实现了翻倍,消耗了超过32T到33T的高质量Token。在数据构成上,团队单独策划了长文档数据,优先收录科学论文和技术报告等具有学术价值的长材料。 混合注意力架构:为了支持高达百万(1M)Token的上下文长度并降低计算需求,V4采用了压缩稀疏注意力(CSA)和重度压缩注意力(HCA)的混合架构,并辅以滑动窗口注意力(Sliding Window Attention)来补偿近距离依赖。 Muon优化器:在训练中,DeepSeek摒弃了传统的AdamW,转而大规模使用基于矩阵正交化的Muon优化器。该优化器采用混合Newton-Schulz迭代(10步分两段),将梯度动量正交化,从而实现更快的收敛速度和更高的训练稳定性。 2. 训练稳定性与工程优化 流形约束超连接(mHC):为了解决大规模模型训练中的信号发散问题,DeepSeek引入了mHC技术。它通过将残差映射矩阵约束在双随机矩阵流形上,确保谱范数不超过1,从而保证信号在深层网络中的稳定传播。 应对Loss Spike的“土办法”:在训练万亿参数模型时,团队曾遇到严重的Loss Spike(损失突刺)问题。他们采用了Anticipatory Routing(预期路由)和SwiGLU Clamping(激活值钳制)等工程技巧来维持训练稳定,尽管其底层机理仍是一个开放性问题。 混合精度与硬件协同:训练采用了混合精度策略(专家层采用FP4精度,其余部分采用FP8),并且其架构设计已深度适配国产算力,例如在华为昇腾NPU平台上验证了细粒度专家并行(EP)方案。 3. 后训练阶段:On-Policy Distillation (OPD) DeepSeek在V4的后训练阶段进行了一次重大的方法论替换,用在线策略蒸馏(OPD)完全替代了传统的混合强化学习(Mixed RL)阶段。具体流程分为两步: 培养领域专家:针对数学、代码、Agent(智能体)、指令跟随四个特定领域,分别独立训练专家模型。每个领域先通过监督微调(SFT)打底,再使用GRPO(基于生成奖励的强化学习)进行领域专属强化学习。 统一模型蒸馏:通过On-Policy Distillation,让一个统一的学生模型向上述多个领域专家对齐。学生模型自己进行Rollout(生成),并通过最小化反向KL散度向对应领域的专家学习(例如数学任务向数学专家靠)。为了应对工程上“装不下”多个万亿级Teacher模型的问题,团队采用了权重按需加载和隐藏状态缓存等妥协方案。 4. 强化学习与推理模式 GRPO算法:在特定领域的强化学习中,DeepSeek引入了GRPO(Generative Reward Model),让Actor网络同时具备生成与评判能力,实现联合优化。 多档推理模式:为了适应不同复杂度的任务,V4引入了三档推理努力模式(Reasoning Effort Mode):Non-think(不思考)、Think High(深度思考)和 Think Max(极限思考),每档对应不同的输出长度和推理深度。

人话就是:缝合 + 自研。

为什么把AI训练称为炼丹??

大概几年前,我一直把ai称作炼丹。

举个例子:我有AB不同的药液。配置一款胶水。 那如何实现这个功能:

  • A配置1%,B配置99%
  • A配置2%,B配置98%

尝试100次,给出最优秀的配比结果。

这种就纯体力活,没有任何技术含量在。 大牛一个小时的产出,给一个实习生相同的工作时间,能产出0.9。

AI就是:

  • 有100种不同的方案
  • 每个方案都尝试一次

最后,人们发现:XX方案最好。

这就是AI炼丹。

经验公式

当人们通过炼丹发现了一个新的方案以后,人们对着目标画靶子。

  • 为什么这个好,原因是因为XXXX

当开一个新的AI模型训练的时候,自动使用这个参数、方案、意见。 至于为啥,没人能解释得清楚。 这就是经验公式。

在土木工程里面,有大量没有经过科学论证,但是通过炼丹获取的经验公式。 而且端端正正的写在大学的课程课本里面。

AI也有大量的经验公式、参数。

我把怎么训练的给你,只需要把参数一改,你就连训练都训练不出来。你怎么调整都调整不出来我这个效果。

在编程届,这个叫做成魔法值。

聊聊AI的问题

很多大厂都进行了AI尝试,但是大部分都失败了。

比如说微软他做了AI项目,但是效果那是相当不理想,市场反馈非常差,用户骂声一片。 至于为啥大家不知道:黄土都快埋了半截了。

而真正做Ai颇有规模的,就是小微公司。比如说cursor,市值才几亿美元。 微软万亿市值,搞AI也没用搞出什么花样来。反而让小微虾米公司骑在头上。

训练成本

训练AI,试错成本非常非常高昂。

  • 想要训练GPT5.0这种顶尖的大模型,全量训练一次已经几个亿了,而且可能是美元
0个评论
点击登录,快来和大家讨论吧~
表情
图片
暂无评论
青碧凝霜
下载 APP