Java后端
·04-01 23:48Day 1
✅ 今天做了:
1.初步建立了机器学习与深度学习的理论基础
主要有下面内容:
机器学习三大方式(监督学习,半监督学习,无监督学习)
感知机-》神经网络-》深度神经网络 神经元与激活函数 前向传播与反向传播
CNN 卷积 池化 cnn经典结构 (图像处理)
RNN(序列处理) 因为记忆力问题 使用LSTM(长短期记忆网络)
最终为了解决长距离依赖问题 使用Transformer(自注意力机制)
2.初步了解了Transformer架构
注意力机制(self-attention)
多头注意力(multi-head attention)
位置编码(positional encoding)
前馈神经网络(feed-forward neural network)
残差连接(residual connection)
层归一化(layer normalization)
Transformer 最底层还是拆分处理:将注意力拆分,将特征向量拆分,将信息拆分。当然拆分只是过程,真正的目的是解耦理解与生成 。 从而实现了并行计算、长序列建模和通用任务适配。
3.大模型与前沿技术
大模型四大特点:1.涌现性 2.通用性和泛化性 3.海量训练数据 4.参数规模巨大
核心要素:数据 算例 算法 发展阶段:1.知识驱动 2.推理驱动
大模型训练的三阶段:1.预训练(最费钱) 2.指令微调(听人话) 3.后训练(RLHF 基于人类反馈的深度学习)
稀疏注意力:适当的偷懒有时候更有效
三种偷懒策略:1.局部注意力 2.全局注意力 3.随机注意力
Longformer BigBird 这些技术正是当前大模型超长上下文的基石
混合专家模型(MoE) 术业有专攻
MoE替换了Transformer中的前馈网络(FFN) 使得总参数 != 每次计算使用的实际参数
典型代表:deepseek
模型压缩与加速:量化与蒸馏
4.提示词工程
这个属于是老生常谈了,主要就以下内容:
警惕模型幻觉,事实性内容要交叉验证
提示词追求有效信息密度,不是越长越好
好提示词是迭代出来的,别指望一步到位
⏰ 明天计划:
📚 今日感悟:
事物的发展都是螺旋上升的,有些在但是看是局部不可选项,但随着时代的发展,会发现它其实是全局最优解的一部分。比如符号主义与联结主义的,现在看来,两者其实是相辅相成的。
2
1
分享
操作
评论
问答助学
相关内容
0个评论
全部评论
点击登录,快来和大家讨论吧~
表情
图片
暂无评论
