05-25 17:41·Java后端- 04-01 23:48·Java后端查看全文Day 1 ✅ 今天做了: 1.初步建立了机器学习与深度学习的理论基础 主要有下面内容: 机器学习三大方式(监督学习,半监督学习,无监督学习)...加油鸭:感谢分享,@编程导航小智 帮忙总结一波~231分享
收到 offer 那天,我反而愣住了
Day3 今天学习内容如下,另外和一个老哥进行了mysql redis的模拟面试,效果挺好的,需要坚持。为什么我感觉ai面比开发面还耗大脑呢
打卡第二天
Day 1 ✅ 今天做了: 1.初步建立了机器学习与深度学习的理论基础 主要有下面内容: 机器学习三大方式(监督学习,半监督学习,无监督学习) 感知机-》神经网络-》深度神经网络 神经元与激活函数 前向传播与反向传播 CNN 卷积 池化 cnn经典结构 (图像处理) RNN(序列处理) 因为记忆力问题 使用LSTM(长短期记忆网络) 最终为了解决长距离依赖问题 使用Transformer(自注意力机制) 2.初步了解了Transformer架构 注意力机制(self-attention) 多头注意力(multi-head attention) 位置编码(positional encoding) 前馈神经网络(feed-forward neural network) 残差连接(residual connection) 层归一化(layer normalization) Transformer 最底层还是拆分处理:将注意力拆分,将特征向量拆分,将信息拆分。当然拆分只是过程,真正的目的是解耦理解与生成 。 从而实现了并行计算、长序列建模和通用任务适配。 3.大模型与前沿技术 大模型四大特点:1.涌现性 2.通用性和泛化性 3.海量训练数据 4.参数规模巨大 核心要素:数据 算例 算法 发展阶段:1.知识驱动 2.推理驱动 大模型训练的三阶段:1.预训练(最费钱) 2.指令微调(听人话) 3.后训练(RLHF 基于人类反馈的深度学习) 稀疏注意力:适当的偷懒有时候更有效 三种偷懒策略:1.局部注意力 2.全局注意力 3.随机注意力 Longformer BigBird 这些技术正是当前大模型超长上下文的基石 混合专家模型(MoE) 术业有专攻 MoE替换了Transformer中的前馈网络(FFN) 使得总参数 != 每次计算使用的实际参数 典型代表:deepseek 模型压缩与加速:量化与蒸馏 4.提示词工程 这个属于是老生常谈了,主要就以下内容: 警惕模型幻觉,事实性内容要交叉验证 提示词追求有效信息密度,不是越长越好 好提示词是迭代出来的,别指望一步到位 ⏰ 明天计划: 📚 今日感悟: 事物的发展都是螺旋上升的,有些在但是看是局部不可选项,但随着时代的发展,会发现它其实是全局最优解的一部分。比如符号主义与联结主义的,现在看来,两者其实是相辅相成的。
Day 1



