机器学习
·2024-07-30# 机器学习打卡第3、第4天
昨天偷懒忘记来鱼皮这记录打卡了,这两天是数据一起补上
主线目标:了解文本分类任务
机器学习里,常用参数无论是运算还是干嘛基本输入的都是一堆数。
因为机器学习的模型接收参数是数学里的矩阵模型,计算机里叫张量。这个矩阵模型他只有数字。
那如果我希望正常的文本比如中文英文还是其他各种语言或者文字进行机器学习。就需要把原始的文字转换成一堆不知道什么以意的数值来进行计算。计算的场景很多样。
举一个常见的例子,我有一个售后平台,每天接收一堆客户的问题。
(我想对我客户的问题进行内容分类,简单分类就是有,骂人的和正常问题投诉的,我想标识出我客户的垃圾话)
测试样本收集:客户描述的问题就是我机器学习输入进来的原始数据。
代码模型设计:
1.有个接收样本的参数
2.样本输入后,进入机器学习层。
3.初始化样本,把文本数据初始化成张量数据
4.对应展示成张量的数据根据传入池化层,向外甩个口子可调用传入文本的长度。
5.走线性层开进行机器学习类的模块。
5.1.补充一个预测值模块,如果没有真实值传入的时候你预测的值是根据什么玩意算的。
6.类里定义词表,词表里的参数和传入参数进行比对然后打标签。我搞得很简单,标签就0,1那种。(有垃圾话的1,没有的0)
7.带标签的数出来之后,直接把这堆语言参数的数值范围控制一下。
8.把这些计算过的值给loss函数,loss函数拿预测值和你真实算出来的值比较一下,返回一个引导你变得梯度的方向数据。
9.根据loss值的大小,机器根据优化器的函数公式自发去调整方向。
(这个地方有点抽象,我现在大概理解的是比如我输入的是“爱情事业双丰收”之类的,机器根据情事俩字认为h然后给标注了脏话之类的,通过优化器优化过几次之后他能根据语境判断出我这句话不是脏话的一个抽象概念)
大概这两天就了解了点这个,说实话别看写逻辑好像没啥问题,python代码一写就死。刚意识到自己根本不熟悉高阶函数调用。明天在继续补课吧。
改了整一天了,还在改。上面的描述内容要是逻辑写的有问题的话,也欢迎指正。
(未完待续·······)
2
0
分享
操作
评论
问答助学
相关内容
0个评论
全部评论
点击登录,快来和大家讨论吧~
表情
图片
暂无评论
