




资源介绍
视频数量:19个
总时长:1小时15分
课程介绍:
监督式机器学习解析:五大核心模型精讲
你有没有过这样的经历:打开一篇机器学习文章,满眼都是公式和术语,还没读几段就已经头昏脑涨了。那些解释要么默认你已经是个数据科学家,要么进度快得让人根本跟不上,结果就是越看越迷茫,最后干脆放弃了。
这门课就是来解决这个问题的。
它不玩虚的,不堆砌那些高大上的名词,就是实打实地从零开始讲。需要的门槛也很低:你只要懂点基础数学,比如怎么看图表、知道平均值是什么、明白函数的基本概念,再加上能读懂简单的Python代码就够了。不需要你是程序员,也不需要你懂什么高深的数学理论。
整个课程一个多小时,带你把监督式机器学习最核心的东西摸个遍。
先说说什么叫“机器真的在学习”。你以为教机器下棋、让它识别图片就是学习?没那么简单。课程会用二手车价格预测这样具体的例子告诉你,当一个模型说它在“学习”的时候,到底发生了什么。什么叫做特征,什么叫做标签,什么叫做训练集和测试集,为什么要分成两批数据而不是把所有数据都喂给模型。这些听起来基础,但真正搞清楚这些概念,你才能理解后面所有的东西。
五大模型一个个讲。
第一个是线性回归,用来预测数字的。比如告诉你一辆车开了多少年、跑了多少公里,预测它现在值多少钱。这种预测连续数值的问题就用它。课程会讲到损失函数,就是拿均方误差来衡量模型的预测到底有多不靠谱。但这里有个坑:很多初学者以为模型的损失越来越小就代表越来越准,其实不一定。课程专门用一整节讲过拟合和欠拟合,告诉你为什么模型在训练数据上表现好不代表它真的学会了,怎么区分它是真的掌握了规律还是在死记硬背。
第二个模型是逻辑回归。注意这个名字里有“回归”,但它不是用来预测数字的,它是用来分类的。比如判断一封邮件是不是垃圾邮件,一笔交易是不是欺诈。模型输出的不再是42这样的数值,而是一个概率,告诉你这件事有几分可能是真的。这里涉及决策阈值的概念,就是概率高到什么程度我们就认定它属于某个类别。还会讲到混淆矩阵和各种分类评估指标,告诉你为什么准确率有时候会骗人。
第三个模型叫k近邻,简称KNN。它的思路特别直观:想知道一个新东西属于哪类,就去看看和它最像的那几个邻居是什么类别。这个“像”到底怎么衡量,课程会讲到距离的概念。但有个问题你必须面对:到底选几个邻居才合适?选得太少容易以偏概全,选得太多又会把不相干的东西也算进去。而且KNN对数据的尺度特别敏感,一辆车的价格可能是几万块,里程数可能是几万公里,这两个数字差着好几个数量级,不处理好的话模型就会出问题。所以特征缩放这一块也讲得很细。
第四个模型是决策树。它的工作方式就像你在做选择题一样,根据一系列问题一步步缩小范围,最后得出结论。课程会讲怎么让模型学会问出最有效的问题,但这里也有讲究:树长得太深,模型就会钻牛角尖,在训练数据上表现完美却处理不了新数据;树太浅,又太笼统,什么都预测不准。课程会讨论如何平衡这个问题,还有交叉验证这个强有力的工具,帮你测试模型的稳定性。
第五个模型是随机森林。它其实是很多棵决策树组合在一起,每棵树独立判断,最后投票决定结果。单打独斗容易出错,但一群树集体决策就能把偏差和方差控制在一个更合理的位置。这个模型在实际工作中用得特别广泛,学完你会明白为什么。
整门课没有止步于讲概念,每个模型都配了Jupyter Notebook让你动手操作。二手车数据集、欺诈检测、邮件分类,这些真实的场景贯穿始终。你不只是被动地看视频听讲解,而是真的去跑代码、去调参数、去感受模型到底是怎么工作的。
学完之后你会得到几样东西:你脑子里有了一张地图,知道监督式学习整体是怎么运转的;你掌握了5个最常用的机器学习模型,知道什么时候该用哪一个;你学会了像构建模型的人那样思考,理解了模型为什么会出错、出错了该怎么调。
整个学习过程不需要花太长时间,一个多小时的视频,内容紧凑不灌水。如果你想踏入机器学习这个领域,又被之前的各种教程劝退过,这门课值得你给自己一个机会。