




资源介绍
视频数量:51个
总时长:4小时44分
课程介绍:
房价预测实战:基于Spark的机器学习项目入门
想象这样一个画面:你打开一个房产网站,输入房子的面积、卧室数量、所在城区,几秒后系统告诉你这栋房子大概能卖多少钱。这不是什么玄学,背后跑的就是一个机器学习回归模型。你也想自己动手搭一个,却被铺天盖地的资料劝退:要么理论太重,学完照样无从下手;要么用的是玩具数据集,离真实工作场景差着十万八千里。这门课想解决的就是这种落差。它用一个真实的房地产销售数据集,带着你从零开始,搭建出能用的房价预测模型,全程用Apache Spark这套工业级的大数据处理框架来跑。
一、课程整体定位与项目概览:
这门课的设计思路很直接——不空谈理论,围绕一个真实完整的项目展开。学完之后你会得到什么?是用Spark MLlib构建出的第一个端到端机器学习项目经验。更具体地说:你会拿到真实的房屋销售数据,从里面探索规律、清洗数据、构造特征,然后训练回归模型,最后用模型去预测未上市房屋的价格区间。
课程的适用人群写得明白:数据工程或数据科学的初学者、希望获得Spark ML实战经验的学生,以及任何对Apache Zeppelin这个交互式笔记本工具好奇的人。零机器学习基础也能跟上,因为会从头讲起。
工具栈的选择也有讲究。主计算引擎用Apache Spark,机器学习库用Spark MLlib,编程语言既支持PySpark也支持Scala。交互式开发环境给了两套方案:本地用Apache Zeppelin,云端用Databricks社区版。这套组合在企业里相当常见,学完以后掌握的技能能直接迁移到工作中。
二、动手配置开发环境:
工具再好,装不上也是白搭。所以课程在环境搭建上花了相当篇幅,而且照顾了不同操作系统的同学。
第一部分讲解Java环境的安装配置。Spark跑在JVM之上,Java没装好后面什么都无从谈起。讲师会逐步演示,从下载安装包、设置JAVA_HOME和PATH变量,到在终端里验证环境是否生效。
然后是Apache Zeppelin的安装。Ubuntu用户会学到直接在Linux上下载二进制包、解压、配置、启动的全流程。Windows用户也不必担心,课程提供了完整方案——通过Docker Desktop把Zeppelin容器化运行,避免各种依赖冲突。
最后还要配置Spark解释器,让Zeppelin能识别并连接到Spark集群。这部分虽然步骤多但讲得细,每步都有对应的HTML文档可以下载查阅,照着做基本不会卡壳。
三、Zeppelin笔记本快速上手:
环境搭好了,该上手工具了。这一章先带你认识Apache Zeppelin是什么、它有哪些特性、为什么数据科学家青睐它。
Zeppelin最大的好处是一个笔记本搞定所有事:能写代码、能写文档、能做可视化。它对Spark的支持是原生的,特别适合做大数据的探索性分析。
讲师会带你认识Zeppelin的界面布局、讲解Markdown文本格式的用法、演示如何创建并运行一段代码段落。后面还有专门的可视化章节,教你用Zeppelin内置的图表功能,把数据变成表格、柱状图、饼图等直观图形。做数据分析最怕只看干巴巴的数字,有了可视化这一步,你对数据的感知会完全不同。
四、在Zeppelin里跑Spark:
学会了Zeppelin的基本操作,下一步是把它和Spark结合。这也是课程的重点之一——讲解Spark解释器的工作原理,教你在Zeppelin里直接写Spark代码。
这里会讲到RDD和DataFrame的区别与联系、怎样用Spark SQL查询数据、查询结果如何缓存以提升性能。你还会学到用Zeppelin把Spark的输出画成图表,以及基础的任务跟踪和性能调优思路。这些内容虽然不是大部头理论,但