




资源介绍
视频数量:48个
总时长:5小时15分
课程介绍:
Spark与Databricks数据工程实战课
数据工程师的日常工作是什么样的?早上打开电脑,面对TB级别的业务数据,用SQL写几个查询,跑一个ETL管道,看着数据从原始文件变成可以被分析师直接使用的报表。听起来简单,但如果你用的是传统Hadoop生态,光是搭集群、配环境、写脚本,可能一周就过去了。这门课想解决的问题很直接:怎么用更现代、更高效的方式做数据工程。
一、Databricks平台入门与存储体系
课程从最基础的认知开始讲起。什么是数据工程?Spark到底是什么,它为什么能成为大数据处理的标配?Databricks这个平台又是干什么的,为什么这么多公司愿意为它买单?搞不清楚这些概念,后面学再多API也是空中楼阁。
学技术最怕上来就给你一堆命令让你敲。课程先带你注册Databricks免费版账号,一步步熟悉界面操作。然后你会接触到Databricks里几个核心的存储概念:DBFS是Databricks抽象出来的文件系统,像操作本地文件一样读写数据;Unity Catalog是元数据管理工具,可以统一管理表、文件和权限;Volumes专门用来存储图片、日志、CSV这类非结构化数据。
还有一个有意思的点:课程演示了怎么用Databricks自带的生成式AI来做数据转换和查询,甚至实现无代码的数据工程。哪怕你不太会写代码,借助AI辅助也能完成基本的数据处理任务,这对刚入门的朋友非常友好。
二、用PySpark和Scala做数据工程
熟悉了Databricks的基本操作,接下来进入Spark的核心世界。Spark的Transformations是惰性的,你定义了一堆操作但不会立即执行,只有碰到Action才会真正开始计算。理解这一点对写出高效Spark程序至关重要。课程用泰坦尼克数据集做练习,从过滤幸存者列表这个简单例子入手,带你理解整个数据管道的构建过程。
除了Python,课程还专门讲了Scala。Spark本身就是用Scala写的,很多企业级Databricks环境里Scala笔记本很常见。课程提供了一个Python和Scala的速成课程,半小时内掌握两门语言的基本语法差异。UDF(用户自定义函数)在内置函数满足不了需求时特别好用。Join操作部分也很扎实,从DataFrame API Join讲到Spark SQL Join,各种join类型都有覆盖。
三、Delta Lake与湖仓一体深度解析
这是课程最核心的部分。先讲清楚三个概念的区别:数据仓库查询快但贵且不灵活,数据湖便宜能存海量原始数据但查询慢,湖仓一体则把两者优势结合起来,既能存各种格式的数据,又能提供数据仓库级别的查询性能。Delta Lake就是实现湖仓一体的关键技术。
你会学到Delta Tables的各种高级特性。Time Travel可以查询表的历史版本,数据出错需要回滚时特别好用。缓存机制能加速查询,分区把数据按字段拆分减少扫描量,Z-ordering是数据聚类技术进一步优化性能。Databricks SQL和Spark SQL的区别也讲得很清楚,前者适合分析师,后者适合工程师,两者在实际项目里会频繁配合使用。
四、AWS上的Databricks实战
理论和本地实验做完,该上云了。课程教你注册AWS账号,在AWS上搭建Databricks环境,然后在云端运行笔记本。最有价值的是用Delta Live Tables构建ETL管道,这是Databricks的声明式ETL框架,你只需要定义数据从哪来、经过哪些转换、输出到哪,它自动帮你处理依赖关系、错误重试和数据质量检查。这代表了现代数据工程的一个重要方向,从命令式编程转向声明式编程。
五、AWS数据工程扩展实验
这部分是额外福利,几乎涵盖AWS数据工程的方方面面。IAM是AWS权限管理的基础。AWS Glue是托管的ETL服务,课程带你创建数据目录、用Glue跑ETL任务、用Athena查询S3数据。EventBridge监听各种AWS事件,Step Functions编排多个Lambda函数构建复杂工作流。课程演示了一个完整的端到端案例:用Glue做ETL、Lambda处理数据、EventBridge触发流程、Step Functions做整体编排,非常贴近真实的企业生产场景。
流式处理部分讲了Kinesis Data Streams,从CLI操作到Python Boto3编写生产者和消费者,最后模拟天气数据实时写入S3。Amazon EMR教你在EC2上跑Spark任务,适合想了解大数据集群底层的朋友。Redshift是AWS的数据仓库服务,演示了如何在S3数据上搭建数仓。最后的Glue DataBrew是一个可视化数据清洗工具,不写代码也能完成数据转换。
六、学完之后能做什么
学完这门课,你对现代数据工程的整体图景会有清晰的认识。你不仅掌握了Spark这个核心计算引擎,还学会了在Databricks平台上高效完成各种数据处理任务,更重要的是理解了湖仓一体这个正在改变数据行业的技术趋势。
对于想进入数据工程领域的朋友,这门课是个很好的起点。它不要求你有Python或Scala经验,从零开始一步步带你上手。对于已经在做数据工作但想了解云端现代数据栈的朋友,AWS部分能帮你快速了解生产环境的搭建方式。
数据工程需要不断学习,技术迭代很快。但只要掌握了核心概念和主流工具,你就能跟上节奏。从搭建第一个数据管道开始,到在AWS云端构建完整的ETL工作流,这门课会是你数据工程学习路上一个扎实的阶梯。