







资源介绍
全面覆盖数据工程核心知识与实践技能的课程,旨在帮助学习者从零基础成长为具备实战能力的数据工程师。课程涵盖基础理论、主流工具与技术栈、实战项目演练及进阶应用,通过系统模块与学习路径,让学习者掌握关键技能。
一、课程基础与概述(第 1 - 9 讲)
课程开篇构建知识框架:
导论与定位(第 1 - 3 讲):解析数据工程定义、工程师职责及行业作用。
前置准备与环境搭建(第 4 - 8 讲):介绍 Python、SQL 等基础知识,配置 Virtualenv、Docker 环境,提供源码获取方式。
学习规划(第 9 讲):梳理课程结构与学习路径。
二、Apache Spark 核心技术(第 10 - 35 讲)
Apache Spark 是重点内容:
基础与原理(第 10 - 11 讲):讲解 Spark 优势、工作原理及核心组件。
实战入门(第 12 - 14 讲):指导环境搭建,入门应用编写与基础函数练习。
DataFrames 与数据操作(第 13、15 - 29 讲):深入 DataFrames 操作,涵盖聚合、连接、UDF 开发及作业优化。
进阶与生态工具(第 30 - 35 讲):介绍作业提交、Spark Streaming、Spark SQL 及进阶应用。
三、数据湖与云存储(第 36 - 50 讲)
结合 AWS 讲解数据湖:
基础(第 36 - 37 讲):解析数据湖定义、优势及适用场景。
AWS 云服务集成(第 38 - 49 讲):介绍 Amazon S3、EMR Serverless 及 Parquet 格式应用。
总结与实战(第 50 讲):回顾关键步骤与工具协同使用。
四、工作流调度与数据管道(第 51 - 74 讲)
Apache Airflow 是数据管道调度重点:
基础(第 51 - 53 讲):介绍功能与架构。
实战(第 54 - 73 讲):指导安装与 DAG 编写,讲解任务处理及 Spark 集成。
进阶与总结(第 74 讲):介绍复杂 DAG 设计与应用场景。
五、机器学习与数据工程集成(第 75 - 98 讲)
结合数据工程与机器学习:
基础(第 75 - 77 讲):解析机器学习定义与回归算法。
模型开发与评估(第 78 - 88 讲):指导模型构建与评估,讲解 Pipeline 应用。
分类算法与模型优化(第 89 - 96 讲):介绍分类算法与超参数调优。
深度学习与总结(第 97 - 98 讲):介绍深度学习基础与技术结合点。
六、自然语言处理与大语言模型(第 99 - 109 讲)
讲解 NLP 与 LLM 应用:
NLP 基础(第 99 - 100 讲):介绍 NLP 技术与 Transformer 架构。
LLM 与工具链(第 101 - 108 讲):讲解 LLM 类型与工具使用,展示文本处理案例。
总结(第 109 讲):回顾核心知识点与工程师角色。
七、流处理与 Apache Kafka(第 110 - 133 讲)
深入讲解 Kafka:
基础(第 110 - 114 讲):介绍核心概念与架构。
实战(第 115 - 129 讲):指导环境搭建与数据读写,讲解核心机制与工具使用。
进阶与练习(第 130 - 133 讲):介绍分层存储与流处理案例。
八、Apache Flink 流处理(第 134 - 152 讲)
聚焦 Flink 实时计算:
基础(第 134 - 135 讲):介绍优势与与 Spark Streaming 区别。
实战(第 136 - 151 讲):讲解与 Kafka 集成及高级操作。
总结(第 152 讲):回顾特性与适用场景。
九、课程总结(第 153 讲)
回顾核心技术栈协同应用,探讨职业发展路径与学习资源。
课程特点
实战导向:含大量练习与解决方案。
技术全面:覆盖数据工程全领域技术。
循序渐进:适合零基础学习者。
紧跟趋势:纳入前沿技术。
通过本课程,学习者可掌握核心技能,胜任多岗位需求,为数据工作奠定基础。