视频课程 编程

SQL数据工程实战——真实业务数据管道与企业级应用 (英文课程中文字幕)

¥5.00 已售 0
✓ 自动发货 ✓ 永久有效 ✓ 售后保障

资源介绍

视频数量:36个 总时长:2小时42分 课程介绍: SQL数据工程实战——真实业务数据管道与企业级应用 你有没有遇到过这种情况:花了好几天学完一本SQL教程,SELECT、JOIN、GROUP BY都能写出来,面试题也刷了不少,但一坐到工位上,打开公司真实的数据库,面对那张有几百万行的客户订单表,突然就不知道该从哪下手了。 这几乎是每个数据岗位新人都踩过的坑。学校和大多数在线课程教的是"查询SQL",但企业里真正用的SQL,是用来搭建数据管道的。课程导师Rahul在生产环境里用SQL干了十多年,他很清楚学校里教的东西和真实工作之间那道鸿沟到底有多宽。这门课想解决的就是这个问题。 一、开发环境搭建与分层架构 课程一开始会帮你理解,为什么数据工程师不能像分析师那样直接在数据库里写写查询就完事了。你需要一套结构化的环境来处理来自CRM、移动应用、网页表单、交易系统等多个数据源的信息。 这一部分会手把手教你安装PostgreSQL和DBeaver,并把它们连接起来。工具准备完毕后,你会学到数据仓库中的分层架构思想——原始层、暂存层、分析层各自承担什么职责。特别值得注意的一点是,课程会强调一个很多新人会忽略的原则:原始层的目的是存储数据原样,而不是去修复它。原始数据就是会有重复记录、会有格式不一致、会有特殊字符,这些都是正常的,关键是你要理解为什么要保留这种原始性。 二、从原始数据到暂存层 原始数据进来之后,第一步要做什么?答案是先分析。课程会用真实的客户数据演示,怎么用聚合查询配合HAVING子句系统性地检测重复记录。比如同一个电话号码出现了多次,是不是意味着同一个客户被重复录入了?在动手清理之前,你得先搞清楚重复是怎么产生的、出现在哪些字段上。 识别出重复之后,就进入暂存层的构建。课程会教你创建暂存表、把原始数据加载进去,然后编写校验查询来确认数据是否正确迁移。接着是非常重要的增量加载逻辑。真实业务里,数据不是一次性灌进去的,而是每天、每小时源源不断地进来,你需要学会判断哪些是新记录、哪些是已有记录的更新。对于更新场景,课程会详细讲解SCD Type1(缓慢变化维度类型一)的处理方式,即直接覆盖旧值,这种方式虽然简单,但在很多分析场景下已经够用。 三、分析层与窗口函数 数据到了分析层,就可以开始做真正的分析了。课程会带你搭建分析层的表结构,理解每一层在整个数据管道中的定位。在这一部分,你会学到几个非常实用的SQL技能。窗口函数是企业级SQL的必备工具,课程会从ROW_NUMBER、RANK这些基础函数讲起,特别会对比RANK和DENSE_RANK的区别,这个细节在面试和实际工作中经常被问到。CTE(公用表表达式)是另一种让复杂查询变得可读的技术,课程会演示单个CTE的使用,以及如何用多个CTE串联起来完成一步步的数据转换,写出来的SQL既清晰又容易维护。 四、高级SQL的核心写法 到了这一部分,课程进入了企业SQL数据工程中最核心的内容。JOIN是基础,但课程不会只讲语法,它会专门对比LEFT JOIN和INNER JOIN在实际业务场景下的选择——什么时候你需要保留左表的所有记录,哪怕右表没有匹配?这种判断能力比记住语法重要得多。聚合与分组也是重点,GROUP BY配合COUNT、SUM、AVG这些聚合函数能解决大量业务问题,而HAVING子句则是过滤聚合结果的关键。 子查询部分会从基础子查询讲起,然后深入到相关子查询,这种查询每一行都会执行一次内层查询,是处理"存在性"问题的利器。接着是EXISTS和NOT EXISTS的使用,以及IN和EXISTS的对比,很多工作了几年的工程师都说不清楚这两者在执行效率上的差异,课程会给你讲清楚。CASE语句则是SQL里的条件分支,在数据转换中几乎无处不在,根据条件给数据打标签、归类、分桶都靠它。最后还会讲到集合操作:UNION和UNION ALL的区别、INTERSECT和EXCEPT的使用场景,以及DISTINCT、ORDER BY、LIMIT这些看似简单但用好并不容易的细节。 五、完整管道串联 课程的最后会做一个完整的数据管道演练,把前面学到的所有内容串起来:从原始层到暂存层,再到分析层,增量加载、去重、转换一条线走下来。学完之后你会发现,SQL不只是一个查询工具,而是一套完整的数据加工语言。你会理解数据在公司里是怎么流动的,每一层的设计背后有什么权衡,以及当你面对一张陌生的业务表时,应该从哪里开始、怎么一步步把它变成可用的分析数据。 这套技能不管你是想做数据分析师、数据工程师,还是后端开发中需要处理大量数据的场景,都很实用。比起再刷一遍练习题上的SQL题目,跟着真实的业务场景走一遍,理解会深得多。