




资源介绍
视频数量:40个
总时长:3小时4分
课程介绍:
NVIDIA认证AI基础设施专家指南
你有没有想过,那些支撑大语言模型训练、自动驾驶汽车实时推理、医院里医学影像分析系统的底层基础设施是怎么搭建起来的?一台服务器放几块GPU能跑起来,但要支撑起真正的AI生产环境,让成百上千个模型同时训练、同时推理,数据要在毫秒级别流转,GPU资源要被高效利用,还要保证安全合规——这完全是另一回事。
这门课就是讲这个的。课程获得NVIDIA官方认证,学完能拿到SoAI的认证证书,更重要的是,它系统地覆盖了构建企业级AI基础设施的完整知识图谱。
先说基础部分。你会搞清楚AI基础设施到底在解决什么问题,GPU为什么是AI workloads的核心,CPU、GPU、DPU三种处理器各自的擅长领域在哪里。这些概念听起来基础,但很多人做决策的时候恰恰卡在这里——不知道什么时候该用什么样的硬件组合。课程还会带你熟悉NVIDIA的生态系统,CUDA、 Triton推理服务器、NGC模型库,这些工具你迟早要用,先搞清楚它们是干嘛的比临时查文档高效得多。
有了基础认知之后,进入实战环节。GPU资源怎么管理?一块A100显卡价格几十万,不可能让一个任务独占,尤其是团队里有多个人、多个项目同时跑的时候。课程会讲清楚MIG多实例GPU配置、GPU共享与隔离技术、虚拟GPU的设置和适用场景。时间分片、MIG切片、vGPU三种方案各有什么优劣,什么情况下该选哪种,这里都有明确的答案。而且每个模块都配套了动手实验,比如让你在A100上实际配置MIG,这比光看概念有用得多。
数据是AI的血液,存储和网络就是血管。课程会讲清楚本地存储、共享存储、对象存储各自的适用场景,NVLink、InfiniBand、RDMA这些高速网络技术的原理,以及数据在训练pipeline里流转时常见的瓶颈在哪。怎么设计一个从ETL到训练到推理的完整数据管道,这个技能在真实项目中非常值钱。配套的实验会让你亲手设计一个端到端的数据流水线。
Kubernetes已经是AI工作负载编排的事实标准,但GPU调度的门道比CPU复杂得多。课程会讲如何在Kubernetes里启用GPU支持,NVIDIA设备插件怎么工作,怎么用节点选择器、污点、容忍度来调度GPU资源。Helm、Operators、自动扩缩容这些生产环境必备的能力都会覆盖到,还会讲到Kubeflow和MLflow怎么和Kubernetes配合。集群拓扑怎么选,本地部署、公有云、混合云各有什么坑需要避开,这些实战经验课上都会分享。
跑起来之后怎么优化是另一门学问。Nsight、DLProf、nvtop这些profiling工具怎么用,GPU指标怎么采集、监控、告警,TensorRT怎么加速推理,瓶颈怎么诊断和调优,这些内容会手把手教你。配套的实验是用TensorRT优化推理pipeline,学完你就能直接应用到工作里。
安全合规这部分很多人容易忽视,但企业环境里这是必须过的坎。GPU工作负载怎么安全加固,DPU和DOCA在加密和访问控制里扮演什么角色,RBAC权限怎么设计,GDPR、HIPAA、FedRAMP这些法规对AI基础设施有什么具体要求——这些内容对于想在企业里推进AI项目的工程师来说,是必须要掌握的知识。
边缘AI也是这两年特别热的方向。边缘和云端的基础设施设计思路有什么不同,NVIDIA Jetson和Orin平台怎么用,联邦学习怎么实现分布式推理,智慧城市、零售、工业物联网这些场景里AI基础设施是怎么落地的——这些内容会拓宽你的视野,不只是数据中心里的GPU集群。
最后三个模块是综合实战加考证准备。你会看到两个完整的案例研究:怎么搭建一台AI超级计算机,怎么为医疗机构设计多租户AI基础设施。还会走一遍从数据到训练到部署到监控的完整workflow,亲手设计一个可扩展的AI基础设施方案。考证方面,有60道模拟题、考试蓝图分析、常犯错误的总结、闪卡复习、还有最终的综合项目。课程结尾会告诉你认证路径和后续学习方向。
整门课40个视频,三四个小时的时长,节奏紧凑但覆盖全面。它适合正在或打算做AI基础设施相关工作的工程师,不管是做DevOps、系统架构还是云平台的;适合已经在做机器学习、想把模型部署和运维搞清楚的开发者;也适合需要评估和设计AI系统方案的架构师。零基础也能学,但最好对Linux命令行和云计算有基本了解,这样学起来会更顺畅。
学完这门课,你收获的不只是一张证书,而是构建和管理企业级AI基础设施的完整能力图谱。从硬件选型到集群编排,从性能调优到安全合规,从云端到边缘,这些知识点串联起来,能让你真正理解一个生产级AI系统是怎么运转的。这门课的实用之处在于,它不只是在讲概念,每个模块都配套了动手实验和真实案例,把学到的知识落地成可以复用的经验。