视频课程 编程

Azure生成式AI的API管理实战课 (英文课程中文字幕)

¥5.00 已售 0
✓ 自动发货 ✓ 永久有效 ✓ 售后保障

资源介绍

视频数量:26个 总时长:2小时42分 课程介绍: Azure生成式AI的API管理实战课 当你第一次把大语言模型集成到生产环境时,很快就会遇到一些棘手的问题:请求超时、令牌配额不够用、响应延迟忽高忽低、费用像坐火箭一样往上涨。更让人头疼的是,怎么在保证安全的前提下,让你的应用稳定可靠地跑起来。 这些坑,我见过太多团队踩过。 这门课专门解决这些问题。讲师Hossein Delay是微软的云解决方案架构师,天天跟Azure上跑生成式AI的企业打交道。他把这些实战中最常见、最关键的问题整理成一套系统方案,从API管理怎么连接OpenAI,到怎么在高并发场景下稳如老狗,再到怎么给服务加上私有网络保护,每个环节都讲得清清楚楚。 课程分八个部分,手把手带你从零搭建一套生产级的LLM API管理架构。 第一章先把基础打牢。你会学到怎么在Azure门户界面上把API管理与OpenAI连起来,怎么用命令行工具自动化这个过程,怎么用Terraform写代码来部署基础设施。最后用Python Jupyter Notebook自己写代码测试连通性,确认整个链路能跑通。 第二章解决一个很现实的问题:大语言模型对输入的令牌数量是有限制的。一旦超过限制,服务直接返回429错误,用户那边就得等着,体验很差。怎么办?答案是创建多个LLM模型实例,然后配置负载均衡。这章会教你设置不同区域、不同实例之间的流量分配比例,比如70%走英国南部的实例,20%走瑞典中部,10%走法国中部。这样即使某个实例挂了,请求会自动切到其他实例,用户几乎感知不到。 第三章继续深入,聊聊令牌限制策略。模型对每次请求的token数有限制,你得知道怎么在API管理层面做拦截和优化。这不是简单地设个阈值那么简单,而是要理解token怎么计算、怎么在客户端和后端之间做好配合。 第四章讲语义缓存,这是个省钱的黑科技。传统的缓存是精确匹配,请求内容一模一样才命中。但语义缓存不一样,它能理解你问的问题的本质,哪怕措辞稍有不同,也能判断这是在问同一类东西,然后直接返回缓存结果。这对于频繁调用的LLM应用来说,能省下大量token和费用。这章会演示怎么在API管理里配置语义缓存,怎么在门户上测试效果,怎么用Python脚本做更精细的验证。 第五章聊可观测性。应用跑起来了,你得知道它到底跑得怎么样。这章会教你收集API管理的日志和指标数据,然后把它们导入Grafana做成可视化看板。 latency分布怎么样、哪些端点调用最频繁、错误率如何变化,这些一目了然,出现问题能快速定位。 第六章讲私有端点。OpenAI这类服务默认是公网访问的,但企业场景里有很多合规要求,必须走内网。这时候就需要把AI服务藏在私有端点后面,让API管理通过内网连接,安全又合规。 第七章把整个架构串起来,介绍怎么通过Azure Front Door访问部署在私有网络里的API管理和AI服务。从整体的私有连接架构设计,到具体怎么用Front Door做流量分发和防护,再到怎么测试验证整个链路,完整走一遍。 学完这门课,你就能掌握一整套在Azure上管理大语言模型API的实战能力。从简单的连接配置,到高可用的负载均衡设计,再到省钱提速的语义缓存,最后到满足企业安全要求的私有网络部署,这条链路上的关键节点你都门儿清。不管你是想让现有的LLM应用更稳更省钱,还是要从零搭建一套生产级的AI服务架构,这门课都能给你扎实的支撑。