视频课程 编程

用Google ADK系统评估AI智能体 (英文课程中文字幕)

¥5.00 已售 0
✓ 自动发货 ✓ 永久有效 ✓ 售后保障

资源介绍

视频数量:27个 总时长:2小时17分 课程介绍: 用Google ADK系统评估AI智能体 你花了两周时间写了一个AI智能体,它能帮你处理采购审批、能调用数据库、还能自动生成报告。你很满意,觉得这东西终于能用了。但紧接着一个问题冒了出来:怎么知道它下次还会不会这样做? 这不是你一个人会遇到的问题。实际上,大多数团队在AI智能体开发中都会遇到一个尴尬的时刻——代码能跑,结果看起来也对,但没人能说清楚它到底靠不靠谱。你可能也见过这种情况:演示的时候完美,上线之后就出问题;今天能通过的case,明天换了个问法就翻车。 这门课要解决的就是这个问题。它教你用Google ADK(Agent Development Kit)建立一套完整的AI智能体评估体系,从最基本的“怎么跑起一个智能体”,到生产环境中怎么用CI/CD自动回归测试,全部覆盖。课程不是讲理论,而是带着你一步步做,用一个真实的采购智能体贯穿始终,每个概念都有具体的代码和操作对应。 课程开头先让你直面一个现实:为什么给AI智能体打分比给普通程序打分难得多。普通的代码逻辑,单元测试跑一遍就知道对不对。但AI智能体不一样,它的输出取决于大模型的推理过程,同样的输入可能产生不同的结果,而且“答案看起来对”不代表“推理过程也对”。课程会演示一个具体的例子:一个智能体给出了“正确”的答案,但实际上是绕过了应该遵守的政策规则。如果只看你最终拿到的回答,根本发现不了这个问题。 基于这个挑战,课程进入第一个核心模块:怎么让智能体可以被ADK框架识别和运行。这里涉及ADK的项目结构规范——你的目录怎么组织、文件怎么命名、agent.yaml怎么配置。这些看起来是基础,但搞错的话后面的评估根本跑不起来。课程会讲清楚每一步为什么这样设计,让你不仅会照着做,还能理解背后的逻辑。 接下来课程进入评估实战,告诉你评估一个智能体要看的不是最终答案,而是执行轨迹。智能体在完成任务的过程中调用了哪些工具、参数是什么、顺序对不对,这些才是关键。课程会教你如何绑定工具、如何用Pydantic模型定义输入输出的契约,以及如何验证智能体是否调用了正确的工具。每一个知识点都对应具体的调试场景,比如你发现智能体调用了工具但顺序错了,或者工具本身没有问题但指令里没有强调执行顺序。 有了基础之后,课程进一步教你如何暴露逻辑错误。ADK提供了一个Trace View工具,能把智能体的思考过程、工具调用、返回结果全部可视化。课程会演示怎么用这个工具做视觉化调试,追踪每一步发生了什么。还会讲到“Trap mocks”这个技巧——通过构造特殊的测试case,逼迫智能体必须真正推理而不是走捷径。 第五部分教你把评估正式化,这是从“手动试”变成“自动跑”的关键一步。课程引入了“黄金追踪”的概念:把你人工验证过的正确案例,转换成机器可以重放和评分的标准轨迹。你会学到如何定义轨迹匹配规则、如何测试智能体的记忆能力、如何组织评估集合方便后续扩展。这些内容解决的是“评估集怎么管”的问题——当你有几百个测试case的时候,怎么组织、怎么维护才不会乱。 评估不能只跑一次就完了,课程第六部分教你规模化评估。Headless批处理让你可以一次性跑完所有测试case不用盯着,课程会讲怎么配置和解读结果。你会接触到“Trajectory vs. semantic”两种评分方式的区别,前者看执行路径对不对,后者看最终效果达没达到。还会讲到Pass@k这个指标——一个智能体跑k次能有几次成功,帮助你区分是真的可靠还是纯粹运气好。 最后一部分进入生产级别的内容。课程会教你用LLM作为评判者,根据自定义的评分标准给智能体打分;做Groundedness和Faithfulness检查,确保智能体的回答是基于给定知识库而不是胡编;通过“负向逻辑”实现安全的拒绝响应,让智能体在遇到不该处理的情况时能正确地说“不”。还有一个很实用的内容:如何在CI/CD流水线里加入回归测试,每次提交代码都自动跑一遍评估,发现问题及时回滚。 学完这门课,你能带走的不只是一堆概念,而是一套可以直接用在工作里的评估流程。从拿到一个智能体开始,怎么设计评估方案、怎么组织测试集、怎么解读结果、怎么把评估集成到发布流程里,整个链路都会清楚。课程还会给一个调试检查清单,遇到问题的时候能快速定位是Prompt、工具还是模型本身出了毛病。 这门课适合有AI智能体开发经验、想系统提升智能体质量控制能力的工程师。如果你现在面临“智能体能不能上生产”的判断难题,或者团队里缺乏评估智能体的标准流程,这门课能给你一套可操作的方法论。课程用的是Google ADK,但如果你的智能体框架不一样,评估的思路和流程同样适用。