




资源介绍
视频数量:19个
总时长:1小时58分
课程介绍:
掌握2025年的向量数据库与嵌入模型
你有没有想过,当你问智能助手“推荐一部类似《盗梦空间》的电影”时,它是怎么理解“类似”这个词的?它怎么知道应该去找烧脑、悬疑、时间主题相关的电影?这种看似智能的理解能力,背后其实靠的是一项叫做嵌入的技术。
嵌入,简单来说就是把文本、图片、声音这些非结构化数据转换成固定长度的数字向量。比如“猫”和“狗”这两个词,转换后会产生两个位置很接近的向量,因为它们都是动物。而“猫”和“汽车”的向量则会离得比较远,因为一个是动物,一个是交通工具。这些向量不是随机生成的,它们捕捉了数据之间的语义关系。
你可能会问,为什么要转换成数字向量?因为计算机处理数字比处理文字更在行。向量数据库本质上就是存储这些高维向量的数据库,普通的关系型数据库根本没法高效处理几百维甚至上千维的向量数据。
这门课的第一个板块会带你从零开始理解嵌入到底是怎么回事。我们会讨论向量相似度这个核心概念。想象一下,你在地图上标记了两个点,要判断这两个点有多近,可以直接计算距离。在向量空间里,道理是一样的,只不过距离的计算方式有多种,最常用的是余弦相似度和点积。课程里会用具体的例子和可视化图形,让你直观感受到不同相似度度量方法的区别。
学完理论之后,你会跟着老师动手实战:使用Sentence Transformers这个开源工具,把文本转换成向量,然后把这些向量画出来看看效果。课程还准备了一个动手项目,从零搭建一个迷你搜索引擎。当用户输入查询时,系统会先把查询转换成向量,然后在你准备好的文档库中找出向量最相似的几篇文档返回给你。整个过程手把手教学,确保你真的理解了原理。
选对嵌入模型比想象中更重要。不同的模型有不同的架构和分词器,分词器直接决定了文本怎么被切分处理。课程会详细讲解BPE、WordPiece这些常见的分词方式,以及它们对向量质量的影响。市面上有几十种嵌入模型可以选择,MTEB是专门评测嵌入模型的标准benchmark,课程会教你如何参考这个评测榜单来挑选适合自己场景的模型。
现在的嵌入模型已经不局限于处理文字了,多模态模型可以同时理解图片和文字。比如CLIP这样的模型,你问它“图片里有什么动物”,它能准确识别出内容。同样,把图片转换成向量之后,可以和文字向量进行相似度比较,实现很多有趣的应用。课程会带你了解多模态嵌入的基本原理,并动手使用Hugging Face Transformers库来处理这类任务。
通用模型很难在特定领域达到最佳效果。比如医疗领域的专业术语,普通模型可能理解不准确。课程专门用一整节来讲如何对嵌入模型进行微调。用的方法是对比学习,对比损失函数会告诉模型:和“猫”相似的词应该离得更近,和“汽车”相似的词应该离得更远。通过这种方式,可以让模型更好地适应你的特定数据集。
向量数据库的工作原理是这个课程的核心部分。普通数据库存的是整数字符串,向量数据库存的是几百上千维的向量,这两者的检索机制完全不同。课程会深入讲解向量索引技术,这是让向量数据库查询速度飞快的关键。
HNSW是一种分层可导航小世界图算法,听起来很复杂,但课程会通过图形和动画让你直观理解它的工作方式。简单来说,HNSW把向量空间划分成多层,越上层跳跃范围越大,越能快速定位到大概区域,越往下越精细,最终找到最近的向量。FAISS是Facebook开源的向量数据库库,里面实现了HNSW,课程会带你实际操作用Python调用FAISS实现HNSW索引。
IVF是另一种重要的索引策略,叫做倒排文件索引。它的思路是把向量空间聚类成多个组,查询时先快速定位到最近的几个聚类中心,然后只在这些聚类里搜索。通过调整聚类数量和搜索范围,可以在速度和精度之间找到平衡。课程同样会在FAISS中实现IVF,并和HNSW进行对比。
有了理论和实战基础之后,课程带你看看现在的向量数据库生态。Milvus、Chroma、Weaviate这些开源方案各有特点,而Pinecone作为商业化产品提供了更完善的托管服务。课程会以Pinecone为例,演示如何注册账号、创建索引、插入和查询向量。
最后一个板块是实际应用环节,这是整门课程最有价值的部分。你会看到向量数据库和嵌入技术如何真正落地。
语义搜索是最直接的应用,它不像传统关键词搜索那样依赖精确匹配,而是理解查询的真正意图。搜“水果的健康益处”,系统能理解你关心的是水果而不是苹果。检索增强生成是当下大语言模型应用的主流架构,当用户提问时,系统先从向量数据库中检索相关文档作为上下文,然后一起送给大语言模型处理,这样模型就能基于真实信息回答,而不是凭空编造。课程会带你完整实现一个RAG系统。
推荐系统也离不开向量数据库。用户和商品都可以用向量表示,用户向量和商品向量的相似度就是推荐的依据。电商平台、视频网站都在用这种技术。课程会展示如何用Pinecone构建一个简单的推荐系统。
学完这门课,你就能独立完成语义搜索功能的开发,理解RAG系统的完整实现原理,甚至可以把这些技术整合到自己的AI产品里。整个课程将近两个小时,内容紧凑但讲得很透,每个知识点都配合代码演示。
适合有Python基础、了解基本机器学习概念的同学。想给产品加语义搜索功能的开发者,或者想在AI领域深耕的工程师,这门课都是很好的选择。向量数据库和嵌入技术已经成为大模型时代的基础设施,越早掌握越有优势。