向量数据库与Embedding面试题全解:从ANN近似搜索到混合检索
向量数据库与Embedding面试题全解从ANN近似搜索到混合检索【免费下载链接】ai-engineering-interview-questionsYour Cheat Sheet for AI Engineering Interview – Questions and Answers.项目地址: https://gitcode.com/gh_mirrors/ai/ai-engineering-interview-questions正在准备 AI 工程面试吗本文从ai-engineering-interview-questionsAI 工程面试速查手册项目中精选「向量数据库与 Embedding」高频面试题带你一次吃透向量数据库与Embedding面试题什么是 Embedding、ANN 近似搜索如何工作、HNSW 与 IVF 怎么选、混合检索为何优于纯向量搜索以及面试官最爱追问的生产陷阱题Embedding 漂移、维度不匹配、海量向量扩展。一、Embedding 与向量数据库用大白话讲清楚 Embedding嵌入就是模型把一段文字翻译成一串数字向量。语义相近的两段话它们的向量在空间里距离也很近——这就是语义搜索能工作的原理。向量数据库则是专门存储这些向量、并能快速找出与查询向量最相似的前 K 个的数据库它和传统数据库按条件精确匹配的最大区别在于它做的是相似度查找而不是等值查找。 面试金句Embedding 把语义变成了几何距离向量数据库就是为这种距离计算优化的存储引擎。高频题What are embeddings in the context of AI engineering?AI 工程中什么是嵌入二、必考题三种相似度度量怎么选 这是几乎必考的基础题面试官通常要求你同时说出适用场景度量方式特点适用场景余弦相似度只看方向、不看长度文本语义搜索最常用点积同时考虑方向与长度向量已归一化时等价于余弦欧氏距离几何直线距离数值型特征、位置敏感场景高频题原文Explain cosine similarity, dot product, and Euclidean distance for vector search. 加分技巧主动说明实际项目中文本向量常做 L2 归一化此时余弦相似度与点积等价能省去一次开方运算。三、ANN 近似搜索为什么放弃精确查找 ⚡数据量到百万级以上时全量精确搜索Flat每个查询都要算一遍所有向量延迟无法接受。于是引入ANNApproximate Nearest Neighbor近似最近邻——用极小的精度损失recallk 从 100% 降到 95%换取成倍的速度提升。三大索引方案的取舍是高频对比题Flat暴力100% 召回小数据集100万首选HNSW分层图召回高、查询快但内存占用大——适合内存充足、延迟敏感场景IVF倒排聚类先聚类再只查最近的几个簇内存友好——适合超大规模数据高频题原文Compare HNSW, IVF, and flat indexes. How do you pick one, and what does recallk cost in latency?扩展追问How do you handle large-scale vector search with billions of vectors?十亿级向量如何扩展——答分片 量化 分层索引即可拿满。四、混合检索关键词 向量的黄金组合 纯向量搜索有两个硬伤领域黑话识别差embedding 模型未必认识OCR 准确率这类行话和短查询信息不足。所以生产级系统普遍采用Hybrid Search混合检索稀疏通道BM25 等关键词匹配抓精确术语稠密通道向量相似度抓语义泛化融合 重排Rerank用 cross-encoder 等重排器对 Top-N 结果精细打分高频题原文What is hybrid search, and why is it better than pure vector search? 场景题联动Your RAG system fails on domain-specific jargon. How do you fix it?——标准答案就是上混合检索这正是面试官验证你是否懂混合检索落地的方式。五、生产陷阱题面试官最爱的坑 ️这一节的题目都在考察你是否真做过线上系统Embedding 漂移You deployed a new embedding model, and search quality crashed overnight.更换模型后新旧向量语义空间不一致必须全量重算索引并做灰度切换维度不匹配新模型输出维度与线上存量向量不同需要双索引并行 逐步迁移内存爆炸Your vector database for RAG is consuming too much memory.用向量量化量化存储或 IVF 索引降本相似分很高但结果无关先查 chunking 质量、再查检索通道而非一味调模型元数据过滤向量库的 metadata 用于权限隔离多租户、按文档类型/时间筛选高频题原文How do you handle embedding drift when the embedding model is updated?六、去仓库哪里刷题以上面试题均出自该项目的 README.md核心章节是 Vector Databases and Embeddings共 20 道题覆盖 Embedding、ANN、混合检索与故障排查。建议按顺序搭配阅读RAG 章节检索链路视角README.md编码实战题手写余弦相似度、向量检索README.md项目首页导航与目录总览README.md封面图源文件assets/banner.png如需离线刷题可克隆仓库git clone https://gitcode.com/gh_mirrors/ai/ai-engineering-interview-questions七、考前 30 分钟速记清单 ✅Embedding 语义 → 向量向量数据库 为相似度查找优化的存储文本搜索默认选余弦相似度记得提归一化后点积等价小规模用 Flat高延迟敏感用HNSW超大规模用IVFANN 的本质用 recallk 的小幅下降换数量级的延迟提升混合检索 稀疏BM25 稠密向量 重排器换 Embedding 模型必须全量重建索引并处理维度不匹配降本三板斧向量量化、IVF 索引、元数据前置过滤掌握以上内容「向量数据库与 Embedding」这个高频考点你就可以从背答案升级到讲原理 讲线上经验稳稳拉开差距。【免费下载链接】ai-engineering-interview-questionsYour Cheat Sheet for AI Engineering Interview – Questions and Answers.项目地址: https://gitcode.com/gh_mirrors/ai/ai-engineering-interview-questions创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考