跳到主要内容
AI 能力图谱

向量数据库

Vector Database · 工程与集成

深入工程与集成数据更新于 2026 年 9 月 24 日

它是什么

按语义相似度而非关键词存取数据的系统,把内容转成数值向量,比较时看「意思有多接近」。

为什么重要

它是检索增强生成的后端组件。理解它,才能判断一个知识库方案在数据量涨上去之后还能不能扛住。

打个比方

像按气味而不是按标签整理的图书馆:即使你记不清书名,只记得大致那股味道,也能把正确的几本抽出来。

举个例子

把十万条客服问答导入 Qdrant 或 pgvector,当用户用完全不同的说法提问时,系统仍能召回语义相近的历史答案,再交给模型改写成合适的回复。

常见误解

  • 误解:向量数据库能理解业务含义。 事实:它只做相似度计算,答得对不对取决于嵌入质量和后续的重排策略。

  • 误解:数据量很小也需要专门产品。 事实:几千份文档用现成应用内置的索引就够,引入独立数据库反而增加维护成本。

  • 误解:换向量数据库就要重写整个应用。 事实:检索层通常独立于生成层,可以分阶段替换、平滑迁移。

  • 误解:嵌入模型随便选一个都行。 事实:中文场景下不同嵌入模型差距明显,换模型通常要重建索引并重新评估效果。

延伸阅读(相关概念)

本页内容更新于 2026 年 9 月 24 日。概念条目会随模型能力变化而修订。