milvus的GPU索引

news2026/2/11 5:49:30

前言

milvus支持多种GPU索引类型，它能加速查询的性能和效率，特别是在高吞吐量，低延迟和高召回率的场景。本文我们将介绍milvus支持的各种GPU索引类型以及它们适用的场景、性能特点。

下图展示了milvus的几种索引的查询性能对比，通过下图我们发现批量查询的场景性能会更好

GPU_CAGRA

GPU_CAGRA是一个针对GPU优化的基于图的索引，它在GPU上能很好的执行推理。它最适合只有少量查询的场景，通过低频的内存训练的GPU通常得不到最优的结果。

索引构建参数：

Parameter	Description	Default Value
`intermediate_graph_degree`	通过在剪枝之前确定图的深度来影响召回率和构建时间，推荐的值是32或者64	`128`
`graph_degree`	通过在剪枝之后设置图的深度来影响查询性能和召回率。这两个深度之间的差异越大，构建时间就越长。它的值必须小于intermediate_graph_degree的值	`64`
`build_algo`	选择剪枝之前的图生成算法。可选的值： `IVF_PQ`: 提供更好的质量但是构建的时间比较慢 `NN_DESCENT`: 提供更快的构建但是降低了召回率	`IVF_PQ`
`cache_dataset_on_device`	决定是否在GPU内存里缓存原始数据集，可选值： `"true"`: 缓存原始数据集，以通过细化搜索结果来提高召回率。 `"false"`: 不在GPU内存缓存原始数据集	`"false"`

查询参数

Parameter	Description	Default Value
`itopk_size`	确定在查询期间中间结果的大小。比较大的值可能提高召回率但是影响查询性能。它至少要等于最终的top-k的值，并且是2的n次方(比如16, 32, 64, 128).	Empty
`search_width`	声明在查询期间进入CAGRA图的切入点的数量，增加它的值可以提高召回率但是影响性能	Empty
`min_iterations` / `max_iterations`	控制查询迭代进程，默认情况下它们设置为0，CAGRA根据itopk_size和search_width自动决定迭代的数量。手动调整它们的值可以平衡性能和准确率	`0`
`team_size`	声明用来在GPU上计算距离指标的CUDA线程数量。常用的值是2的n次方到32 (比如 2, 4, 8, 16, 32).它对搜索性能的影响很小，默认值是0，这样milvus会根据向量的维度自动设置team_size的值。	`0`

GPU_IVF_FLAT

与IVF_FLAT类似，GPU_IVF_FLAT也是将向量数据分为 nlist个聚类单元，然后比较输入的目标向量与每个聚类中心的距离。根据系统设置为查询（nprobe）的聚类数量，仅仅比较目标输入和最相似的聚类的向量来返回相似搜索结果，极大的降低了查询时间。

通过调整nprobe，针对特定的场景可以完美的平衡准确率和速度。从IVF_FLAT性能测试报告看出，随着目标输入向量数量（nq）和需要搜索的聚类数量（nprobe）的增加，查询时间急剧增加。

GPU_IVF_FLAT大部分是基于IVF索引，并且每个单元的编码数据存储与原始数据保持一致。当进行搜索的时候，我们可以对GPU_IVF_FLAT索引集合设置tok-K到256

索引构建参数

Parameter	Description	Range	Default Value
`nlist`	聚类单元的个数	[1, 65536]	128

查询参数

Parameter	Description	Range	Default Value
`nprobe`	查询多少个聚类单元	[1, nlist]	8

搜索限制

Parameter	Range
`top-K`	<= 256

GPU_IVF_PQ

PQ（乘积量化）将原始高维向量空间均匀分解为m个低维向量空间的笛卡尔乘积，然后对分解的低维度空间进行量化。替代计算目标向量和所有单元的中心距离，乘积量化计算目标向量和每个低维空间的聚类中心的聚类，这极大的降低了算法的时间复杂度和空间复杂度。

IVF_PQ在向量乘积的量化之前执行IVF索引聚类。它的索引文件甚至比IVF_SQ8还要小，但是它也导致了在向量搜索的时候损失了精度。

注意：索引构建参数和查询参数会随着milvus的版本变化，所以我们需要先选择对应的版本。当进行搜索的时候，我们可以对GPU_IVF_PQ索引集合设置tok-K到8192

索引构建参数

Parameter	Description	Range	Default Value
`nlist`	聚类单元的数量	[1, 65536]	128
`m`	乘积向量因子的大小	`dim mod m == 0`	4
`nbits`	低维度向量存储的位数（bits）	[1, 16]	8

查询参数

Parameter	Description	Range	Default Value
`nprobe`	需要查询的单元数量	[1, nlist]	8

查询限制

Parameter	Range
`top-K`	<= 1024

GPU_BRUTE_FORCE

GPU_BRUTE_FORCE是专门为非常高的召回率场景进行定制的，它通过比较数据库里面所有的向量确保召回率是1，它仅仅需要度量类型（metric_type）和 top-k(limit)作为索引构建和查询参数。

对于GPU_BRUTE_FORCE,不需要额外的索引构建参数和查询参数。

结论

当前，milvus为了高效的搜索操作加载所有的索引到GPU内存。可以加载的数据量依赖于GPU内存的大小。

GPU_CAGRA:需要的内存大小是原始向量数据大小的1.8倍
GPU_IVF_FLAT和GPU_BRUTE_FORCE:需要的内存大小与原始数据大小一样
GPU_IVF_PQ:占用较小的内存空间，它取决于压缩参数的设置。

本文来自互联网用户投稿，该文观点仅代表作者本人，不代表本站立场。本站仅提供信息存储空间服务，不拥有所有权，不承担相关法律责任。如若转载，请注明出处：http://www.coloradmin.cn/o/1818131.html

如若内容造成侵权/违法违规/事实不符，请联系多彩编程网进行投诉反馈，一经查实，立即删除！

milvus的GPU索引

GPU_IVF_FLAT

相关文章

40. 【Java教程】数据库编程

nosql数据库的特点

无法在地址[localhost]和端口[8005]上创建服务器关闭套接字(基本端口[8005]和偏移量[0])

SpringBoot集成slf4j日志配置

mysql中 redo日志（下）

利用AI大模型，将任何文本语料转化为知识图谱，可本地运行！

JVM性能优化案例：优化垃圾回收器的年轻代和老年代占比

学习笔记丨嵌入式BI分析的12个关键功能

React+TS前台项目实战（七）-- 全局常用组件Select封装

java1.8运行arthas-boot.jar运行报错解决

资源付费系统小程序APP公众号h5源码

项目五串行通信系统任务5-3温度信息上传

算法课程笔记——线段树动态开点

大模型高考数学测评结果，国内AI大模型成绩超GPT-4o！

设备管理系统——设备台账管理

B端系统的颜值问题：成也框架，败也框架！

传统工厂该如何做数字化转型？

男士内裤买便宜还是贵的？2024年高性价比男士内裤汇总分享

lnmp的介绍与源码部署以及 |什么是正向、反向、透明代理 | 常见的集群有哪些

你为什么不相信 LLM 模型评测：深入评测 LLM 接口