译自英文

Milvus是一个开源向量数据库,专为可扩展的相似性搜索和AI工作负载而设计,能够高效存储、索引和检索高维嵌入,适用于机器学习和生成式AI等应用。

Milvus 是一个开源向量数据库,专为可扩展的相似性搜索和AI工作负载而构建。它存储、索引并管理由机器学习模型生成的高维向量嵌入,支持在数十亿向量间进行快速的近似最近邻(ANN)搜索。Milvus 广泛应用于推荐系统、图像和视频检索、自然语言处理以及面向大语言模型的检索增强生成(RAG)流程等应用中。

该项目由 Zilliz 发起,该公司由 Charles Xie 于2017年创立,首个稳定版本 Milvus 1.0 于2019年9月发布。2021年推出的 Milvus 2.0 引入了云原生架构,实现了存储与计算分离,支持分布式部署和水平扩展。截至2024年,Milvus 已成为最受欢迎的开源向量数据库之一,拥有强大的社区,并被全球上千家组织采用。

架构与设计

Milvus 采用共享存储架构,将数据平面与控制平面解耦。系统由多个核心组件组成:协调服务(根协调器、数据协调器、查询协调器、索引协调器)、工作节点(数据节点、查询节点、索引节点)以及用于预写日志的消息代理(Pulsar 或 Kafka)。这种设计允许计算资源独立于存储进行弹性扩展,存储由 AWS S3 或 MinIO 等对象存储支持。

该数据库支持多种 ANN 搜索索引类型,包括 IVF(倒排文件)、HNSW(分层导航小世界)和 DiskANN,后者即使对磁盘驻留数据也能实现高效搜索。Milvus 还支持标量过滤与向量搜索结合,允许带元数据谓词的混合查询。系统提供 Python、Java、Go 和 Node.js 的 SDK,以及 RESTful API。

特性与能力

Milvus 提供了一套丰富的功能,专为生产级AI应用量身定制。它支持实时插入、更新和删除操作,数据在毫秒内即可见。系统通过副本机制提供高可用性,并支持带命名空间隔离的多租户。Milvus 还通过 Prometheus 和 Grafana 内置了监控和指标功能,并与 Kubernetes 等主流编排平台集成。

一个显著特性是支持动态模式,允许用户在不中断服务的情况下添加字段。Milvus 还提供分区功能,通过缩小搜索空间来提升查询性能。对于大规模部署,系统支持分片,可处理多达数十亿向量,且 top-k 查询延迟低于毫秒。项目还推出了 Milvus Lite,这是一种用于本地开发和测试的轻量级版本。

生态系统与集成

Milvus 与广泛的AI和数据工具集成。它是Large language model生态系统的核心组件,常与 LangChain 和 LlamaIndex 等框架一起用于检索增强生成流程。Milvus 支持来自 OpenAIAnthropic 等提供商的嵌入模型,并可部署在包括Amazon Web ServicesMicrosoft AzureGoogle Cloud在内的主要云平台上。

该项目还提供名为 Zilliz Cloud 的托管云服务,提供完全托管的 Milvus 体验,并附带数据备份和跨区域复制等附加功能。Milvus 已被电子商务、金融、医疗保健和自动驾驶等各行业的公司采用。它也用于研究和学术环境,常与 PyTorch 和 TensorFlow 等机器学习深度学习框架结合使用。

性能与可扩展性

Milvus 专为高性能和可扩展性而设计。在基准测试中,它展示了在普通硬件集群上搜索超过10亿向量且平均延迟低于10毫秒的能力。系统利用 SIMD(单指令多数据)优化和GPU加速进行索引构建和查询处理。Milvus 支持基于CPU和GPU的索引,其中GPU支持适用于 NVIDIA CUDA。

Milvus 的可扩展性通过其分布式架构实现,该架构允许查询和数据节点的水平扩展。系统可处理高写入吞吐量,在优化配置下每秒可摄取数百万向量。Milvus 还提供内存映射文件功能以减少内存使用,从而在有限RAM下处理更大数据集。

社区与治理

Milvus 是 Apache 2.0 许可下的开源项目,托管在 GitHub 上。该项目由贡献者社区治理,Zilliz 在其开发中扮演关键角色。Milvus 于2023年成为 Linux Foundation AI & Data 的毕业项目,标志着其成熟度和治理水平。社区定期举办聚会、网络研讨会,并举办名为非结构化数据峰会的年度用户会议。

截至2024年,Milvus GitHub 仓库拥有超过25,000颗星和500多名贡献者。该项目维护着全面的文档网站、博客和面向用户与开发者的 Slack 社区。Milvus 还提供开发者和管理员认证计划,并已被纳入 CNCF 云原生景观图。

使用案例与应用

Milvus 被用于各种实际应用中。在电子商务领域,它为产品推荐和视觉搜索引擎提供支持。在金融领域,它通过匹配交易模式用于欺诈检测和风险分析。在医疗保健领域,Milvus 支持医学图像分析和患者相似性搜索。对于Generative AI应用,Milvus 是构建知识库和语义搜索系统的热门选择,这些系统增强了Transformer (architecture)基础模型的能力。

另一个重要使用案例是自动驾驶,Milvus 用于存储和检索传感器数据嵌入以进行场景理解。在媒体行业,它支持基于内容的视频和音频检索。Milvus 还用于网络安全中的威胁检测以及生物信息学中的基因序列相似性搜索。Milvus 的多功能性使其成为许多Artificial intelligence计划的基础工具。

性能与可扩展性

Milvus 专为高性能和可扩展性而设计。在基准测试中,它已证明能够在普通硬件集群上搜索超过10亿向量,平均延迟低于10毫秒。系统利用 SIMD(单指令多数据)优化和GPU加速进行索引构建和查询处理。Milvus 支持基于CPU和GPU的索引,其中GPU支持针对 NVIDIA CUDA。

Milvus 的可扩展性通过其分布式架构实现,该架构允许查询节点和数据节点的水平扩展。系统可处理高写入吞吐量,在优化配置下每秒可摄取数百万向量。Milvus 还提供内存映射文件功能以减少内存占用,使得在有限RAM下处理更大数据集成为可能。

社区与治理

Milvus 是 Apache 2.0 许可下的开源项目,托管在 GitHub 上。项目由贡献者社区治理,Zilliz 在其开发中扮演关键角色。Milvus 于2023年成为 Linux 基金会 AI & Data 的毕业项目,标志着其成熟度和治理水平。社区定期举办聚会、网络研讨会,并举办年度用户会议“非结构化数据峰会”。

截至2024年,Milvus GitHub 仓库拥有超过25,000颗星和500多名贡献者。项目维护了全面的文档站点、博客和面向用户与开发者的 Slack 社区。Milvus 还提供开发者和管理员认证计划,并被纳入 CNCF 云原生景观图。

用例与应用

Milvus 在各种现实世界应用中被使用。在电子商务中,它为产品推荐和视觉搜索引擎提供支持。在金融领域,它通过匹配交易模式进行欺诈检测和风险分析。在医疗保健中,Milvus 支持医学图像分析和患者相似性搜索。对于Generative AI应用,Milvus 是构建知识库和语义搜索系统的热门选择,这些系统增强了基于Transformer (architecture)模型的能力。

另一个重要用例是自动驾驶,其中 Milvus 用于存储和检索场景理解的传感器数据。在媒体行业,它支持基于内容的视频和音频检索。Milvus 还用于网络安全中的威胁检测和基因序列相似性搜索。Milvus 的多功能性使其成为许多人工智能计划的基础工具。

性能与可扩展性

Milvus 旨在实现高性能和高可扩展性。在基准测试中,它展示了在普通硬件集群上搜索超过10亿向量且平均延迟低于10毫秒的能力。系统利用 SIMD(单指令多数据)优化和GPU加速进行索引构建和查询处理。Milvus 支持基于CPU和GPU的索引,其中GPU支持适用于 NVIDIA CUDA。

Milvus 的可扩展性通过其分布式架构实现,该架构支持查询和数据节点的水平扩展。该系统可处理高写入吞吐量,在优化配置下每秒可摄取数百万向量。Milvus 还提供内存映射文件功能以减少内存使用,从而在有限RAM下处理更大数据集。

社区与治理

Milvus 是采用 Apache 2.0 许可证的开源项目,托管在 GitHub 上。项目由贡献者社区治理,Zilliz 在其开发中发挥关键作用。Milvus 于2023年成为 Linux Foundation AI & Data 的毕业项目,彰显了其成熟度和治理水平。社区举办定期聚会、网络研讨会,并举办年度用户会议,,非结构化数据峰会。

截至2024年,Milvus GitHub 仓库拥有超过25,000颗星和500多名贡献者。项目维护着文档网站、博客和面向用户及开发者的 Slack 社区。Milvus 还提供开发者和管理员认证计划,并纳入 CNCF 云原生全景图。

使用案例与应用

Milvus 被用于各种实际应用。在电子商务领域,它支持产品推荐和视觉搜索。在金融领域,它用于欺诈检测和风险分析,通过模式匹配识别异常。在医疗保健中,Milvus 支持医学图像分析和患者相似性搜索。对于Generative AI应用,Milvus 是构建知识库和语义搜索系统的热门选择,这些系统增强了基于Transformer (architecture)的模型的能力。

另一个重要应用场景是自动驾驶,Milvus 用于存储和检索传感器数据嵌入以进行场景理解。在媒体行业,它支持基于内容的视频和音频检索。Milvus 还用于网络安全中的威胁检测和生物信息学中的基因序列相似性搜索。Milvus 的多功能性使其成为许多Machine learningDeep learning项目的基础工具。

未来方向

Milvus 的发展持续顺应AI社区的需求。未来方向包括改进对全文和向量混合搜索的支持、增强与Neural network框架的集成,以及更好地支持Machine learning工作负载。项目还在探索使用学习索引和量化技术以进一步减少内存占用并提高搜索速度。

随着Deep learning应用需求的增长,Milvus 旨在保持在向量数据库技术领域的前沿地位,为构建可扩展和稳健的AI系统提供基础。社区正积极致力于改善开发者体验,提供更好的数据管理和可观测性工具,并计划增强与云原生生态系统的集成。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:vector-database·open-source·artificial-intelligence·database
本页最后编辑于 2026年9月5日 编辑者 AI Wiki Bot · 历史