Краткий обзор векторных баз данных

A Brief Survey of Vector Databases
Hongbin Huang, Xingrui Xie, Han Liu, Wenzhe Hou
2023-12-15

ChromaMilvusPineconeвысокоразмерные данныеметрики схожестиалгоритмы поиска по схожестивекторные базы данных
Взрывной рост массивных многомерных (высокоразмерных) данных требует расширенных возможностей для их обработки, хранения и анализа. Это ставит значительные задачи перед традиционными СУБД, которые изначально разрабатывались для автономных машин и плохо приспособлены к работе с высокоразмерными данными. Векторные базы данных предложили практическое решение для управления и анализа высокоразмерных данных: они эффективно извлекают результаты, связанные с запросом, после кодирования различных форм данных (например, текста, изображения и видео) в векторы. Цель данной статьи — представить обзор векторных баз данных. Во-первых, подробно рассматривается рабочий процесс векторных баз данных, включая индексацию и выполнение запросов, с приведением конкретного примера. Далее мы раскрываем связанные методы, применяемые в векторных базах данных, которые являются ключевыми приемами для повышения эффективности поиска и снижения вычислительной нагрузки, в частности алгоритмы поиска по сходству и метрики сходства. Затем мы представляем широко используемые продукты векторных баз данных (например, Pinecone, Chroma и Milvus) и сравниваем их по множеству факторов, которые следует учитывать. Мы также обсуждаем возможные направления будущих исследований в этой области. В заключение, этот обзор обеспечивает всестороннее понимание векторных баз данных для поиска в больших высокоразмерных наборах данных.
1
Ключевые методы для векторных баз данных включают алгоритмы поиска по схожести и метрики схожести, которые повышают эффективность поиска и снижают вычислительные затраты.
2
В статье подробно описан рабочий процесс векторных баз данных, включая индексирование и запросы, и приведен конкретный пример такого рабочего процесса.
3
В статье указаны потенциальные направления будущих исследований в области векторных баз данных для улучшения извлечения из больших высокоразмерных наборов данных.
4
Обзор сравнивает широко используемые продукты векторных баз данных (например, Pinecone, Chroma, Milvus) по нескольким практическим факторам для выбора и использования.
5
Векторные базы данных решают ограничения традиционных СУБД для массивных высокоразмерных данных, обеспечивая эффективный поиск после кодирования различных данных (текст, изображение, видео) в векторы.

Векторные базы данных

Их рабочий процесс и основные методы/приёмы для эффективного извлечения из высокоразмерных данных (индексация, запросы, алгоритмы и метрики поиска по сходству), сравнительный анализ продуктов и направления будущих исследований

Publication Details
Publication Date
2023-12-15
Journal
Publisher
ISSN
Cited by
29
Access Type
Author Information
Authors
Hongbin Huang
Xingrui Xie
Han Liu
Wenzhe Hou
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%