За пределами сжатия: комплексная оценка методов сжатия чисел с плавающей запятой без потерь
Beyond Compression: A Comprehensive Evaluation of Lossless Floating-Point Compression
2025-07-01
SCID: 54.1/qqy5bp4z
Discuss with AI
генерация с дополнением поиска (RAG)эффективность сжатиявыполнение запросов in-situпоиск k ближайших соседей (k-NN)сжатие чисел с плавающей точкой без потерь
Figures from the paper
Abstract (AI)
Современные приложения, работающие с большими объемами данных, генерируют значительные объемы данных с плавающей запятой, которые необходимы для таких областей, как базы данных и машинное обучение. Хотя многие методы сжатия ориентированы на эффективность использования пространства, существует недостаток бенчмарков, оценивающих как эффективность сжатия, так и производительность выполнения запросов, особенно в таких задачах, как выполнение запросов in situ над сжатыми данными и задачи машинного обучения, включая измерение расстояний и поиск k ближайших соседей (k-NN) в системах генерации с дополнением поиска (Retrieval-Augmented Generation, RAG). В данной статье восполняется этот пробел посредством оценки популярных методов сжатия чисел с плавающей запятой без потерь по трем ключевым критериям: эффективности сжатия, производительности операций с базами данных и производительности запросов машинного обучения. Мы реализовали эти методы на языке Rust и интегрировали их в библиотеку с открытым исходным кодом для использования с колоночными движками. Сравнение выявляет компромиссы между эффективностью сжатия и производительностью запросов, показывая, что ни один из подходов не превосходит другие по всем направлениям, а некоторые методы обеспечивают более высокую степень сжатия ценой снижения производительности.
Key Findings
1
Оцениваются выполнение запросов непосредственно над сжатыми данными, а также задачи машинного обучения, включая измерение расстояний и поиск k ближайших соседей в системах дополненной генерации с поиском.
2
Результаты показывают компромисс между эффективностью сжатия и производительностью запросов: ни один метод не является лучшим по всем оцениваемым параметрам.
3
Некоторые методы повышают эффективность использования пространства, но приводят к снижению скорости выполнения.
4
Исследованные методы реализованы на Rust и интегрированы в библиотеку с открытым исходным кодом для движков обработки столбцовых данных.
5
В статье сравниваются популярные методы сжатия чисел с плавающей точкой без потерь по эффективности сжатия, производительности операций баз данных и запросов машинного обучения.
Research Object
Методы без потерь для сжатия данных с плавающей запятой, применяемые в столбцовых базах данных и задачах машинного обучения
Research Subject
Компромиссы между эффективностью сжатия, производительностью операций с базами данных и производительностью запросов машинного обучения, включая выполнение запросов in situ, измерение расстояний и поиск k ближайших соседей
Publication Details
Publication Date
2025-07-01
Journal
Publisher
ISSN
Cited by
10
Access Type
Author Information
Download PDF
Subscribe to digest
Источники этой статьи в scid.ai5
До последнего бита: кодирование данных на основе данных с помощью CodecDB2021
BtrBlocks: эффективное столбцовое сжатие для озёр данных2023
Компоновка сжатия FastLanes: декодирование более 100 миллиардов целых чисел в секунду с использованием скалярного кода2023
ALP: Адаптивное сжатие чисел с плавающей точкой без потерь2023
k-Shape2015