Сегментация многомерных смешанных данных с использованием кодирования с потерями и сжатия данных

Segmentation of Multivariate Mixed Data via Lossy Data Coding and Compression
Yi Ma, John Wright, Wei Hong, Harm Derksen
2007-08-22

смеси гауссовских распределенийсжатие данных с потерямисегментация многомерных смешанных данныхфазовые переходытеория скорость–искажение
В этой статье, опираясь на идеи кодирования с потерями и сжатия данных, мы представляем простой, но эффективный метод сегментации многомерных смешанных данных, полученных из смеси гауссовских распределений, которые могут быть почти вырожденными. Цель состоит в нахождении оптимальной сегментации, минимизирующей общую длину кодирования сегментированных данных при заданном уровне искажений. Анализируя длину/скорость кодирования смешанных данных, мы формально устанавливаем тесную связь сегментации данных со многими фундаментальными концепциями сжатия данных с потерями и теории скорость–искажение. Мы показываем, что детерминированная сегментация является приближённо асимптотически оптимальным решением задачи сжатия смешанных данных. Мы предлагаем очень простой и эффективный алгоритм, зависящий от единственного параметра — допустимого уровня искажений. При любом заданном уровне искажений алгоритм автоматически определяет соответствующие число и размерность групп и не требует оценки параметров. Результаты моделирования выявляют интересное поведение, напоминающее фазовый переход, для числа сегментов при изменении уровня искажений или количества выбросов. Наконец, мы демонстрируем, как этот метод может быть непосредственно применён для сегментации реальных изображений и биоинформатических данных.
1
Предложена постановка сегментации многомерных смешанных данных через минимизацию общей длины кодирования при заданном уровне искажения.
2
Показано, что детерминированная сегментация является приближённо асимптотически оптимальной для сжатия смешанных данных.
3
Моделирование выявляет фазопереходоподобные изменения числа сегментов при изменении уровня искажения или количества выбросов; метод продемонстрирован на изображениях и биоинформатических данных.
4
Метод работает со смесями гауссовских распределений, включая почти вырожденные случаи, и связывает сегментацию с теорией сжатия с потерями и теорией «скорость–искажение».
5
Предложенный алгоритм использует только допустимый уровень искажения и автоматически определяет число и размерность групп без оценки параметров.

многомерные смешанные данные, полученные из смесей почти вырожденных гауссовских распределений

оптимальная сегментация при заданном ограничении на искажение, включая определение числа и размерностей групп на основе минимизации общей длины кодирования

Publication Details
Publication Date
2007-08-22
Journal
Publisher
ISSN
Access Type
Author Information
Authors
Yi Ma
John Wright
Wei Hong
Harm Derksen
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%