Моделирование для сжатия текста

Modeling for text compression
Tim Bell, Ian H. Witten, John G. Cleary
1989-12-01

адаптивное моделированиесловарное моделированиемоделирование конечного контекстамоделирование конечного автоматасжатие текста
Наиболее эффективные схемы сжатия текста используют большие модели для предсказания следующих символов. Фактические символы кодируются относительно предсказания, что обеспечивает сжатие информации. Наиболее эффективные модели строятся адаптивно, на основе уже просмотренного текста. В статье рассматриваются успешные стратегии адаптивного моделирования, пригодные для практических систем сжатия текста. Эти стратегии подразделяются на три основные класса: моделирование с конечным контекстом, при котором несколько последних символов используются для задания условного распределения вероятностей следующего символа; моделирование с конечными состояниями, при котором распределение определяется текущим состоянием и которое включает моделирование с конечным контекстом как важный частный случай; и словарное моделирование, при котором строки символов заменяются указателями на элементы динамически формируемого словаря. Также приводится сравнение различных методов на одних и тех же тестовых текстах и анализируются направления дальнейших исследований.
1
Адаптивные модели, формируемые на основе уже просмотренного текста, признаны наиболее практичным и успешным подходом к сжатию текста.
2
Эффективные схемы сжатия текста используют крупные предиктивные модели, кодируя фактические следующие символы относительно предсказанных вероятностей для уменьшения объёма информации.
3
Успешные стратегии адаптивного моделирования включают модели конечного контекста, конечных состояний и словарные модели; моделирование конечного контекста является важным частным случаем моделирования конечных состояний.
4
В статье сравниваются различные методы на одинаковых тестовых текстах и анализируются направления дальнейших исследований.

системы адаптивного сжатия текста

успешные стратегии адаптивного моделирования и их сравнительная эффективность при предсказании последовательных символов, включая моделирование с конечным контекстом, конечными состояниями и словарное моделирование

Publication Details
Publication Date
1989-12-01
Journal
ACM Computing Surveys
Publisher
Association for Computing Machinery
ISSN
0360-0300
Cited by
262
Access Type
Author Information
Authors
Tim Bell
Ian H. Witten
John G. Cleary
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%