Уточнение псевдоаудио-подсказок с выравниванием речи и текста для адаптации по домену только по тексту в ASR на основе LLM
Refining Pseudo-Audio Prompts with Speech-Text Alignment for Text-Only Domain Adaptation in LLM-Based ASR
2026-05-14
SCID: 54.1/9mggpu3z
Discuss with AI
ASR на основе LLMпокрытие вне словаряпсевдо-аудио подсказкивыравнивание речи и текстаадаптация домена по тексту
Figures from the paper
Abstract (AI)
Модели автоматического распознавания речи на основе больших языковых моделей (LLM) демонстрируют высокую эффективность за счёт связи аудиоэнкодеров и LLM. Однако дефицит пар «речь — транскрипция» часто затрудняет адаптацию к новым доменам, поэтому критически важна адаптация по домену на основе только текстовых данных. Существующие подходы обычно либо дообучают только LLM, либо используют псевдоаудио-подсказки. Первый вариант игнорирует важный акустический контекст, тогда как второй либо страдает ограниченной масштабируемостью при нехватке данных, либо даёт мало выразительные подсказки, опираясь только на текстовые признаки и игнорируя аудиомодальность. Чтобы решить эту проблему, мы предлагаем усовершенствованную схему, которая явно моделирует выравнивание речи и текста. Наш метод эффективно генерирует высоковыразительные псевдоаудио-подсказки, преодолевающие модальную пропасть и обеспечивающие эффективную адаптацию к целевому домену. Эксперименты показывают, что предложенный подход превосходит существующие методы, работающие только с текстом, улучшая как общие показатели ошибок, так и покрытие вне словаря.
Key Findings
1
Существующие методы адаптации домена только по тексту для ASR на базе LLM либо дообучают только LLM (теряя акустический контекст), либо используют псевдо-аудио подсказки, которые либо не масштабируются, либо невыразительны.
2
Эксперименты показывают, что предложенный подход превосходит существующие текстовые методы, снижая общие ошибки и улучшая покрытие вне словарного запаса.
3
Авторы предлагают фреймворк, который явно моделирует выравнивание речи и текста для генерации более выразительных псевдо-аудио подсказок, закрывающих модальную пропасть аудио-текста.
4
Метод позволяет эффективно генерировать высоковыразительные псевдо-аудио подсказки, улучшая адаптацию к целевому домену без парных данных речь–транскрипция.
Research Object
Система автоматического распознавания речи на базе больших языковых моделей, адаптируемая к целевому домену с помощью только текстовых данных через псевдо-аудио подсказки
Research Subject
Генерация и уточнение выразительных псевдо-аудио подсказок с явным выравниванием речи и текста для обеспечения эффективной адаптации к домену при наличии только текста и улучшения показателей ошибок ASR и покрытия вне словаря
Publication Details
Publication Date
2026-05-14
Journal
Publisher
ISSN
Cited by
0
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest