Уточнение псевдоаудио-подсказок с выравниванием речи и текста для адаптации по домену только по тексту в ASR на основе LLM

Refining Pseudo-Audio Prompts with Speech-Text Alignment for Text-Only Domain Adaptation in LLM-Based ASR
Ryo Magoshi, Takashi Maekaku, Yusuke Shinohara
2026-05-14

ASR на основе LLMпокрытие вне словаряпсевдо-аудио подсказкивыравнивание речи и текстаадаптация домена по тексту
Модели автоматического распознавания речи на основе больших языковых моделей (LLM) демонстрируют высокую эффективность за счёт связи аудиоэнкодеров и LLM. Однако дефицит пар «речь — транскрипция» часто затрудняет адаптацию к новым доменам, поэтому критически важна адаптация по домену на основе только текстовых данных. Существующие подходы обычно либо дообучают только LLM, либо используют псевдоаудио-подсказки. Первый вариант игнорирует важный акустический контекст, тогда как второй либо страдает ограниченной масштабируемостью при нехватке данных, либо даёт мало выразительные подсказки, опираясь только на текстовые признаки и игнорируя аудиомодальность. Чтобы решить эту проблему, мы предлагаем усовершенствованную схему, которая явно моделирует выравнивание речи и текста. Наш метод эффективно генерирует высоковыразительные псевдоаудио-подсказки, преодолевающие модальную пропасть и обеспечивающие эффективную адаптацию к целевому домену. Эксперименты показывают, что предложенный подход превосходит существующие методы, работающие только с текстом, улучшая как общие показатели ошибок, так и покрытие вне словаря.
1
Существующие методы адаптации домена только по тексту для ASR на базе LLM либо дообучают только LLM (теряя акустический контекст), либо используют псевдо-аудио подсказки, которые либо не масштабируются, либо невыразительны.
2
Эксперименты показывают, что предложенный подход превосходит существующие текстовые методы, снижая общие ошибки и улучшая покрытие вне словарного запаса.
3
Авторы предлагают фреймворк, который явно моделирует выравнивание речи и текста для генерации более выразительных псевдо-аудио подсказок, закрывающих модальную пропасть аудио-текста.
4
Метод позволяет эффективно генерировать высоковыразительные псевдо-аудио подсказки, улучшая адаптацию к целевому домену без парных данных речь–транскрипция.

Система автоматического распознавания речи на базе больших языковых моделей, адаптируемая к целевому домену с помощью только текстовых данных через псевдо-аудио подсказки

Генерация и уточнение выразительных псевдо-аудио подсказок с явным выравниванием речи и текста для обеспечения эффективной адаптации к домену при наличии только текста и улучшения показателей ошибок ASR и покрытия вне словаря

Publication Details
Publication Date
2026-05-14
Journal
Publisher
ISSN
Cited by
0
Access Type
Author Information
Authors
Ryo Magoshi
Takashi Maekaku
Yusuke Shinohara
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%