Автоматическая генерация мультимедийных учебных материалов на основе генеративного ИИ: на примере танской поэзии

Automatic Generation of Multimedia Teaching Materials Based on Generative AI: Taking Tang Poetry as an Example
Xu Chen, Di Wu
2024-01-01

ситуационные видео по танской поэзиигенеративный ИИгенерация изображения из текстасинтез речи из текстасинтез видео
Генеративный ИИ широко признан одной из наиболее влиятельных технологий будущего, вызвав парадигмальный сдвиг в научных исследованиях. Область образования также претерпела значительное влияние этой трансформирующей технологии: исследователи изучают применение генеративного ИИ, в частности ChatGPT, в образовании. Однако существующие исследования в основном сосредоточены на генерации текста из текста, и по-прежнему относительно мало работ, посвящённых использованию мультимодальных возможностей генерации для решения ключевых задач обучения, поддерживаемого мультимодальными данными. В настоящей статье мы представляем техническую структуру для генерации ситуационных видеороликов по танской поэзии, делая акцент на использовании генеративного ИИ для удовлетворения потребности в мультимедийных учебных ресурсах. Наша структура включает три основных модуля: семантическое / ситуативное понимание текста, создание изображений и генерацию видео. Кроме того, мы разработали систему генерации ситуационных видеороликов, которая объединяет различные технологии, включая модели текст→текст, модели текст→изображение, интерполяцию изображений, синтез речи из текста и синтез видео. Для оценки эффективности модулей в системе генерации ситуационных видеороликов по танской поэзии мы провели сравнительный анализ с использованием распространённых моделей текст→изображение и текст→видео. Эмпирические результаты показывают, что наш подход способен генерировать изображения с большей семантической схожестью с поэмами, что обеспечивает лучшее понимание коннотаций и ключевых компонентов произведений. Одновременно с этим сгенерированные видеоролики по танской поэзии могут существенно способствовать снижению когнитивной нагрузки и повышению уровня понимания в процессе обучения. Наше исследование демонстрирует потенциал генеративного ИИ в сфере образования, в частности в области мультимодальных учебных ресурсов.
1
Сравнительный анализ показывает, что предложенный подход генерирует изображения с большей семантической схожестью с поэмами, чем распространённые модели text-to-image и text-to-video.
2
Показан потенциал мультимодального генеративного ИИ для решения дефицита мультимедийных учебных материалов в образовании.
3
Разработана система генерации ситуационных видео, объединяющая text-to-text, text-to-image, интерполяцию изображений, синтез речи и синтез видео.
4
Сгенерированные видео по танской поэзии могут значительно снизить когнитивную нагрузку учащихся и улучшить понимание коннотаций и ключевых компонентов поэм.
5
Представлена техническая рамочная схема для генерации ситуационных видео по танской поэзии с модулями понимания текста, создания изображений и генерации видео.

Система на основе генеративного ИИ для автоматической генерации мультимедийных учебных материалов (ситуационные изображения и видео) для танской поэзии

Эффективность мультимодальных модулей системы (понимание текстовой ситуации, преобразование текста в изображение, интерполяция изображений, синтез речи по тексту и синтез видео) в создании семантически согласованных изображений и ситуационных видео, снижающих когнитивную нагрузку и повышающих понимание танской поэзии

Publication Details
Publication Date
2024-01-01
Journal
Publisher
ISSN
Cited by
65
Access Type
Author Information
Authors
Xu Chen
Di Wu
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%