BloombergGPT: большая языковая модель для финансов

BloombergGPT: A Large Language Model for Finance
Ozan İrsoy, Sebastian Gehrmann, Mark Dredze, Steven Lu, Prabhanjan Kambadur, Shijie Wu, Vadim Dabravolski, David Rosenberg, Gideon Mann
2023-03-30

языковая модель с 50 миллиардами параметровBloombergGPTфинансовые NLP бенчмаркифинансовый датасет (363 млрд токенов)смешанное обучение на датасетах (финансовые + общие 345 млрд токенов)
Применение методов обработки естественного языка (NLP) в финансовых технологиях широко и сложно и включает такие задачи, как анализ сентимента, распознавание именованных сущностей и ответы на вопросы. Большие языковые модели (LLM) показали свою эффективность в различных задачах; однако в литературе не сообщалось о LLM, специализированной для финансовой области. В настоящей работе мы представляем BloombergGPT, языковую модель с 50 миллиардами параметров, обученную на широком спектре финансовых данных. Мы собрали датасет объемом 363 миллиарда токенов на основе обширных источников данных Bloomberg, возможно, крупнейший доменно-специфический датасет на сегодняшний день, дополненный 345 миллиардами токенов из общих наборов данных. Мы валидации BloombergGPT на стандартных бенчмарках для LLM, открытых финансовых бенчмарках и наборе внутренних бенчмарков, наиболее точно отражающих предполагаемое использование. Обучение на смешанном датасете привело к модели, которая превосходит существующие модели по финансовым задачам с существенными отрывами, не жертвуя при этом производительностью на общих LLM-бенчмарках. Кроме того, мы поясняем выбор моделей, процесс обучения и методологию оценки. Мы публикуем Training Chronicles (Приложение C) с описанием нашего опыта обучения BloombergGPT.
1
BloombergGPT — это крупная языковая модель с 50 миллиардами параметров, специально обученная для финансовой области.
2
BloombergGPT сохраняет конкурентную производительность на стандартных общих бенчмарках LLM при улучшении результатов по финансовым задачам.
3
Обучение на смешанном наборе данных обеспечивает модель, которая превосходит существующие модели по финансовым задачам с существенным отрывом.
4
В статье описаны выборы моделирования, процесс обучения, методология оценки и представлены подробные Training Chronicles (Приложение C).
5
Корпус для обучения включает 363 миллиарда токенов финансовых данных и дополнительно 345 миллиардов токенов общих датасетов.

BloombergGPT — языковая модель большого размера с 50 миллиардами параметров, обученная на финансовых и общих корпусах текстов

Работоспособность и поведение BloombergGPT на финансовых задачах NLP и общих бенчмарках LLM в зависимости от смешанного доменного (финансовые + общие) масштабного обучающего корпуса и принятых решений при тренировке

Publication Details
Publication Date
2023-03-30
Journal
Publisher
ISSN
Cited by
309
Access Type
Author Information
Authors
Ozan İrsoy
Sebastian Gehrmann
Mark Dredze
Steven Lu
Prabhanjan Kambadur
Shijie Wu
Vadim Dabravolski
David Rosenberg
Gideon Mann
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%