MERA: Всесторонняя оценка LLM для русского языка
MERA: A Comprehensive LLM Evaluation in Russian
2024-01-09
SCID: 54.1/sx9zbc53
Discuss with AI
11 доменов навыков21 тестовая задачаMERAМультиформатная оценка архитектур на русскоминструкционный бенчмарк на русскомblack-box тестисключение утечки данныхfew-shot оценкафундаментальные модели (FMs)языковые модели (LMs)таблица лидеров с системой отправкиоткрытый исходный код для оценкиzero-shot оценка
Figures from the paper
Abstract (AI)
За последние несколько лет одним из наиболее заметных достижений в исследованиях ИИ стали фундаментальные модели (foundation models, FMs), прежде всего рост моделей обработки языка (language models, LMs). С увеличением размеров моделей LMs показывают улучшение измеримых величин и появление новых качественных возможностей. Однако несмотря на внимание исследователей и быстрый рост приложений LMs, их способности, ограничения и связанные риски остаются недостаточно изученными. Для решения этих задач мы представляем открытый Multimodal Evaluation of Russian-language Architectures (MERA) — новый инструкционный бенчмарк для оценки фундаментальных моделей, ориентированных на русский язык. Бенчмарк включает 21 задачу оценки для генеративных моделей в 11 областях навыков и разработан как тест «черного ящика» для исключения утечек данных. В статье предлагается методология оценки FMs и LMs в условиях нулевого и малошотного (zero- и few-shot) фиксированного инструкционного формата, которую можно расширить на другие модальности. Мы предоставляем методику оценки, открытый код для проведения оценки MERA и таблицу лидеров с системой приёма заявок. В качестве базовых систем мы оценили открытые LMs и установили, что они по-прежнему значительно уступают человеческому уровню. Мы публично выпускаем MERA, чтобы направить будущие исследования, предвосхитить появление новых возможностей моделей, стандартизировать процедуры оценки и учитывать потенциальные общественные риски.
Key Findings
1
Предоставлены открытая кодовая база, лидерборд и система сабмитов для MERA с целью стандартизации оценки и отслеживания моделей.
2
Базовая оценка открытых языковых моделей показывает, что они по-прежнему значительно уступают человеческому уровню производительности в MERA.
3
MERA — новый открытый многомодальный бенчмарк с инструкциями, специально для оценки фундаментальных моделей на русском языке.
4
Бенчмарк включает 21 задачу оценки в 11 областях навыков и разработан как black-box тест для исключения утечки данных.
5
В статье представлена методика оценки в zero-shot и few-shot режимах с фиксированными инструкциями, применимая к другим модальностям.
Research Object
Бенчмарк Multimodal Evaluation of Russian-language Architectures (MERA) для оценки фундаментальных и языковых моделей
Research Subject
Методология оценки и анализ возможностей, ограничений и рисков фундаментальных/больших языковых моделей по 21 задаче в 11 доменах навыков на русском языке с использованием чёрного ящика в нулевом и нескольких примерах (zero- и few-shot) с фиксированной инструкцией, а также базовые результаты и система лидеров/подачи заявок
Publication Details
Publication Date
2024-01-09
Journal
Publisher
ISSN
Cited by
2
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest