MERA: Всесторонняя оценка LLM для русского языка

MERA: A Comprehensive LLM Evaluation in Russian
Alena Fenogenova, Artem Chervyakov, Nikita Martynov, Anastasia Kozlova, Maria Tikhonova, Anton Emelyanov, Denis Shevelev, Pavel Lebedev, Leonid S. Sinev, Ulyana Isaeva, Katerina Kolomeytseva, Daniil Moskovskiy, Elizaveta Goncharova, Nikita Savushkin, Polina Mikhailova, Denis Dimitrov, Alexander Panchenko, Sergei Markov, Albina Akhmetgareeva
2024-01-09

11 доменов навыков21 тестовая задачаMERAМультиформатная оценка архитектур на русскоминструкционный бенчмарк на русскомblack-box тестисключение утечки данныхfew-shot оценкафундаментальные модели (FMs)языковые модели (LMs)таблица лидеров с системой отправкиоткрытый исходный код для оценкиzero-shot оценка
За последние несколько лет одним из наиболее заметных достижений в исследованиях ИИ стали фундаментальные модели (foundation models, FMs), прежде всего рост моделей обработки языка (language models, LMs). С увеличением размеров моделей LMs показывают улучшение измеримых величин и появление новых качественных возможностей. Однако несмотря на внимание исследователей и быстрый рост приложений LMs, их способности, ограничения и связанные риски остаются недостаточно изученными. Для решения этих задач мы представляем открытый Multimodal Evaluation of Russian-language Architectures (MERA) — новый инструкционный бенчмарк для оценки фундаментальных моделей, ориентированных на русский язык. Бенчмарк включает 21 задачу оценки для генеративных моделей в 11 областях навыков и разработан как тест «черного ящика» для исключения утечек данных. В статье предлагается методология оценки FMs и LMs в условиях нулевого и малошотного (zero- и few-shot) фиксированного инструкционного формата, которую можно расширить на другие модальности. Мы предоставляем методику оценки, открытый код для проведения оценки MERA и таблицу лидеров с системой приёма заявок. В качестве базовых систем мы оценили открытые LMs и установили, что они по-прежнему значительно уступают человеческому уровню. Мы публично выпускаем MERA, чтобы направить будущие исследования, предвосхитить появление новых возможностей моделей, стандартизировать процедуры оценки и учитывать потенциальные общественные риски.
1
Предоставлены открытая кодовая база, лидерборд и система сабмитов для MERA с целью стандартизации оценки и отслеживания моделей.
2
Базовая оценка открытых языковых моделей показывает, что они по-прежнему значительно уступают человеческому уровню производительности в MERA.
3
MERA — новый открытый многомодальный бенчмарк с инструкциями, специально для оценки фундаментальных моделей на русском языке.
4
Бенчмарк включает 21 задачу оценки в 11 областях навыков и разработан как black-box тест для исключения утечки данных.
5
В статье представлена методика оценки в zero-shot и few-shot режимах с фиксированными инструкциями, применимая к другим модальностям.

Бенчмарк Multimodal Evaluation of Russian-language Architectures (MERA) для оценки фундаментальных и языковых моделей

Методология оценки и анализ возможностей, ограничений и рисков фундаментальных/больших языковых моделей по 21 задаче в 11 доменах навыков на русском языке с использованием чёрного ящика в нулевом и нескольких примерах (zero- и few-shot) с фиксированной инструкцией, а также базовые результаты и система лидеров/подачи заявок

Publication Details
Publication Date
2024-01-09
Journal
Publisher
ISSN
Cited by
2
Access Type
Author Information
Authors
Alena Fenogenova
Artem Chervyakov
Nikita Martynov
Anastasia Kozlova
Maria Tikhonova
Anton Emelyanov
Denis Shevelev
Pavel Lebedev
Leonid S. Sinev
Ulyana Isaeva
Katerina Kolomeytseva
Daniil Moskovskiy
Elizaveta Goncharova
Nikita Savushkin
Polina Mikhailova
Denis Dimitrov
Alexander Panchenko
Sergei Markov
Albina Akhmetgareeva
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%