сбалансированная точностьдообучение по инструкциямбольшие языковые моделипредсказание психического здоровьяпромптинг
Figures from the paper
Abstract (AI)
Достижения в области больших языковых моделей (LLM) сделали возможным применение таких моделей в самых разных задачах. Однако в исследовании понимания и расширения возможностей LLM в области психического здоровья по-прежнему существует существенный пробел. В настоящей работе представлена всесторонняя оценка нескольких LLM на различных задачах прогнозирования психического здоровья с использованием текстовых данных из интернета, включая Alpaca, Alpaca-LoRA, FLAN-T5, GPT-3.5 и GPT-4. Проведён широкий спектр экспериментов, охватывающий промптинг в режиме zero-shot, промптинг в режиме few-shot и дообучение по инструкциям. Результаты свидетельствуют о многообещающей, но ограниченной эффективности LLM в задачах психического здоровья при использовании конструкций zero-shot- и few-shot-промптов. Более того, эксперименты показывают, что дообучение по инструкциям может существенно повысить эффективность LLM одновременно во всех задачах. Наши лучшие дообученные модели Mental-Alpaca и Mental-FLAN-T5 превосходят лучшие конструкции промптов для GPT-3.5 — при размерах моделей, соответственно, в 25 и 15 раз превышающих их размеры — на 10,9% по сбалансированной точности, а также лучшие конструкции промптов для GPT-4 — при размерах моделей, соответственно, в 250 и 150 раз превышающих их размеры — на 4,8%. Кроме того, они демонстрируют результаты, сопоставимые с современными специализированными языковыми моделями для отдельных задач. Мы также провели исследовательский анализ возможностей LLM в задачах рассуждения о психическом здоровье, продемонстрировав многообещающие возможности некоторых моделей, таких как GPT-4. Полученные результаты обобщены в виде практических рекомендаций относительно потенциальных методов расширения возможностей LLM в задачах психического здоровья. Одновременно мы подчёркиваем важные ограничения, которые необходимо учитывать до внедрения таких моделей в реальную практику охраны психического здоровья, включая известные расовые и гендерные предубеждения. Мы обращаем внимание на существенные этические риски, сопутствующие этому направлению исследований.
Key Findings
1
Инструкционное дообучение существенно повышает качество одновременно на всех оцениваемых задачах психического здоровья.
2
Mental-Alpaca и Mental-FLAN-T5 превосходят варианты GPT-3.5 с оптимальными промптами на 10,9%, а варианты GPT-4 — на 4,8% по сбалансированной точности, несмотря на значительно меньший размер.
3
Лучшие дообученные модели достигают уровня современных специализированных языковых моделей; GPT-4 демонстрирует перспективные способности к рассуждению о психическом здоровье, однако применению мешают расовые и гендерные предубеждения и этические риски.
4
В исследовании оцениваются Alpaca, Alpaca-LoRA, FLAN-T5, GPT-3.5 и GPT-4 на разнообразных задачах прогнозирования психического здоровья по данным онлайн-текстов.
5
Обучение без примеров и с небольшим числом примеров демонстрирует перспективные, но ограниченные результаты на задачах психического здоровья.
Research Object
большие языковые модели, применяемые для прогнозирования психического здоровья на основе текстовых данных из интернета
Research Subject
их эффективность, повышение эффективности с помощью промптинга и дообучения на инструкциях, способность к рассуждению, а также ограничения, включая предвзятость и этические риски
Publication Details
Publication Date
2024-03-06
Journal
Publisher
ISSN
Cited by
214
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest