Mental-LLM

Mental-LLM
Xuhai Xu, Bingsheng Yao, Yuanzhe Dong, Saadia Gabriel, Hong Yu, James Hendler, Marzyeh Ghassemi, Anind K. Dey, Dakuo Wang
2024-03-06

сбалансированная точностьдообучение по инструкциямбольшие языковые моделипредсказание психического здоровьяпромптинг
Достижения в области больших языковых моделей (LLM) сделали возможным применение таких моделей в самых разных задачах. Однако в исследовании понимания и расширения возможностей LLM в области психического здоровья по-прежнему существует существенный пробел. В настоящей работе представлена всесторонняя оценка нескольких LLM на различных задачах прогнозирования психического здоровья с использованием текстовых данных из интернета, включая Alpaca, Alpaca-LoRA, FLAN-T5, GPT-3.5 и GPT-4. Проведён широкий спектр экспериментов, охватывающий промптинг в режиме zero-shot, промптинг в режиме few-shot и дообучение по инструкциям. Результаты свидетельствуют о многообещающей, но ограниченной эффективности LLM в задачах психического здоровья при использовании конструкций zero-shot- и few-shot-промптов. Более того, эксперименты показывают, что дообучение по инструкциям может существенно повысить эффективность LLM одновременно во всех задачах. Наши лучшие дообученные модели Mental-Alpaca и Mental-FLAN-T5 превосходят лучшие конструкции промптов для GPT-3.5 — при размерах моделей, соответственно, в 25 и 15 раз превышающих их размеры — на 10,9% по сбалансированной точности, а также лучшие конструкции промптов для GPT-4 — при размерах моделей, соответственно, в 250 и 150 раз превышающих их размеры — на 4,8%. Кроме того, они демонстрируют результаты, сопоставимые с современными специализированными языковыми моделями для отдельных задач. Мы также провели исследовательский анализ возможностей LLM в задачах рассуждения о психическом здоровье, продемонстрировав многообещающие возможности некоторых моделей, таких как GPT-4. Полученные результаты обобщены в виде практических рекомендаций относительно потенциальных методов расширения возможностей LLM в задачах психического здоровья. Одновременно мы подчёркиваем важные ограничения, которые необходимо учитывать до внедрения таких моделей в реальную практику охраны психического здоровья, включая известные расовые и гендерные предубеждения. Мы обращаем внимание на существенные этические риски, сопутствующие этому направлению исследований.
1
Инструкционное дообучение существенно повышает качество одновременно на всех оцениваемых задачах психического здоровья.
2
Mental-Alpaca и Mental-FLAN-T5 превосходят варианты GPT-3.5 с оптимальными промптами на 10,9%, а варианты GPT-4 — на 4,8% по сбалансированной точности, несмотря на значительно меньший размер.
3
Лучшие дообученные модели достигают уровня современных специализированных языковых моделей; GPT-4 демонстрирует перспективные способности к рассуждению о психическом здоровье, однако применению мешают расовые и гендерные предубеждения и этические риски.
4
В исследовании оцениваются Alpaca, Alpaca-LoRA, FLAN-T5, GPT-3.5 и GPT-4 на разнообразных задачах прогнозирования психического здоровья по данным онлайн-текстов.
5
Обучение без примеров и с небольшим числом примеров демонстрирует перспективные, но ограниченные результаты на задачах психического здоровья.

большие языковые модели, применяемые для прогнозирования психического здоровья на основе текстовых данных из интернета

их эффективность, повышение эффективности с помощью промптинга и дообучения на инструкциях, способность к рассуждению, а также ограничения, включая предвзятость и этические риски

Publication Details
Publication Date
2024-03-06
Journal
Publisher
ISSN
Cited by
214
Access Type
Author Information
Authors
Xuhai Xu
Bingsheng Yao
Yuanzhe Dong
Saadia Gabriel
Hong Yu
James Hendler
Marzyeh Ghassemi
Anind K. Dey
Dakuo Wang
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%