Оценка больших языковых моделей, обученных на коде
Evaluating Large Language Models Trained on Code
2021-07-07
SCID: 54.1/rdgg7ce4
Discuss with AI
CodexGPT-модель, дообученная на кодеHumanEvalсинтез программ из docstringсемплирование для генерации кода
Figures from the paper
Abstract (AI)
Мы представляем Codex, языковую модель GPT, дообученную на общедоступном коде с GitHub, и изучаем её возможности по написанию кода на Python. Отдельная производственная версия Codex используется в GitHub Copilot. На HumanEval, новом наборе для оценки, который мы публикуем для измерения функциональной корректности синтеза программ по docstring, наша модель решает 28.8% задач, тогда как GPT-3 решает 0%, а GPT-J — 11.4%. Более того, мы обнаружили, что повторная выборка из модели является удивительно эффективной стратегией для получения работающих решений на сложные запросы. С помощью этого метода мы решаем 70.2% задач при 100 сэмплах на задачу. Внимательное исследование модели выявляет её ограничения, включая затруднения с docstring, описывающими длинные цепочки операций, и с привязкой операций к переменным. Наконец, мы обсуждаем потенциальные широкие последствия внедрения мощных технологий генерации кода, включая вопросы безопасности, защиты и экономические аспекты.
Key Findings
1
У Codex есть ограничения: он испытывает трудности с docstring, описывающими длинные цепочки операций, и с привязкой операций к переменным.
2
Codex — это модель GPT, дообученная на общедоступном коде с GitHub, и использованная для исследования возможностей написания кода на Python.
3
На бенчмарке HumanEval Codex решает 28.8% задач, GPT-3 — 0%, а GPT-J — 11.4%.
4
Повторная выборка ответов эффективна: при 100 образцах на задачу Codex решает 70.2% задач HumanEval.
5
В статье обсуждаются более широкие последствия внедрения мощных технологий генерации кода, включая проблемы безопасности, защиты и экономики.
Research Object
Codex — языковая модель GPT, дообученная на публичном коде с GitHub (используемая для генерации Python‑кода)
Research Subject
Способности к генерации Python‑кода и функциональная корректность синтеза программ из докстрингов, включая показатели на бенчмарке HumanEval, стратегии многократной выборки, ограничения (например, описания длинных цепочек операций и привязка к переменным) и более широкие последствия развёртывания
Publication Details
Publication Date
2021-07-07
Journal
Publisher
ISSN
Cited by
1465
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest