Оценка больших языковых моделей, обученных на коде

Evaluating Large Language Models Trained on Code
Łukasz Kaiser, Jie Tang, Michael Petrov, Alec Radford, Girish Sastry, Pamela Mishkin, Gretchen Krueger, Ilya Sutskever, Dario Amodei, Sam McCandlish, Jared Kaplan, Peter Welinder, Wojciech Zaremba, Bob McGrew, Matthias Plappert, Alex Ray, Alex Nichol, Miles Brundage, Ariel Herbert-Voss, Raul Puri, Heewoo Jun, Scott Gray, Nick Ryder, Clemens Winter, Christopher Hesse, Mark Chen, William S. Saunders, Jerry Tworek, Nikolas Tezak, Felipe Petroski Such, Heidy Khlaaf, Elizabeth A. Barnes, Nicholas Joseph, I. Babuschkin, Harrison Edwards, Matthew M. Knight, Greg Brockman, Qiming Yuan, Henrique Pondé de Oliveira Pinto, Yuri Burda, Brooke Chan, Mikhail Pavlov, Alethea Power, Mohammad Bavarian, Philippe Tillet, Dave Cummings, Fotios Chantzis, William H. Guss, Alex Paino, Suchir Balaji, Shantanu Jain, Andrew N. Carr, Jan Leike, Joshua Achiam, Vedant Misra, Evan Morikawa, Mira Murati, Katie Mayer
2021-07-07

CodexGPT-модель, дообученная на кодеHumanEvalсинтез программ из docstringсемплирование для генерации кода
Мы представляем Codex, языковую модель GPT, дообученную на общедоступном коде с GitHub, и изучаем её возможности по написанию кода на Python. Отдельная производственная версия Codex используется в GitHub Copilot. На HumanEval, новом наборе для оценки, который мы публикуем для измерения функциональной корректности синтеза программ по docstring, наша модель решает 28.8% задач, тогда как GPT-3 решает 0%, а GPT-J — 11.4%. Более того, мы обнаружили, что повторная выборка из модели является удивительно эффективной стратегией для получения работающих решений на сложные запросы. С помощью этого метода мы решаем 70.2% задач при 100 сэмплах на задачу. Внимательное исследование модели выявляет её ограничения, включая затруднения с docstring, описывающими длинные цепочки операций, и с привязкой операций к переменным. Наконец, мы обсуждаем потенциальные широкие последствия внедрения мощных технологий генерации кода, включая вопросы безопасности, защиты и экономические аспекты.
1
У Codex есть ограничения: он испытывает трудности с docstring, описывающими длинные цепочки операций, и с привязкой операций к переменным.
2
Codex — это модель GPT, дообученная на общедоступном коде с GitHub, и использованная для исследования возможностей написания кода на Python.
3
На бенчмарке HumanEval Codex решает 28.8% задач, GPT-3 — 0%, а GPT-J — 11.4%.
4
Повторная выборка ответов эффективна: при 100 образцах на задачу Codex решает 70.2% задач HumanEval.
5
В статье обсуждаются более широкие последствия внедрения мощных технологий генерации кода, включая проблемы безопасности, защиты и экономики.

Codex — языковая модель GPT, дообученная на публичном коде с GitHub (используемая для генерации Python‑кода)

Способности к генерации Python‑кода и функциональная корректность синтеза программ из докстрингов, включая показатели на бенчмарке HumanEval, стратегии многократной выборки, ограничения (например, описания длинных цепочек операций и привязка к переменным) и более широкие последствия развёртывания

Publication Details
Publication Date
2021-07-07
Journal
Publisher
ISSN
Cited by
1465
Access Type
Author Information
Authors
Łukasz Kaiser
Jie Tang
Michael Petrov
Alec Radford
Girish Sastry
Pamela Mishkin
Gretchen Krueger
Ilya Sutskever
Dario Amodei
Sam McCandlish
Jared Kaplan
Peter Welinder
Wojciech Zaremba
Bob McGrew
Matthias Plappert
Alex Ray
Alex Nichol
Miles Brundage
Ariel Herbert-Voss
Raul Puri
Heewoo Jun
Scott Gray
Nick Ryder
Clemens Winter
Christopher Hesse
Mark Chen
William S. Saunders
Jerry Tworek
Nikolas Tezak
Felipe Petroski Such
Heidy Khlaaf
Elizabeth A. Barnes
Nicholas Joseph
I. Babuschkin
Harrison Edwards
Matthew M. Knight
Greg Brockman
Qiming Yuan
Henrique Pondé de Oliveira Pinto
Yuri Burda
Brooke Chan
Mikhail Pavlov
Alethea Power
Mohammad Bavarian
Philippe Tillet
Dave Cummings
Fotios Chantzis
William H. Guss
Alex Paino
Suchir Balaji
Shantanu Jain
Andrew N. Carr
Jan Leike
Joshua Achiam
Vedant Misra
Evan Morikawa
Mira Murati
Katie Mayer
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%