В новом интервью Сэм Алтман дал редкую оценку:
«Он, возможно, самый важный, но малоизвестный исследователь в истории ИИ».
Этот человек — Алек Радфорд, настоящий отец GPT.

Возможно, вы о нем не слышали, но почти наверняка пользовались тем, что он изобрел.
Он является первым автором статей по GPT-1, GPT-2, CLIP, Whisper.
Кроме того, он участвовал в ключевых работах над GPT-3, DALL·E, Scaling Law, GPT-4 и GPT-4o.
Странно, но у человека с такой биографией, охватывающей почти каждый ключевой поворот в больших моделях, нет докторской степени, и он редко дает интервью.
Когда ChatGPT покорил мир, он почти не появлялся в свете софитов.

Но если пролистать научные статьи по ИИ за последние десять лет, обнаружится еще более странный феномен:
Каждый раз, когда модель начинала приобретать новую, ранее не существовавшую универсальную способность, имя Алека Радфорда часто уже было в списке авторов.
Настоящий взлет OpenAI начался с найма Алека
В последнем выпуске подкаста «Invest Like The Best» ведущий спросил Алтмана:
«Кого из тех, кто оставался за кулисами на протяжении всего пути компании, вы цените больше всего?»
Алтман, не задумываясь, ответил: Алека Радфорда.
Работа Алека позже действительно превратилась в серию GPT.
Кроме того, он постоянно вдохновлял и направлял окружающих, продвигая исследования в направлениях, которые позже оказывались чрезвычайно важными.
Журнал Wired также дал чрезвычайно весомую оценку:
Путь к успеху OpenAI действительно начался, когда компания наняла тогда еще неизвестного Алека Радфорда.
В 2016 году Алек присоединился к OpenAI. Ему тогда было всего 23 года.
Тогда он был еще молодым парнем, который ел пиццу с ананасами и луком по ночам, участвовал в соревнованиях Kaggle с однокурсниками и основал в своей комнате в общежитии в Бостоне небольшую AI-компанию: Indico.

Приняв приглашение присоединиться к OpenAI, Алек не считал это чем-то очень важным, скорее, эта работа была для него «чем-то вроде аспирантуры».
Не было большого краткосрочного давления, не было обязательного немедленного создания продукта. Он мог свободно искать ответ на вопрос, который тогда еще никто не знал: Что на самом деле могут делать языковые модели?
Его первая попытка — обучение языковой модели на 2 миллиардах комментариев с Reddit. Масштаб данных был немалым, но результат оказался бесполезным.
Этот эксперимент, как и многие ранние исследования OpenAI, провалился.
Но OpenAI позволил ему продолжать. Бывший технический директор Грег Брокман вспоминает:
«Мы тогда подумали, Алек — крутой, пусть делает то, что хочет».
Таким образом, этот молодой человек мог продолжать свои эксперименты. Но вскоре он столкнулся с ограниченными вычислительными мощностями OpenAI.
Поскольку нельзя было запустить более масштабный эксперимент, Алек сузил область и взял около 100 миллионов отзывов с Amazon, заставив модель делать до смешного простую вещь: предсказывать следующий символ на основе предыдущего текста.
В этом процессе произошел неожиданный прорыв.
Хотя модель никто не учил, что такое положительный или отрицательный отзыв, внутри модели появился нейрон, который начал самостоятельно различать положительные и отрицательные эмоции в тексте.
Настроив его в одном направлении, модель легче генерировала положительные отзывы; настроив в другом — начинала критиковать товар.

Позже OpenAI назвал это «нейроном бесконтрольного настроения».
Этот эксперимент впервые дал ответ, который искал Алек:
Когда модель обучается на достаточно большом объеме данных для выполнения задачи предсказания, она может самостоятельно освоить некоторые способности, которые никогда явно не прописывались в цели обучения.
Илья Суцкевер также поощрял его выйти за рамки отзывов с Amazon и заставить модель изучать более масштабные и разнообразные тексты, даже весь интернет.
Проблема была в том, что при тогдашней архитектуре нейронных сетей обработка такого огромного объема данных могла занять годы.
Но вскоре OpenAI повезло. Потому что в 2017 году появилась статья Google, изменившая ход развития ИИ: «Attention Is All You Need».

Илья сразу же обратил внимание на архитектуру Transformer. Его первая реакция была: «Это именно то, чего мы ждали!»
Алек немедленно подключил Transformer к своей экспериментальной линии. Он взял набор данных BooksCorpus, включающий более 7000 еще не опубликованных английских книг, охватывающих жанры любовных романов, приключений и фэнтези.
В отличие от многих наборов данных, где предложения разбиты, книги сохраняют длинное непрерывное повествование, что лучше подходит для обучения модели дальним связям между контекстами.
Он не использовал Transformer для машинного перевода, как Google, а заставил его предсказывать следующее наиболее вероятное слово.
Машина отреагировала: одно слово, затем другое, и еще одно — каждое новое слово выводилось из паттернов, скрытых в тех семи тысячах книг.
Для Алека «прогресс за эти две недели был больше, чем за предыдущие два года вместе взятые». Этот эксперимент в конечном итоге стал основой предобучения для GPT-1.
Он с коллегами начал обсуждать направление под названием «Большой Трансформер»: не усложнять модель множеством хитрых правил, а просто увеличить масштаб модели, данных и вычислений, и посмотреть, чему она еще научится.
В 2018 году у этого подхода появилось официальное название:
Generative Pre-trained Transformer (Генеративный предобученный Трансформер), сокращенно GPT.
В первой статье о GPT было четыре автора, первым в списке стоял Алек Радфорд.

GPT-1 не сразу потряс мир, но он дал OpenAI нечто более важное: направление.
После прорыва Алека руководство OpenAI приняло ряд ключевых решений. Они начали сосредотачивать исследовательские ресурсы, ранее распределенные по робототехнике и другим проектам, на языковых моделях.
Вместо того чтобы продолжать проектировать сложные новые структуры, команда предпочла собирать больше данных, вкладывать больше вычислительных ресурсов и продолжать масштабировать уже показавший потенциал метод.
Год спустя был выпущен GPT-2.
Количество его параметров увеличилось со 117 миллионов в GPT-1 до 1,5 миллиарда, а данные для обучения расширились с 7000 книг до примерно 8 миллионов веб-страниц.
В статье о GPT-2 было 6 авторов, Алек по-прежнему стоял первым, разделяя первое авторство с Джеффри Ву.

На этот раз модель больше не нуждалась в переобучении для каждой задачи. Просто предсказывая следующее слово, она уже могла пытаться переводить, отвечать на вопросы, делать выжимки и даже показывать неплохие результаты в нескольких тестах с нулевым образцом.
В начале 2020 года OpenAI описал эту взаимосвязь в статье «Законы масштабирования нейронных языковых моделей».
Алек также был в числе 10 авторов. Суждения, накопленные в ходе предыдущих экспериментов, начали описываться как предсказуемые математические закономерности.

В мае того же года OpenAI увеличил модель до 175 миллиардов параметров, создав GPT-3.
К этому времени количество авторов статьи выросло с 4 в GPT-1 до 31.
Первым автором стал Том Браун, Алек занял 29-е место, сразу перед Ильей Суцкевером и Дарио Амодеи.

Изменение позиции в списке авторов также намекало на изменение характера проекта GPT.
Это был уже не эксперимент небольшой группы под руководством Алека, а крупный проект, осуществляемый совместными усилиями исследований, инженерии и вычислительных мощностей OpenAI.
Направление, которое изначально продвигал Алек, уже стало важнейшей технологической стратегией компании.
Но как раз в то время, когда GPT начал становиться известным широкой публике и готовился оказать огромное влияние, Алек уже перевел взгляд на другое.
За пределами языка: он последовательно угадывал изображения и речь
После выпуска GPT-3 Алек вернулся к своему первоначальному направлению: изображениям.
Еще до прихода в OpenAI его самой влиятельной работой был DCGAN.

Вместе с Люком Метцем и Сумитом Чинталой он внедрил сверточные сети в GAN, решив проблему нестабильного обучения таких моделей.
Они также обнаружили, что при обучении генерации изображений спален модель самостоятельно формирует визуальные представления о кроватях, окнах и структуре сцены.
Та интуиция, которая позже неоднократно появлялась в исследованиях Алека, уже начала проявляться:
Достаточно найти достаточно универсальную задачу обучения, и модель в процессе ее решения может самостоятельно освоить дополнительные способности.
Кстати, здесь есть одна история.
В 2016 году Дженсен Хуанг на конференции NVIDIA демонстрировал изображения, сгенерированные DCGAN, но приписал основные заслуги лаборатории Facebook, которой тогда руководил Ян Лекун.

Алек и несколько его товарищей смотрели трансляцию из бостонского офиса и были очень расстроены.
Вскоре после этого Алек покинул Бостон и присоединился к OpenAI.
Его друг Викторов даже считает, что это пренебрежение стало одной из важных причин, по которой Алек решил перейти в OpenAI.
Спустя несколько лет он вернулся к изображениям, но уже с GPT.

В 2020 году OpenAI выпустил Image GPT: изображение разворачивается в последовательность пикселей, а затем модель, как и в случае с предсказанием следующего слова, предсказывает следующий пиксель.
Алек был вторым автором статьи.
Это доказало, что GPT не является исключительно языковой моделью. Если данные можно представить в виде последовательности, тот же метод можно использовать и для обучения на изображениях.
Только генерировать пиксели по одному было слишком медленно. Полгода спустя DALL·E сжал изображения в визуальные токены и поместил текст и изображения в одну последовательность Transformer.

«Кресло в форме авокадо», «детка-морковка, выгуливающая собаку» — эти никогда не существовавшие комбинации впервые были нарисованы моделью.
В тот же день, что и DALL·E, был выпущен CLIP.
На этот раз Алек снова вернулся на позицию одного из первых авторов.
OpenAI взяла 400 миллионов пар изображение-текст, собранных из интернета, и дала модели всего одну задачу с множественным выбором: какой текст соответствует какому изображению?

Никаких фиксированных категорий, никакого специального обучения для каждой задачи.
В итоге CLIP, не используя обучающий набор ImageNet, достиг точности распознавания с нулевым образцом, сопоставимой с ранними ResNet-50, обученными с учителем.
Помимо изображений, он экспериментировал и со звуком.
Jukebox (2020 год) сжимал аудио в дискретные коды, а затем заставлял Transformer генерировать музыку, как текст.
Два года спустя тот же подход привел к более практичному Whisper.
Алек снова оказался первым автором статьи.

OpenAI собрала из интернета 680 тысяч часов аудио и соответствующих текстов, данные были неидеальными, но включали разные языки, акценты, шумы и сценарии использования.
Whisper не был специально оптимизирован под какой-либо конкретный набор данных, но при тестировании с нулевым образцом на множестве различных наборов данных он показал себя более надежным, лучше справляясь с акцентами, фоновым шумом и профессиональной лексикой реального мира.
Эти работы, казалось бы, охватывают изображения, язык, мультимодальность и речь, но основаны на одном и том же убеждении Алека:
Меньше правил, больше данных и вычислительных мощностей — и универсальные способности могут проявиться сами.
Кажется, он всегда на шаг опережает отраслевой консенсус, находя следующую простую задачу, достойную масштабирования.
Самый загадочный мужчина OpenAI
Вот и подошел к концу рассказ о славном прошлом этой важной фигуры.
Возвращаясь к его личности, можно сказать, что он «был» едва ли не самым загадочным мужчиной в OpenAI.
По сравнению с влиянием его статей, Алек почти не занимается созданием личного бренда.
У него есть аккаунт в X с 70 тысячами подписчиков, но он редко публикует что-то личное, в основном делает репосты.

Наверху до сих пор закреплен его пост от 2018 года о выпуске GPT-1.
«Вот чем я занимался последний год.»

Он сначала перечислил три источника вдохновения: CoVe, ELMo и ULMFiT, а затем простыми словами представил результат:
«Языковая модель на основе Transformer, которую можно адаптировать к различным задачам обработки естественного языка с минимальной доработкой.»
Кто бы мог подумать, что эта работа предвещает совершенно новую эпоху?
Длинных публичных интервью с Алеком очень мало; а его личный сайт предельно прост, почти пуст.

Только имя, «Latest Posts» и кнопки пагинации, почти без другого контента.
(Даже фото он использует одно и то же. Слишком скромный, этот важный человек)
Это создает странный контраст с его положением в отрасли.
Когда широкая публика говорит об OpenAI и GPT, первыми на ум приходят Сэм Алтман и Илья Суцкевер; но когда исследователи говорят о ключевых статьях последнего десятилетия, трудно обойти вниманием Алека Радфорда.
Алтман в своем последнем интервью сказал, что если спросить тех, кто работал с Алеком, они, конечно, сначала скажут:
Это «гений, появляющийся раз в несколько десятилетий», невероятно креативный мыслитель, глубоко понимающий свое исследование.

Но прежде чем закончить, каждый добавит еще одну фразу:
Он также один из самых добрых и лучших людей, с которыми им доводилось сотрудничать.
И еще кое-что
Однако этот высоко оцененный отец GPT действительно идет необычным путем в науке...
В декабре 2024 года Алек покинул OpenAI, где проработал почти девять лет, чтобы заниматься независимыми исследованиями.
Но когда все ожидали, что он создаст следующую GPT —
Алек занялся созданием «ИИ-старичка».

В апреле этого года он вместе с Ником Левином и Дэвидом Давенодом представил Talkie.
Это «антикварная языковая модель» с 13 миллиардами параметров, базовую модель обучали на 260 миллиардах токенов.
Для ее предобучающих данных действует одно жесткое правило:
Англоязычные материалы, опубликованные после 1 января 1931 года, не допускаются!
Таким образом, она читала о паровых двигателях, самолетах и Первой мировой войне, но не знает, что случилось позже с телевидением, интернетом и Второй мировой войной.
И уж точно не знает про Python.

Но вот этому раритету показали несколько примеров программ на Python и дали решить задачи HumanEval.
И он действительно написал несколько простых фрагментов кода.
Этот эксперимент действительно проверяет: насколько быстро языковая модель, никогда не сталкивавшаяся с современными компьютерами, может усвоить совершенно незнакомый навык после получения небольшого количества новых примеров и последующего дообучения?
Что? Вы говорите, что пока весь интернет продолжает активно масштабироваться, пытаясь заставить модели читать больше...
Отец GPT взял и «отключил» свою модель от интернета почти на сто лет???
Если модель никогда не видела ответа, но все равно может научиться на лету, то она полагается на память или на обучение?
И снова неизвестно, на что именно нацелился на этот раз этот важный человек...
Но судя по его обычной манере, к тому времени, когда внешний мир наконец поймет суть вопроса, он, скорее всего, уже перейдет к следующему~

Ссылки:
[1]https://x.com/InvestLikeBest/status/2086849947119333878?s=20
[2]https://www.wired.com/story/what-openai-really-wants/
[3]https://www.bostonglobe.com/2023/06/10/business/how-couple-olin-college-students-helped-spark-ai-chatbot-revolution/
[4]https://www.newyorker.com/books/under-review/can-sam-altman-be-trusted-with-the-future
Эта статья взята с официального аккаунта WeChat «量子位», автор: 关注前沿科技








