В мире ИИ всегда хватает слухов.
На этот раз в центре внимания — Джамбаттиста Параскандоло, ключевой исследователь в направлении моделей логического вывода OpenAI.

В 2020 году он проходил собеседование на должность профессора в MIT, где представил доклад об использовании GPT для логического вывода. Большинство профессоров комитета назвали это направление «чушью» (nonsense).

https://x.com/turingbook/status/2084003612687249836?s=20
Парень не постеснялся вынести это на всеобщее обозрение, описав данный опыт на своей личной странице и приложив ссылки на описание доклада и слайды того времени.

https://sites.google.com/view/giambattista-parascandolo/home
О чём же был тот доклад, названный «чушью»?
Согласно информации на сайте MIT, тема доклада заключалась в том, как искусственным нейронным сетям выйти за пределы обучающего распределения и получить способности к обобщению и планированию, более близкие к человеческим.

Параскандоло считал, что люди способны рекомбинировать имеющиеся знания, выявлять ключевые инварианты, строить абстрактные модели и выполнять долгосрочное планирование. Искусственные нейронные сети всё ещё имеют большой потенциал для роста в этих аспектах.
В конце доклада он предложил три направления для будущих исследований: открытое логическое рассуждение в нейронных сетях, ещё не изученные степени свободы в искусственных нейронных сетях, а также использование языка в качестве носителя рассуждений в обучении с подкреплением для повышения эффективности использования данных.
Ключевой концепцией среди них было «открытое логическое рассуждение».
Параскандоло определил его так: модель может тратить больше времени и вычислительных ресурсов, постоянно улучшая ответ. Чем сложнее задача, тем больше шагов рассуждения должна сделать модель, и дополнительные вычисления должны преобразовываться в лучший результат.
Это уже очень напоминает сегодняшнее расширение вычислений во время логического вывода.

В то время стандартный Transformer имел фиксированную глубину сети, объём прямого прохода для каждого токена был в основном предопределён, но сложность задачи не имела устойчивой связи с длиной входных данных. Задача может быть длинной, а ответ — простым. Другая задача может состоять из одного предложения, но требовать многоэтапного разбора и проверки.

RNN (рекуррентные нейронные сети) выглядели более подходящими для таких задач. Они могут работать циклически и теоретически получать любое время на размышление. Однако кривые, представленные Параскандоло в презентации, показали, что RNN обычно показывают наилучшие результаты только вблизи количества шагов рассуждения, встречавшихся во время обучения. Дальнейшее увеличение циклов может даже снизить точность.


Это означало, что увеличение объёма вычислений — лишь первый шаг; модель также должна научиться использовать эти вычисления.
В то время наиболее эффективное многошаговое планирование в значительной степени опиралось на прогнозирующее управление моделью и поиск по дереву Монте-Карло. Нейронная сеть отвечала за предсказание среды или оценку ценности, а внешний алгоритм поиска — за развёртывание будущих путей. Параскандоло хотел глубже интегрировать способность к долгосрочному логическому выводу в нейронную сеть.

Его вторая идея заключалась в том, чтобы сделать язык носителем рассуждений.

Параскандоло привёл в пример классическую игру «Montezuma’s Revenge». Агент обучения с подкреплением, обученный с нуля, должен пробовать множество комбинаций состояний и действий. Многие правильные действия сами по себе не сложны, агенту же не хватает суждения о том, «какое поведение более разумно».


GPT уже усвоило огромные знания о мире из текстов. Язык может помочь модели описывать среду, понимать цели, декомпозировать задачи и генерировать планы высокого уровня, а также значительно сузить область поиска.
Сегодня эта идея легко ассоциируется с цепочкой мыслей, языковым планированием и рабочими процессами агентов.
Третье направление, предложенное Параскандоло, заключалось в том, что системы искусственного интеллекта могут сбрасывать задачи, возвращаясь к любому сохранённому состоянию в памяти, конструировать контрфактуальные сценарии, а также регулировать время, гравитацию и наблюдения в симуляторе. Системы могут даже напрямую считывать, копировать и изменять собственные активации и веса нейронной сети.


Это эквивалентно включению самого процесса обучения в операционное пространство агента. Он может заниматься целенаправленной практикой, генерировать специальные обучающие сценарии, переносить имеющиеся знания и переобучаться на неудачных траекториях.

В презентации пятилетней давности почти прописан сегодняшний путь развития моделей логического вывода.
Мы также раскопали его запись в блоге от июня 2021 года под названием «Обратное распространение, эволюция и заблуждение о «двух собаках».

Эта запись в основном опровергает мнение, что «нейронным сетям нужно огромное количество данных, поэтому они не похожи на человеческий мозг».
Параскандоло считал, что тот факт, что человек, увидев несколько собак, может научиться их распознавать, не означает отсутствия предшествующего опыта. Длительная эволюция осела в структуре человеческого мозга и индуктивных смещениях как опыт взаимодействия предков с миром.
Согласно этой точке зрения, масштабное предобучение нейронных сетей можно уподобить биологической эволюции, а тонкая настройка моделей и обучение в контексте ближе к обучению в течение жизни отдельной особи. GPT-3 прочитало текстов больше, чем любой человек, но его предобучение взяло на роль сжатия огромного опыта и формирования эффективной способности к обучению. Поэтому нельзя напрямую сравнивать все данные предобучения модели с небольшим количеством обучающих примеров одного человека после рождения.
Такое понимание также означает, что дальнейшее увеличение данных и вычислительной мощности всё ещё может привести к значительному улучшению. Он проводил аналогию по выполняемой роли, а не утверждал, что градиентный спуск и биологическая эволюция имеют одинаковые конкретные механизмы.
Что это за парень?
Этот парень довольно скромен: его последний пост в X датирован ноябрём 2024 года, когда он нанимал двух инженеров-исследователей (RE) и инженеров-программистов (SWE) для o1.

Согласно его личной странице, исследования Параскандоло всегда вращались вокруг обобщения, планирования и логического вывода.
В 2017 году он поступил в аспирантуру Института интеллектуальных систем Общества Макса Планка и Швейцарской высшей технической школы Цюриха (ETH Zurich), где его научными руководителями были Бернхард Шёлькопф и Томас Хофманн. Диссертация была посвящена OOD-обобщению в глубоком обучении.
Во время докторантуры он проходил стажировки в Google X в Маунтин-Вью и в DeepMind в Лондоне, участвуя соответственно в исследованиях по автоматизированному дизайну на сверхкрупных симуляторах и в исследованиях по поиску по дереву Монте-Карло с разделением и властвованием.
Получив докторскую степень в сентябре 2021 года, он сразу присоединился к OpenAI, первоначально войдя в команду обучения с подкреплением под руководством Джона Шульмана, затем перейдя в алгоритмическую команду Марка Чена, а затем присоединившись к команде 🍓 (клубники) под руководством Джерри Творека. Команда «Клубника» была внутренним кодовым названием проекта o1.

В 2023 году он участвовал в разработке GPT-4 и сформировал новую команду, продолжившую исследования в области логического вывода. Позже участвовал в фундаментальных исследованиях OpenAI o1 и o3, продвигая моделирование вознаграждений, построение среды и масштабирование алгоритмов общего логического вывода. Часть описаний алгоритмов до сих пор скрыта им чёрными прямоугольниками.

В том собеседовании 2020 года Параскандоло не получил профессорскую должность в MIT. Он ушёл в OpenAI.
Четыре года спустя он помог построить o1.
Жизнь полна удивительных совпадений.
Ссылки:
https://x.com/giambattista92
https://sites.google.com/view/giambattista-parascandolo/home
https://gibipara92.github.io/2021/06/09/backprop-evolution-two-dogs.html
https://docs.google.com/presentation/d/1edd2GkAP31wNygaev3DO8gE1t2lgsx1z8TeVpBKqlYA/edit?slide=id.gc772610149_0_179#slide=id.gc772610149_0_179
Статья из официального аккаунта WeChat «Machine Heart» (ID:almosthuman2014), автор: Ян Вэнь






