Только что! Модель Ильи впервые оказалась в центре внимания
Бывший главный научный сотрудник OpenAI Илья Суцкевер, спустя более двух лет после ухода, вновь привлек внимание. Согласно анонимному сообщению пользователя «Три клубники» в X, его компания SSI (Safe Superintelligence) разрабатывает компактный механизм логического вывода, основанный на обучении во время тестирования (Test-Time Training, TTT).
Сообщается, что эта модель учится «учиться» на специально подготовленных данных, а затем обновляет часть своих параметров в процессе решения задач. Несмотря на небольшой размер, она потенциально может конкурировать с более крупными моделями. Утверждается, что текущая версия готова, а следующая увеличится в 10 раз, и первые релизы могут появиться уже в августе для ограниченного круга пользователей.
Эта информация перекликается с ранее высказанными Ильей взглядами. В ноябре 2023 года он говорил о важности непрерывного обучения после развертывания, противопоставляя его преобладающей парадигме предварительного обучения. Также в июле NVIDIA объявила о стратегическом партнерстве и инвестициях в SSI, отметив, что компания два года тайно работала над новым исследовательским направлением.
TTT позволяет модели адаптироваться и обучаться на новых данных непосредственно во время инференса, а не только в ходе предварительного обучения. Это принципиально отличается от подходов вроде увеличения контекста или использования агентов, так как меняет саму модель. Однако такая способность поднимает серьезные вопросы безопасности, которые SSI, судя по названию, стремится решить.
Илья Суцкевер — ключевая фигура в глубоком обучении, соавтор AlexNet, архитектуры Seq2Seq и один из создателей GPT. Его способность предвидеть технологические тренды заставляет многих с нетерпением ждать следующего шага от SSI. Если слухи верны, он может создать не просто еще одну крупную языковую модель, а систему, способную к постоянной самоадаптации после развертывания — интеллект, который продолжает учиться.
marsbit08/13 08:29