Грядут большие результаты в области воплощенного интеллекта!!!
С тех пор, как на прошлой неделе Generalist представил воплощенный мозг Gen 1.5, способный обучаться действиям от 3 до 12 секунд,~
Только что, североамериканский стартап в области воплощенного ИИ Skild AI выпустил новую базовую модель для роботов S1, которая увеличила длительность задач контекстного обучения для роботов до более 10 минут.

Новая модель S1 специализируется на контекстном обучении (in-context learning, ICL):
Не требует специализированного изучения новых данных об операциях на этапе дообучения. Достаточно посмотреть демонстрационное видео, снятое человеком, чтобы "срисовать с тигра кошку" — непосредственно выполнить сложную, ранее не встречавшуюся последовательность операций.
В официальной демонстрации робот выполнил длительные задачи: приготовление блинов, заваривание кофе, пересадку растений и сборку оборудования. И при выполнении незнакомых задач достиг успеха в 66% случаев, что значительно превосходит результат VLA на основе языковых подсказок (всего 9%).
Кроме того, даже если идти по традиционному пути тонкой настройки с дообучением, чтобы достичь эффекта, аналогичного однократному просмотру демонстрации моделью S1, вероятно, потребуется "скормить" около 380 демонстраций задачи.
Очень удивительно!
Можно сказать, что эта волна работ, сфокусированных на контекстном обучении, вновь возродила надежды многих на воплощенный ИИ.
Пользователь Twitter выразил мнение, что универсальные роботы могут появиться через два года, а не через семь.

Другой пользователь отметил, что от Rhoda и Generalist на прошлой неделе до 10-минутных задач Skild S1 сейчас, похоже, наступает настоящий "момент GPT" для роботов.

Потому что если эта способность действительно станет универсальной, разработка навыков для роботов в будущем действительно может стать похожей на написание промптов для ChatGPT.

Неужели всё так волшебно? Давайте посмотрим вместе.
От эпохи BERT к эпохе GPT
Чтобы понять, как именно S1 реализует контекстное обучение, сначала нужно посмотреть, как традиционный робот учится новому навыку.
В традиционном пайплайне обучение робота довольно похоже на обучение большой модели:
Сначала предварительное обучение на огромном массиве данных для освоения базовых способностей; затем, в конкретном сценарии, сбор данных для определенной задачи и дообучение, чтобы робот овладел специализированными навыками.

Однако проблема в том, что хотя процесс у роботов и больших моделей схож, затраты на данные — это совершенно разные вещи.
Данные для предварительного обучения больших моделей в основном берутся из интернета; даже в специализированных сценариях, таких как программирование или агенты, многие данные для дообучения можно быстро получить онлайн или даже сгенерировать автоматически.
Но роботам приходится гораздо тяжелее. Данные для предварительного обучения нужно собирать в реальном мире, данные для дообучения — тоже в реальном мире.
Поэтому в техническом блоге Skild AI прямо заявляют:
Если базовой модели робота для изучения каждой новой задачи по-прежнему требуются десятки или сотни часов данных с реального оборудования и повторное дообучение, тогда позвольте спросить, в чем же "базовость" этой "базовой модели"?
Они даже ссылаются на существующие исследования, указывающие, что если данных для новой задачи уже достаточно много, то модель, обученная с нуля, может даже догнать базовую модель, прошедшую предварительное обучение и тонкую настройку.
Так в чем же тогда смысл предварительного обучения для воплощенного ИИ?
Ответ Skild таков: контекстное обучение.
Чтобы иметь точку отсчета, Skild провели аналогию с траекторией развития больших языковых моделей.
Ранний BERT уже был очень мощным, но при столкновении с новой задачей часто всё равно приходилось заново готовить данные и проводить тонкую настройку.
Игровые правила изменила способность к контекстному обучению, которая стала проявляться после GPT-3:
Не нужно менять веса модели, достаточно привести несколько примеров в промпте, и модель может временно "выучить" новую задачу.

Исходя из этого, Skild считают, что роботы сейчас фактически застряли в аналогичной эпохе BERT, и их истинная цель — осуществить для роботов такую же смену парадигмы.
Другими словами, истинная ценность предварительного обучения должна заключаться не только в том, чтобы сократить объем данных для дообучения, а в том, чтобы роботы в конечном итоге приобрели способность "прямого обучения из контекста".
Контекстное обучение
Так чему же на этот раз S1 научилась из контекста?
Skild считают, что истинную способность робота к контекстному обучению можно проверить по двум измерениям:
Во-первых, может ли он научиться совершенно новым навыкам, которых не было в обучающих данных; во-вторых, может ли он рекомбинировать имеющиеся навыки для выполнения новой, очень длинной и сложной задачи.
Например, робот может научиться готовить блины, просто посмотрев видео о том, как их переворачивать, —
Даже если этот навык ранее не встречался в его обучающих данных.
В то же время, по сравнению с демонстрацией секундных видео Gen-1.5 на прошлой неделе, S1 на этот раз увеличила контекстное обучение до максимум 10 минут.
В задачах, таких как пересадка растений, каждая задача требует выполнения десятков последовательных операционных шагов. В демонстрациях этих длительных задач роботу нужно не только "срисовывать кошку с тигра", но и понимать:
На каком я сейчас этапе, что делать дальше, как комбинировать навыки и как продолжать, если что-то пошло не так.
Другими словами, роботу необходимо по-настоящему понимать намерения "задача-действие" в демонстрационном видео, импровизировать и адаптироваться, а не просто клонировать поведение.
Кроме того, в задаче по пересадке растений от начала записи демонстрации до того, как робот приступил к работе самостоятельно, прошло всего 11 минут, что напрямую "уделало" традиционное дообучение по части эффективности.
Наконец, на протяжении всего процесса S1 не использовала тонкую настройку (fine-tuning) и дообучение (post-training), веса модели полностью оставались неизменными — с одним и тем же набором весов была выполнена каждая задача, показанная в блоге.
Это практически соответствует переходу большой модели от необходимости тонкой настройки под конкретный сценарий, как у BERT, к способности GPT-3 выполнять OOD-задачи (задачи, выходящие за пределы распределения обучающих данных), просто просмотрев демонстрацию.
Единственное отличие в том, что используемый промпт — это уже не язык, а видео с действиями, которые лучше соответствуют целевой задаче.

Эксперимент: действительно ли ICL лучше масштабируется?
В экспериментальной части Skild сначала сравнили ICL с видео-промптами и традиционными языковыми промптами VLA на знакомых (из обучающих данных) и незнакомых задачах.

Результаты тестов показали, что когда объем обучающих данных составляет всего 1000 часов, языковые промпты работают лучше, но с увеличением масштаба данных ICL начинает обгонять.
При 100 тысячах часов на знакомых (из обучающих данных) задачах: ICL — 96%, языковые промпты — 89%.
А на действительно ключевых OOD-задачах: ICL — 66%, языковые промпты — всего 9%, что дает разрыв более чем в 7 раз.
Чтобы проверить способность S1 к обобщению, Skild провели тестирование в различных экспериментальных условиях.

Результаты показали, что падение производительности языковых промптов VLA может достигать 3 раз по сравнению с ICL.
Это означает, что ICL учится не просто повторять действия в фиксированных сценариях, а лучше способна перепланировать действия в соответствии с текущей средой.
Наконец, в аспекте обучения с одного примера (One-shot learning).
S1, не выполняя никакого дообучения на новой задаче и просмотрев лишь одну видеодемонстрацию, достигла успеха в 66% случаев.

Для сравнения, традиционной VLA потребовалось бы около 380 демонстраций дообучения, чтобы достичь того же уровня.
Конечно, если продолжить увеличивать количество до 2000 демонстраций, традиционное дообучение в конечном итоге может достичь 86%.
Поэтому вывод, возможно, не в том, что "роботам больше не нужно обучаться", а в следующем:
Раньше, чтобы научить новому навыку, возможно, требовалось показать его сотни раз, а теперь, посмотрев один раз, робот может сразу выполнить задачу на уровне 60-70 баллов из 100.
Это и есть так называемый закон масштабирования ICL от Skild:
Чем больше данных, тем больше модель не просто осваивает навыки, а тем лучше она "учится навыкам из демонстраций".
Кто такая Skild AI?
Skild была основана в 2023 году, за ней стоят два старых знакомых из робототехнических кругов Университета Карнеги-Меллона (CMU): Дипак Патхак и Абхинав Гупта.

Оба являются профессорами Института робототехники Университета Карнеги-Меллона. Дипак в основном занимается обучением роботов, обучением с подкреплением и компьютерным зрением, а Абхинав — гуру в области компьютерного зрения и самообучения.
Еще в 2022 году они сотрудничали над проектом WHIRL, где робот обучался имитации с одного примера, просматривая человеческие видео. Можно сказать, что путь S1 тоже не возник внезапно из ниоткуда.

Будучи звездным предприятием в североамериканских кругах воплощенного ИИ, в 2024 году Skild, только выйдя из режима скрытности, привлекла 300 миллионов долларов в раунде А с оценкой в 1,5 миллиарда долларов;
К январю этого года компания завершила раунд финансирования C на сумму 1,4 миллиарда долларов, при этом оценка взлетела до более чем 14 миллиардов долларов, с лидирующим участием SoftBank, а NVIDIA, Безос и другие продолжили участвовать. За чуть более двух лет оценка выросла почти в 10 раз.
При горизонтальном сравнении позиционирование Skild в североамериканском сообществе воплощенного ИИ также весьма своеобразно.
В то время как PI больше похожа на создание "GPT для роботов", Generalist недавно делала акцент на обучении с одного примера (one-shot learner), а Genesis AI, Sunday — на комплексных подходах (full-stack), Skild всегда подчеркивала одну фразу: Любой робот, любая задача, один мозг.
Компания больше акцентирует внимание на кроссплатформенности (cross-embodiment), надеясь, что один и тот же Skild Brain сможет работать на различных "телах": манипуляторах, четвероногих, гуманоидных роботах и т.д.
Говоря通俗чным языком, они хотят стать "Android" эпохи роботов: одним интеллектуальным слоем, встраиваемым в различные тела.
Это также определяет стратегию Skild в отношении данных: взять всё.
Skild рассматривает данные для роботов по трем измерениям: близость к оборудованию (hardware proximity), разнообразие (diversity) и масштабируемость (scalability):
Телеуправление реальным роботом (Robot Teleop) наиболее близко к оборудованию, но дорого; видео от первого лица, снятое человеком (Egocentric Video), проще всего масштабировать, но сильно отличается от "тела" робота; симуляция (Simulation) дешева и позволяет генерировать много данных, но существует разрыв между симуляцией и реальностью (sim-to-real gap).

Поэтому их подход к Robot Teleop, UMI, Egocentric Video, Simulation, по сути, заключается в использовании всего.
А ICL в S1 — это естественное продолжение этой траектории:

Сентябрь 2025: LocoFormer → Февраль 2026: первый In-Domain ICL → Май 2026: первый успешный переворот блина → Август 2026: выпуск S1, выводящий контекстное обучение на OOD-задачи длительностью до 10 минут.
Таким образом, сейчас действительно стоит задаться вопросом не о том, сможет ли робот освоить еще больше навыков, а о следующем:
Может ли стоимость обучения робота новому навыку действительно измениться с "обучения сотням раз" на "вы делаете один раз, он смотрит один раз".
Если этот закон масштабирования продолжит действовать, то так называемый "момент GPT" для роботов, возможно, действительно станет не просто очередным маркетинговым мемом.
Ссылки:[1]https://www.skild.ai/blogs/s1
Эта статья взята с официального аккаунта WeChat "Квантовый бит" (量子位), автор: henry





