Сегодняшняя самая горячая модель в Силиконовой долине: не требует дообучения, учится с одного просмотра

marsbitОпубликовано 2026-08-26Обновлено 2026-08-26

Введение

Стартап Skild AI представил новую базовую модель для роботов S1, способную к обучению в контексте (in-context learning, ICL). Модель может выполнять новые сложные задачи длительностью до 10 минут, просмотрев всего одну демонстрационную видеоинструкцию, без дополнительного дообучения. В тестах S1 достигла 66% успеха в незнакомых задачах, что значительно превосходит результат моделей на языковых промптах (9%). Разработчики сравнивают этот прорыв с переходом от эпохи BERT к GPT-3 в больших языковых моделях, где ключевым стало обучение на основе контекста, а не тонкой настройки. Skild AI, основанная экспертами из CMU, фокусируется на создании единого «мозга» для любых роботов, используя данные с реальных устройств, симуляций и видео от первого лица. Этот прогресс может приблизить момент, когда обучение роботов станет таким же простым, как написание промпта для ChatGPT.

Грядут большие результаты в области воплощенного интеллекта!!!

С тех пор, как на прошлой неделе Generalist представил воплощенный мозг Gen 1.5, способный обучаться действиям от 3 до 12 секунд,~

Только что, североамериканский стартап в области воплощенного ИИ Skild AI выпустил новую базовую модель для роботов S1, которая увеличила длительность задач контекстного обучения для роботов до более 10 минут.

Новая модель S1 специализируется на контекстном обучении (in-context learning, ICL):

Не требует специализированного изучения новых данных об операциях на этапе дообучения. Достаточно посмотреть демонстрационное видео, снятое человеком, чтобы "срисовать с тигра кошку" — непосредственно выполнить сложную, ранее не встречавшуюся последовательность операций.

В официальной демонстрации робот выполнил длительные задачи: приготовление блинов, заваривание кофе, пересадку растений и сборку оборудования. И при выполнении незнакомых задач достиг успеха в 66% случаев, что значительно превосходит результат VLA на основе языковых подсказок (всего 9%).

Кроме того, даже если идти по традиционному пути тонкой настройки с дообучением, чтобы достичь эффекта, аналогичного однократному просмотру демонстрации моделью S1, вероятно, потребуется "скормить" около 380 демонстраций задачи.

Очень удивительно!

Можно сказать, что эта волна работ, сфокусированных на контекстном обучении, вновь возродила надежды многих на воплощенный ИИ.

Пользователь Twitter выразил мнение, что универсальные роботы могут появиться через два года, а не через семь.

Другой пользователь отметил, что от Rhoda и Generalist на прошлой неделе до 10-минутных задач Skild S1 сейчас, похоже, наступает настоящий "момент GPT" для роботов.

Потому что если эта способность действительно станет универсальной, разработка навыков для роботов в будущем действительно может стать похожей на написание промптов для ChatGPT.

Неужели всё так волшебно? Давайте посмотрим вместе.

От эпохи BERT к эпохе GPT

Чтобы понять, как именно S1 реализует контекстное обучение, сначала нужно посмотреть, как традиционный робот учится новому навыку.

В традиционном пайплайне обучение робота довольно похоже на обучение большой модели:

Сначала предварительное обучение на огромном массиве данных для освоения базовых способностей; затем, в конкретном сценарии, сбор данных для определенной задачи и дообучение, чтобы робот овладел специализированными навыками.

Однако проблема в том, что хотя процесс у роботов и больших моделей схож, затраты на данные — это совершенно разные вещи.

Данные для предварительного обучения больших моделей в основном берутся из интернета; даже в специализированных сценариях, таких как программирование или агенты, многие данные для дообучения можно быстро получить онлайн или даже сгенерировать автоматически.

Но роботам приходится гораздо тяжелее. Данные для предварительного обучения нужно собирать в реальном мире, данные для дообучения — тоже в реальном мире.

Поэтому в техническом блоге Skild AI прямо заявляют:

Если базовой модели робота для изучения каждой новой задачи по-прежнему требуются десятки или сотни часов данных с реального оборудования и повторное дообучение, тогда позвольте спросить, в чем же "базовость" этой "базовой модели"?

Они даже ссылаются на существующие исследования, указывающие, что если данных для новой задачи уже достаточно много, то модель, обученная с нуля, может даже догнать базовую модель, прошедшую предварительное обучение и тонкую настройку.

Так в чем же тогда смысл предварительного обучения для воплощенного ИИ?

Ответ Skild таков: контекстное обучение.

Чтобы иметь точку отсчета, Skild провели аналогию с траекторией развития больших языковых моделей.

Ранний BERT уже был очень мощным, но при столкновении с новой задачей часто всё равно приходилось заново готовить данные и проводить тонкую настройку.

Игровые правила изменила способность к контекстному обучению, которая стала проявляться после GPT-3:

Не нужно менять веса модели, достаточно привести несколько примеров в промпте, и модель может временно "выучить" новую задачу.

Исходя из этого, Skild считают, что роботы сейчас фактически застряли в аналогичной эпохе BERT, и их истинная цель — осуществить для роботов такую же смену парадигмы.

Другими словами, истинная ценность предварительного обучения должна заключаться не только в том, чтобы сократить объем данных для дообучения, а в том, чтобы роботы в конечном итоге приобрели способность "прямого обучения из контекста".

Контекстное обучение

Так чему же на этот раз S1 научилась из контекста?

Skild считают, что истинную способность робота к контекстному обучению можно проверить по двум измерениям:

Во-первых, может ли он научиться совершенно новым навыкам, которых не было в обучающих данных; во-вторых, может ли он рекомбинировать имеющиеся навыки для выполнения новой, очень длинной и сложной задачи.

Например, робот может научиться готовить блины, просто посмотрев видео о том, как их переворачивать, —

Даже если этот навык ранее не встречался в его обучающих данных.

В то же время, по сравнению с демонстрацией секундных видео Gen-1.5 на прошлой неделе, S1 на этот раз увеличила контекстное обучение до максимум 10 минут.

В задачах, таких как пересадка растений, каждая задача требует выполнения десятков последовательных операционных шагов. В демонстрациях этих длительных задач роботу нужно не только "срисовывать кошку с тигра", но и понимать:

На каком я сейчас этапе, что делать дальше, как комбинировать навыки и как продолжать, если что-то пошло не так.

Другими словами, роботу необходимо по-настоящему понимать намерения "задача-действие" в демонстрационном видео, импровизировать и адаптироваться, а не просто клонировать поведение.

Кроме того, в задаче по пересадке растений от начала записи демонстрации до того, как робот приступил к работе самостоятельно, прошло всего 11 минут, что напрямую "уделало" традиционное дообучение по части эффективности.

Наконец, на протяжении всего процесса S1 не использовала тонкую настройку (fine-tuning) и дообучение (post-training), веса модели полностью оставались неизменными — с одним и тем же набором весов была выполнена каждая задача, показанная в блоге.

Это практически соответствует переходу большой модели от необходимости тонкой настройки под конкретный сценарий, как у BERT, к способности GPT-3 выполнять OOD-задачи (задачи, выходящие за пределы распределения обучающих данных), просто просмотрев демонстрацию.

Единственное отличие в том, что используемый промпт — это уже не язык, а видео с действиями, которые лучше соответствуют целевой задаче.

Эксперимент: действительно ли ICL лучше масштабируется?

В экспериментальной части Skild сначала сравнили ICL с видео-промптами и традиционными языковыми промптами VLA на знакомых (из обучающих данных) и незнакомых задачах.

Результаты тестов показали, что когда объем обучающих данных составляет всего 1000 часов, языковые промпты работают лучше, но с увеличением масштаба данных ICL начинает обгонять.

При 100 тысячах часов на знакомых (из обучающих данных) задачах: ICL — 96%, языковые промпты — 89%.

А на действительно ключевых OOD-задачах: ICL — 66%, языковые промпты — всего 9%, что дает разрыв более чем в 7 раз.

Чтобы проверить способность S1 к обобщению, Skild провели тестирование в различных экспериментальных условиях.

Результаты показали, что падение производительности языковых промптов VLA может достигать 3 раз по сравнению с ICL.

Это означает, что ICL учится не просто повторять действия в фиксированных сценариях, а лучше способна перепланировать действия в соответствии с текущей средой.

Наконец, в аспекте обучения с одного примера (One-shot learning).

S1, не выполняя никакого дообучения на новой задаче и просмотрев лишь одну видеодемонстрацию, достигла успеха в 66% случаев.

Для сравнения, традиционной VLA потребовалось бы около 380 демонстраций дообучения, чтобы достичь того же уровня.

Конечно, если продолжить увеличивать количество до 2000 демонстраций, традиционное дообучение в конечном итоге может достичь 86%.

Поэтому вывод, возможно, не в том, что "роботам больше не нужно обучаться", а в следующем:

Раньше, чтобы научить новому навыку, возможно, требовалось показать его сотни раз, а теперь, посмотрев один раз, робот может сразу выполнить задачу на уровне 60-70 баллов из 100.

Это и есть так называемый закон масштабирования ICL от Skild:

Чем больше данных, тем больше модель не просто осваивает навыки, а тем лучше она "учится навыкам из демонстраций".

Кто такая Skild AI?

Skild была основана в 2023 году, за ней стоят два старых знакомых из робототехнических кругов Университета Карнеги-Меллона (CMU): Дипак Патхак и Абхинав Гупта.

Оба являются профессорами Института робототехники Университета Карнеги-Меллона. Дипак в основном занимается обучением роботов, обучением с подкреплением и компьютерным зрением, а Абхинав — гуру в области компьютерного зрения и самообучения.

Еще в 2022 году они сотрудничали над проектом WHIRL, где робот обучался имитации с одного примера, просматривая человеческие видео. Можно сказать, что путь S1 тоже не возник внезапно из ниоткуда.

Будучи звездным предприятием в североамериканских кругах воплощенного ИИ, в 2024 году Skild, только выйдя из режима скрытности, привлекла 300 миллионов долларов в раунде А с оценкой в 1,5 миллиарда долларов;

К январю этого года компания завершила раунд финансирования C на сумму 1,4 миллиарда долларов, при этом оценка взлетела до более чем 14 миллиардов долларов, с лидирующим участием SoftBank, а NVIDIA, Безос и другие продолжили участвовать. За чуть более двух лет оценка выросла почти в 10 раз.

При горизонтальном сравнении позиционирование Skild в североамериканском сообществе воплощенного ИИ также весьма своеобразно.

В то время как PI больше похожа на создание "GPT для роботов", Generalist недавно делала акцент на обучении с одного примера (one-shot learner), а Genesis AI, Sunday — на комплексных подходах (full-stack), Skild всегда подчеркивала одну фразу: Любой робот, любая задача, один мозг.

Компания больше акцентирует внимание на кроссплатформенности (cross-embodiment), надеясь, что один и тот же Skild Brain сможет работать на различных "телах": манипуляторах, четвероногих, гуманоидных роботах и т.д.

Говоря通俗чным языком, они хотят стать "Android" эпохи роботов: одним интеллектуальным слоем, встраиваемым в различные тела.

Это также определяет стратегию Skild в отношении данных: взять всё.

Skild рассматривает данные для роботов по трем измерениям: близость к оборудованию (hardware proximity), разнообразие (diversity) и масштабируемость (scalability):

Телеуправление реальным роботом (Robot Teleop) наиболее близко к оборудованию, но дорого; видео от первого лица, снятое человеком (Egocentric Video), проще всего масштабировать, но сильно отличается от "тела" робота; симуляция (Simulation) дешева и позволяет генерировать много данных, но существует разрыв между симуляцией и реальностью (sim-to-real gap).

Поэтому их подход к Robot Teleop, UMI, Egocentric Video, Simulation, по сути, заключается в использовании всего.

А ICL в S1 — это естественное продолжение этой траектории:

Сентябрь 2025: LocoFormer → Февраль 2026: первый In-Domain ICL → Май 2026: первый успешный переворот блина → Август 2026: выпуск S1, выводящий контекстное обучение на OOD-задачи длительностью до 10 минут.

Таким образом, сейчас действительно стоит задаться вопросом не о том, сможет ли робот освоить еще больше навыков, а о следующем:

Может ли стоимость обучения робота новому навыку действительно измениться с "обучения сотням раз" на "вы делаете один раз, он смотрит один раз".

Если этот закон масштабирования продолжит действовать, то так называемый "момент GPT" для роботов, возможно, действительно станет не просто очередным маркетинговым мемом.

Ссылки:[1]https://www.skild.ai/blogs/s1

Эта статья взята с официального аккаунта WeChat "Квантовый бит" (量子位), автор: henry

Связанные с этим вопросы

QКакую ключевую способность демонстрирует новый роботизированный базовый модель S1 от Skild AI?

AМодель S1 демонстрирует способность к обучению в контексте. Она может научиться выполнять новые, ранее не встречавшиеся, длительные и сложные задачи, просто посмотрев одно демонстрационное видео, без необходимости в дополнительном посттрейнинге или изменении весов модели.

QКак новое решение Skild AI сравнивается с традиционным подходом к обучению роботов?

AТрадиционный подход требует сбора большого количества реальных данных и последующего тонкого настройки модели для каждой новой задачи. S1 устраняет эту необходимость. Для достижения 66% успеха на новой задаче традиционным VLA-моделям потребовалось бы около 380 демонстраций для посттрейнинга, в то время как S1 достигает такого же результата после просмотра всего одной демонстрации.

QКакие конкретные задачи смог выполнить робот с помощью модели S1 в демонстрациях?

AВ официальных демонстрациях робот, используя модель S1, успешно выполнил несколько длительных и сложных задач, включая приготовление блинов, заваривание кофе, пересадку растения в новый горшок, а также сборку устройств. Эти задачи длятся до 10 минут и состоят из десятков последовательных шагов.

QКакова основная цель и философия компании Skild AI в области робототехники?

AФилософия Skild AI выражена в лозунге «Any robot, any task, one brain». Компания стремится создать универсальный «мозг» (интеллектуальный слой), который можно будет использовать на различных физических платформах — манипуляторах, четвероногих или гуманоидных роботах. Это похоже на попытку стать «Android» для роботов.

QКакие типы данных использует Skild AI для обучения своих моделей и почему?

ASkild AI использует комбинированную стратегию сбора данных, включающую: 1) Телеуправление роботами (высокая точность, но дорого), 2) Видео от первого лица (легко масштабировать, но разрыв с роботом), 3) Данные из симуляций (дешево и много, но есть разрыв с реальностью). Такой подход позволяет балансировать между точностью, разнообразием и масштабируемостью обучающих данных.

Похожее

Иранский риал обвалился до рекордного минимума на фоне новых санкций, нацеленных на его «спасательный круг» — майнинг биткоинов

Курс иранского риала обвалился до рекордного минимума около 2,02 млн риалов за доллар после введения США нового масштабного пакета санкций «Economic Outcast». Санкции впервые нацелены на цифровые активы, среди других секторов, с целью изолировать иранские государственные банки от доллара. Инфляция в Иране прогнозируется на уровне 68,9% в 2026 году. Иран, легализовавший майнинг биткоинов в 2019 году, активно использовал его и криптовалюты для обхода ограничений. Фермы, связанные с Корпусом стражей Исламской революции, контролируют около 65% майнинговых мощностей страны. Через криптобиржи, такие как Nobitex, Центральный банк Ирана перемещал сотни миллионов стейблкоинов (включая USDT) для поддержки риала. Вашингтон уже вводил санкции против ключевых иранских криптобирж и изъял связанные с Ираном активы на сотни миллионов долларов. Взлом Nobitex и замораживание средств подорвали доверие, сократив общий объем криптовалютных потоков Ирана в 2025 году до 3,7 млрд долларов. Новые санкции угрожают вторичными мерами против торговых партнёров Ирана, что может нарушить конвертацию стейблкоинов в наличные. Уязвимость энергосистемы Ирана также создаёт риски для майнинговых операций. Несмотря на давление, Иран в прошлом находил способы обходить ограничения, и борьба вокруг его «криптовалютной линии жизни» продолжается.

cryptonews.ru14 мин. назад

Иранский риал обвалился до рекордного минимума на фоне новых санкций, нацеленных на его «спасательный круг» — майнинг биткоинов

cryptonews.ru14 мин. назад

Маркус Тилен, основатель компании 10x Research, не ожидает, что биткоин достигнет рекордного максимума в ближайшем будущем

Маркус Тилен, основатель аналитической компании 10x Research, полагает, что, несмотря на вероятное продолжение восходящего тренда, биткоин вряд ли достигнет нового исторического максимума в краткосрочной перспективе. Он считает, что потенциал для роста сохраняется, но он не приведёт к немедленному установлению ценового рекорда. Ключевое внимание в прогнозе уделено уровню в 100 000 долларов. Достижение этой отметки, по мнению аналитика, станет важной вехой и психологическим порогом, свидетельствующим о долгосрочном бычьем потенциале биткоина, даже без обновления абсолютного максимума. Тилен подчёркивает, что на динамику криптовалюты влияют не только исторические паттерны, но и макроэкономические условия, глобальная ликвидность, политика центробанков и интерес институциональных инвесторов. Его осторожная позиция не отрицает возможности существенного роста, но указывает на сдержанные ожидания относительно скорого прорыва на рекордные уровни.

cryptonews.ru25 мин. назад

Маркус Тилен, основатель компании 10x Research, не ожидает, что биткоин достигнет рекордного максимума в ближайшем будущем

cryptonews.ru25 мин. назад

Госсектор Хубэя получил самую крупную отдачу в истории

Долгожданный момент наступил: компания Yangtze Memory Holding Co., Ltd. (Changcun Holding) подала заявку на IPO на бирже STAR Market, планируя привлечь 330 млрд юаней, что станет крупнейшим размещением в истории этой площадки. Вслед за успехом Changxin Technology из Хэфэя, «второй звезде» отечественной памяти из Уханя, Changcun Holding, также прогнозируют рыночную капитализацию в триллионы юаней после выхода на биржу. За этим успехом стоит более чем 20-летняя поддержка государственного капитала провинции Хубэй. Начиная с основания Wuhan Xinxin в 2006 году и создания Changcun Holding в 2016 году как национальной базы производства памяти, государственные фонды провинциального, городского и районного уровней постоянно инвестировали, сопровождая компанию даже в периоды убытков. Согласно проспекту эмиссии, пять из семих крупнейших акционеров (более 1%) имеют фоновую поддержку хубэйского госкапитала. В случае достижения триллионной капитализации их доля будет стоить сотни миллиардов юаней, демонстрируя впечатляющую отдачу от долгосрочных стратегических инвестиций в отрасль. Ухань, и особенно его оптоэлектронный кластер «Долина Гуангу», переживает бум. Помимо Changcun Holding, такие компании, как Huagong Tech (рыночная капитализация свыше 100 млрд юаней, также получившая поддержку уханьского госкапитала), демонстрируют аналогичную модель успеха: государственные инвесторы входят на ранней стадии и терпеливо сопровождают рост компаний в сфере высоких технологий. Сегодня в Гуангу сосредоточено 16 000 предприятий оптоэлектронной промышленности, формируя кластер с оборотом более 850 млрд юаней, который стремится стать мирового уровня. Успех Changxin Technology в Хэфэе и предстоящее IPO Changcun Holding в Ухане иллюстрируют, как стратегические долгосрочные инвестиции государства в ключевые отрасли (полупроводники, память) могут не только приносить значительную финансовую отдачу, но и кардинально менять промышленный ландшафт и конкурентные позиции целых городов. Этот путь требует не удачи, а терпения, смелости и ответственности. Начинается новая перетасовка в ранжировании китайских городов, движимая подобными преобразованиями в отраслях.

marsbit32 мин. назад

Госсектор Хубэя получил самую крупную отдачу в истории

marsbit32 мин. назад

Миф об инвестициях в ИИ рухнул

Американский хедж-фонд Situational Awareness (SA), основанный бывшим исследователем OpenAI Леопольдом Ашенбреннером, потерпел масштабный крах в конце июля. За год активы фонда выросли с 1.5 до 45 миллиардов долларов благодаря агрессивной стратегии: длинные позиции в акциях компаний, связанных с инфраструктурой ИИ (полупроводники, вычисления), и короткие позиции в софтверных компаниях, которым, по мнению фонда, ИИ угрожает. Эта стратегия, известная как «Техасский хедж», по сути, была односторонней ставкой на веру рынка в ИИ, усиленной высоким кредитным плечом (до 3x). В середине июля началась коррекция на рынке полупроводников. Цены на ключевые длинные позиции SA (например, SK Hynix) упали, в то время как короткие позиции (например, Adobe) выросли. Это привело к убыткам по обоим направлениям. Высокое плечо усугубило ситуацию, вызвав требования от банков (Goldman Sachs, JPMorgan) о внесении дополнительного маржинального обеспечения. 29-30 июля SA оказался на грани принудительного закрытия позиций банками. За 20 минут до открытия торгов 30 июля фонд экстренно продал весь свой публичный портфель со скидкой около 10% инвестиционной компании Citadel, чтобы выполнить маржинальные требования. Это предотвратило более широкую волну распродаж на рынке. В результате активы SA сократились примерно до 10 миллиардов долларов (без учета частных акций Anthropic). Крах фонда, который еще недавно был «легендой Уолл-стрит», заставил рынок задуматься о системных рисках, скрытых в безумной гонке за инвестициями в ИИ, основанной на высоком плече и концентрации. Инвестор может оказаться прав в долгосрочной перспективе, но высокое плечо может уничтожить его до того, как эта перспектива реализуется.

marsbit33 мин. назад

Миф об инвестициях в ИИ рухнул

marsbit33 мин. назад

Торговля

Спот
活动图片