Интеллект в материальном воплощении снова обогатился новым подходом к сбору данных.
Прежде чем перейти к официальному представлению, давайте проведём небольшую интерактивную сессию: если отбросить ИИ и не пользоваться справочными материалами, сможете ли вы в течение 5 секунд перечислить существующие методы сбора данных для материализованного интеллекта?
Основными четырьмя методами являются: сбор данных через телеуправление реальными устройствами, сбор без персональных данных (UMI/Ego), синтетические данные из симуляций и дистилляция из интернет-видео.
(Перечислены не в порядке важности, я просто привёл примеры).
Если углубляться в классификацию, можно составить длинный список.
По крайней мере, таков ответ, который дал мне ИИ, — можете оценить сами:

В последнее время стал появляться и набирать популярность новый подход, который смещает фокус сбора данных с внешних действий дальше — на сторону двигательной активности человека.
Это набирающий сейчас большое внимание подход с использованием нейромышечной электрографии (sEMG, поверхностная электромиография).
OriginFlow (渊澈太初) — самая горячая и наиболее популярная стартап-компания в этом направлении.
Основатель и генеральный директор Цинь Шэньтао, родившийся в 2001 году, в настоящее время является докторантом в Школе транспортных средств и перевозок Университета Цинхуа.
В августе прошлого года он основал OriginFlow в Пекине; к маю этого года компания сообщила о последовательном завершении раундов финансирования: ангельского, стратегического и Pre-A1, с совокупным объёмом более 500 миллионов юаней (около 5 млрд руб.), от инвесторов, включая Lanchi, Lüzou, Monolith и других.
Цинь Шэньтао сообщил нам:
Между реальными производственными сценариями и моделями отсутствует слой, способный абстрагировать неструктурированную, высокоточную, сложную в деталях информацию о физическом взаимодействии в обучаемые представления.
Поэтому он сам начал свой бизнес в области инфраструктуры физического ИИ общего назначения (AGI), надеясь сделать нейромышечную электрографию одним из источников сбора данных для материализованного интеллекта.

Цинь Шэньтао заявил, что в краткосрочной перспективе NeuroScale скорее является дополнением для подходов, таких как UMI и Ego (перспектива от первого лица); однако незаметный сбор данных, безусловно, является важным трендом будущего.
Когда происходит новая трансформация, более подходящей стратегией является совместная эволюция с существующими технологиями.
Сбор данных для материализованного интеллекта с помощью «нейроинтерфейса»
Сначала давайте приблизимся к тому, чем OriginFlow занимается на данном этапе, через обычные жизненные примеры.
Когда человек закручивает винт, уверенно несёт миску супа или сжимает мягкий предмет, тело постоянно даёт микроскопические обратные связи в зависимости от ситуации.
Когда именно пальцы начинают сжиматься? Как изменяется усилие? ... На самом деле, человек не задумывается об этих вопросах по отдельности — за крайне короткое время тело успевает завершить и выполнить целый набор решений, касающихся контакта, трения, веса и устойчивости.
OriginFlow хочет зафиксировать этот уровень реакций, чтобы использовать его как часть данных для материализованного интеллекта.

Решение сделать ставку на это направление уходит корнями в студенческие годы Цинь Шэньтао.
Во время бакалавриата команда Цинь Шэньтао завоевала почти все возможные чемпионские титулы в робототехнических соревнованиях; также именно в этот период у него зародились дальнейшие размышления:
Клавиатура, мышь и голос — это не самые прямые способы общения человека с машиной. Руки человека — самый гибкий инструмент; если машина поймёт истинные намерения, стоящие за движениями рук, человеко-машинное взаимодействие выйдет на новый уровень.
Таким образом, в поле зрения Цинь Шэньтао, увлечённого идеей «симбиоза человека и машины», вошли нейроинтерфейсы.
Нейроинтерфейс собирает периферические электрические сигналы, связанные с двигательными нервами (т.е. нейромышечные сигналы), избегая проблем с высокой инвазивностью, большим количеством каналов и соответствием областям мозга, характерных для интерфейсов «мозг-компьютер».
После своего появления нейромышечная электрография долгое время ограничивалась университетскими лабораториями.
Позже, с развитием беспроводных сенсоров, сухих электродов и итераций алгоритмов ИИ, нейромышечная электрография стала использоваться в качестве точки входа для восприятия двигательных намерений человека, находя широкое применение в биологической обратной связи для медицинской реабилитации, анализе движений в спорте, оценке профессиональных нагрузок и эргономики, а также для дискретного управления миоэлектрическими протезами.

△
Приведём типичный пример~
В 2019 году Reality Labs, ключевое исследовательское подразделение Meta, приобрела компанию, занимающуюся неинвазивными нейроинтерфейсами, CTRL-Labs.
До покупки CTRL-Labs уже выпустила комплект для разработчиков, состоящий из основного устройства размером с часы и прикреплённого компонента с электродами.
Он использует 16-канальные сенсоры электромиографии для мониторинга электрических сигналов мышц, передаваемых от двигательных нейронов к пальцам в области запястья, и с помощью алгоритмов ИИ декодирует эти сигналы, преобразуя их в цифровые команды (например, клик, смахивание, жесты).

Спустя два года Meta впервые публично продемонстрировала прототип нейроинтерфейсного браслета на основе технологии CTRL-Labs — Meta Neural Band, показав его потенциал для управления интерфейсом дополненной реальности путём улавливания крошечных нейронных сигналов, например, для печати в воздухе, выбора меню и т.д.
Марк Цукерберг тогда отметил, что поскольку он может точно воспринимать намерения пользователя, даже ещё не реализованные в движении, то такой способ взаимодействия обеспечивает «почти безграничное управление».
В прошлом году третье поколение умных очков Meta уже включало нейроинтерфейсный браслет для ввода данных, позволяя пользователям напрямую управлять интерфейсом на очках с помощью движений рук (мысленное смахивание, клик).
(Посторонняя информация: жесты «щипка» для подтверждения и закрытия окон в Apple Watch в основном основаны на оптических сенсорах)

В отличие от Meta, которая не фокусируется на том, как сделать клики, смахивания или ввод текста удобнее для пользователя, размышления Цинь Шэньтао сосредоточены на недостающих условиях для физического ИИ общего назначения.
По его мнению, во-первых, крайняя нехватка высококачественных данных о физическом взаимодействии уже стала ключевым ограничением для продвижения материализованных интеллектуальных роботов.
Существующие методы сбора данных для материализованного интеллекта имеют свои недостатки; можно ли использовать нейромышечную электрографию в качестве точки входа для их дальнейшего дополнения?
Более того, выбор сбора данных через нейромышечную электрографию потенциально позволяет обойти различия в материалах и сенсорах конкретных контактных поверхностей, исходя из стороны привода как человека, так и машины, чтобы найти общее представление действий, способное связать активацию мышц, усилие сухожилий и движение суставов.
Сбор данных начинается с одного браслета
В 2025 году, будучи докторантом, Цинь Шэньтао официально начал свой бизнес, зарегистрировав компанию OriginFlow, с целью создания «действенной основы» (action base) для Физического ИИ общего назначения (Physical AGI), помимо текста и видео.
Вскоре команда предложила технологическую систему NeuroScale.
NeuroScale — это не просто добавление миоэлектрического браслета к существующему оборудованию для сбора данных материализованного интеллекта.
Это комплексная система данных и моделей, охватывающая сбор сигналов, реконструкцию физических величин, представление действий и перенос между различными воплощениями.
Эта система использует неинвазивный нейромоторный интерфейс в качестве точки входа сигнала, объединяет нейромышечную электрографию, зрение от первого лица и мультимодальную информацию, такую как IMU, и через базовую модель PULSE реконструирует позу, контактные и движущие силы в действиях человека, преобразуя одно реальное действие в обучаемые машиной Human Tokens.

NeuroScale долгосрочно фокусируется на двух ключевых вопросах.
Во-первых, как достичь Scale Up (масштабирования) Human Data?
То есть, как можно меньше нарушая естественное восприятие и движение человека, непрерывно записывать реальные действия, производя больше высококачественных данных о физическом взаимодействии.
Во-вторых, как реализовать Cross-Embodiment Transfer (перенос между воплощениями) между Человеком и Роботом, чтобы опыт действий человека через представление и адаптацию мог быть применён к роботам различной конструкции.
Под этими двумя вопросами лежит ещё более фундаментальная техническая проблема: в какой форме действия человека должны входить в базовую модель?
Текст уже имеет относительно зрелое представление в виде токенов, визуальная информация также постепенно сводится к Patch или Latent представлениям, но модальность действий до сих пор не имеет общепризнанного стандартного представления.
OriginFlow разделяет одно физическое действие на три взаимосвязанных пространства:
MotionSpace, описывающее позу и траекторию движения руки
TactileSpace, описывающее нормальную силу, касательную силу и тактильную обратную связь
TendonSpace, описывающее усилие мышц, сухожилий и крутящий момент суставов
Движущая сила создаёт движение, движение приводит к контакту, контакт в конечном итоге формирует воздействующую силу — эти три элемента вместе образуют цепь физической причинности.
Human Tokens, о которых говорит OriginFlow, — это как раз представление действий, построенное на этих трёх типах физических величин.
«По форме человека можно рассматривать как частный случай в пространстве конфигураций воплощений. Поэтому перенос от человека к роботу по сути является подзадачей проблемы «переноса между воплощениями»», — говорит Цинь Шэньтао.
Конкретно, данные Human Data в больших масштабах отвечают за охват как можно более широкого распределения человеческих действий и навыков; данные Cross-Embodiment Data, которые меньше по масштабу, но достаточно разнообразны по конфигурациям роботов, предоставляют точки привязки для согласования между человеком и различными воплощениями роботов.
Комбинируя эти два типа данных, модель получает возможность изучить набор общих представлений действий, относительно независимых от конкретного воплощения, и затем перенаправить один и тот же набор человеческих действий и информации об усилии на роботизированные воплощения с различными степенями свободы и способами привода.
Таким образом, OriginFlow не стремится напрямую скопировать данные о действиях человека для робота, а сначала ищет общие для разных воплощений элементы действий, движущих сил и контактных отношений, а затем выполняет адаптацию и отображение.
В реальном мире NeuroScale начинается с одного браслета.

Браслет назван OriginKitGen 1.0, по дизайну он немного шире ремешка Apple Watch, но в целом имеет меньший объём и вес.
Браслет отвечает за сбор микровольтных сигналов поверхностной электромиографии, испускаемых пользователем. В системе используется 16-канальный сбор, поток информации составляет около 96 КБ в секунду, и она осуществляет непрерывное моделирование движения руки.

Однако реализация NeuroScale не ограничивается только браслетом.
Только с браслетом система может знать об изменениях в активности мышц предплечья, но ей сложно определить, что именно делают пальцы.
Сигналы, собранные OriginKitGen 1.0, вместе с информацией от зрения от первого лица, IMU и других источников поступают в конвейер данных NeuroScale.
Исходные сигналы после синхронизации, калибровки и обработки затем проходят через собственную базовую модель PULSE команды, которая извлекает из них ключи, связанные с позой руки, траекторией движения, контактной силой и усилием сухожилий — соответствующие трём основным физическим пространствам: Motion Space (пространство движения), Tactile Space (тактильное пространство) и Tendon Space (пространство сухожилий). На аппаратной стороне выполняется фильтрация, дифференцирование, подавление артефактов движения; на стороне модели — кодирование нейронных сигналов и обучение с жёстким контролем — постепенно формируя представления действий, которые машина может изучать.
Это и есть те самые Human Tokens, о которых говорит команда.
Во время WAIC (Всемирная конференция по искусственному интеллекту) Цинь Шэньтао и команда продемонстрировали текущие результаты — демо-версию PULSE 0.2:
Браслет отвечает за сбор 16-канальных сигналов поверхностной электромиографии; PULSE использует эти сигналы в качестве входных данных для непрерывного моделирования движения руки и наблюдения за изменениями усилия при соприкосновении кончиков пальцев.
В отличие от дискретного распознавания жестов, PULSE фокусируется на непрерывном отслеживании руки и представлении усилия на кончиках пальцев.
Когда пользователь выполняет действие соприкосновения кончиков пальцев, система может в реальном времени наблюдать изменение прикладываемого усилия.
Однако реконструкция действия из нейронного сигнала не означает получения данных, которые можно напрямую использовать для обучения роботов.
Исходные данные должны пройти через множество этапов: синхронизация времени с нескольких устройств, индивидуальная калибровка, обработка артефактов движения, разделение на задачи, аннотация действий и сил, проверка качества и отображение между разными воплощениями.
Для этого OriginFlow также создала инфраструктуру данных (Data Infra), охватывающую производство, обработку, оценку и обучение данных.
В частности, ORACLE использует мультимодальные модели для автоматической аннотации действий, сил, семантики и фрагментов задач; унифицированная базовая модель CHORD отвечает за синхронизацию времени и согласование представлений между нейромышечной электрографией, зрением, IMU, языком и состоянием робота.
Данные также последовательно проходят этапы проверки качества: физическая валидность, валидность задачи, валидность аннотаций, ценность для модели и оценка на реальном устройстве. Только данные, которые могут принести практическую пользу в обучении модели или выполнении роботом задач, попадают в итоговый набор данных.
Другими словами, необходимо не только собрать данные, но и иметь возможность с достаточно низкими предельными затратами преобразовать огромное количество исходных сигналов в обучаемые, оцениваемые и повторно используемые активы данных.
От данных человека к улучшению человека
Демонстрация PULSE 0.2 — это лишь небольшая часть текущей деятельности компании, сама модель также является лишь промежуточным результатом.
Разрабатываемая в настоящее время версия PULSE 0.3 глубже исследует взаимосвязь между усилием сухожилий и прямой кинематикой руки (forward kinematics).
Упомянутый ранее браслет — это лишь текущее устройство для сбора данных, а не конечная форма продукта.
Для подхода, зависящего от долгосрочного и масштабного сбора данных, способность устройства быть естественно принятым человеком определяет возможность непрерывного получения данных.
Цинь Шэньтао говорит, что нужно, чтобы люди сначала были готовы носить устройство, и носить его достаточно долго.
По сути, OriginFlow стремится с минимальным вмешательством в естественное восприятие и способ движения человека непрерывно записывать его двигательную активность в реальном мире и преобразовывать её в Physical Tokens.
Только тогда сбор данных сможет покинуть специализированные фабрики по сбору данных и специально оборудованные рабочие места, чтобы войти в повседневную жизнь и реальные производственные процессы.
К тому времени «триллионы часов данных», которые сейчас недостижимы для области материализованного интеллекта, можно будет собрать, просто записывая поведение всего человечества в течение примерно десяти дней.
Цинь Шэньтао описывает этот процесс как непрерывное увеличение Scaling (масштабирования) данных.
В будущем мы будем способствовать масштабированию полно-модальных данных о человеке от десятков миллионов часов, сотен миллионов часов, постепенно приближаясь к триллионам часов.
А предполагаемая следующим поколением точка входа для физических данных будет постепенно принимать более лёгкую, естественную форму, более близкую к потребительским товарам.
По их замыслу, в будущем людям достаточно будет носить имеющие потребительские свойства очки, часы или более лёгкий браслет, чтобы в повседневной жизни непрерывно моделировать самих себя и получать удобства от персональных моделей.

△
В целом, то, чем компания OriginFlow занимается на данном этапе, находится в первой фазе своего плана развития.
Они планируют трёхэтапный путь развития — Первый этап, From Human (От человека): сначала как можно полнее собрать данные о том, как движется человек, систематически дистиллировать и преобразовать опыт физических действий человека в данные и представления, которые могут изучать машины.
OriginFlow стремится, не вмешиваясь в естественный процесс восприятия и движения человека, полностью восстановить его двигательную активность.
Вся схема сбора данных всегда следует принципу неинвазивности, гарантируя, что при сохранении человеком своего обычного состояния его действия могут быть точно наблюдаемы и восстановлены системой.
Второй этап, With Human (С человеком).
На этом этапе будут созданы, включая роботов, новые аппаратные средства с ИИ, которые будут интегрированы в повседневную работу и жизнь в режиме постоянной готовности (Always-on), чтобы больше людей смогли ощутить ценность, приносимую интерфейсами следующего поколения.
Третий этап, рассчитанный на 10-30 лет вперёд, — Enhance Human (Улучшение человека).
Конечно, между демонстрацией соприкосновения кончиков пальцев в PULSE 0.2 и полно-модальными данными о человеке объёмом в триллионы часов лежит долгий путь инженерной проверки.
И ещё кое-что (One More Thing)
Известно, что другие стартапы в Китае, такие как BrainCo (强脑科技), Octopus Dynamics (章鱼动力), SnowOrigin, Nianxiang Technology (念象科技), Wujie Mailuo (无界脉络), Shouyi Technology (手亿科技) и другие, также используют нейромышечную электрографию для сбора данных для материализованного интеллекта.
Статья из официального аккаунта WeChat «QbitAI» (ID: QbitAI), автор: Хэн Юй





