# Сопутствующие статьи по теме Предобучение

Новостной центр HTX предлагает последние статьи и углубленный анализ по "Предобучение", охватывающие рыночные тренды, новости проектов, развитие технологий и политику регулирования в криптоиндустрии.

10 000 часов человеческих данных позволили создать первую в мире неявную мировую модель действия для полного мобильного манипулирования роботом-гуманоидом

За последние два года фокус в разработке человекоподобных роботов сместился с аппаратной части на моделирование их способностей. Ключевым вызовом стало создание модели, способной понимать окружение, предсказывать изменения и координировать все тело для выполнения задач. Компания «Чжицзай Уцзе» представила Being-M0.7 — первую в мире скрытую мировую модель действия (Latent WAM), предназначенную для полноценного мобильного манипулирования человекоподобными роботами. Модель предварительно обучалась на более чем 10000 часов данных, сфокусированных на человеке (видео от первого лица и данные о движении), а затем донастраивалась на небольшом наборе реальных демонстрационных данных с робота. Being-M0.7 использует архитектуру Mixture of Transformers (MoT), которая позволяет совместно обучаться на спаренных (видео+движение) и одиночных (только видео или только движение) данных, эффективно решая проблему дефицита дорогостоящих данных с реальных роботов. Модель предсказывает будущие состояния среды и траектории движения в скрытом пространстве, что снижает вычислительные затраты по сравнению с предсказанием пикселей. Для контроля используется «эксперт по действиям», который преобразует высокоуровневые прогнозы модели в низкоуровневые команды для конкретного робота. Возможности модели были продемонстрированы на реальном роботе Unitree G1 в сложных задачах, требующих координации всего тела: ловля рыбы в аквариуме (взаимодействие с жидкостью), взятие предмета с использованием зеркала (пространственное рассуждение), длинная последовательность действий по переносу предметов и обход препятствий с грузом. В сравнительных тестах Being-M0.7 показала результаты, превосходящие или сопоставимые с другими моделями. Этот подход, развиваемый от ранее представленной модели для ловких манипуляций Being-H, предлагает путь к масштабируемому обучению роботов за счет использования богатого опыта человеческих действий, прежде чем адаптировать знания к конкретной роботизированной платформе.

marsbit07/15 01:50

10 000 часов человеческих данных позволили создать первую в мире неявную мировую модель действия для полного мобильного манипулирования роботом-гуманоидом

marsbit07/15 01:50

Впервые: претренированная VLA для ловкого манипулирования на чисто человеческих видео успешно развертывается после тонкой настройки на небольшом количестве данных

Новаторский фреймворк VITRA от Microsoft Research Asia и Университета Цинхуа совершил прорыв в обучении роботов для ловких манипуляций. Ключевая инновация — полностью автоматизированный конвейер для преобразования неразмеченных видеозаписей реальных человеческих действий в структурированные данные, пригодные для обучения моделей «зрение-язык-действие» (VLA). Система извлекает 3D-траектории движения руки, сегментирует видео на атомарные действия и генерирует текстовые инструкции с помощью GPT-4. На созданном масштабном наборе данных (1 млн сегментов, 26 млн кадров) была предобучена VLA-модель. Она демонстрирует впечатляющую способность к нулевому обучению (zero-shot), точно предсказывая движения руки в незнакомых условиях. Для развёртывания на реальном роботе (например, с манипулятором StarMove XHAND1) модели требуется лишь небольшая тонкая настройка на ограниченном наборе данных (~1.2 тыс. демонстраций), после чего она успешно выполняет сложные задачи: захват, перемещение, высыпание, подметание, показывая высокую степень обобщения для новых объектов и окружения. Исследование подтверждает закон масштабирования: производительность модели стабильно растёт с увеличением объёма данных для предобучения. Этот подход открывает путь к созданию более универсальных и адаптивных роботов, способных учиться на обширных и разнообразных видеозаписях человеческой деятельности.

marsbit06/08 08:55

Впервые: претренированная VLA для ловкого манипулирования на чисто человеческих видео успешно развертывается после тонкой настройки на небольшом количестве данных

marsbit06/08 08:55

Альма-матер 'Цинхуа' выпускник 00-х Ван Гуан представил новую работу: разрушение парадигмы предобучения Transformer с использованием 1/900 токенов и 1/432 вычислительной мощности

Новая работа выпускника Университета Цинхуа, Ван Гуана (р. 2000), предлагает альтернативу дорогому и ресурсоёмкому предварительному обучению больших языковых моделей. Исследователи представили HRM-Text — эффективную модель, основанную на иерархической рекуррентной архитектуре (HRM), которая заменяет стандартный Transformer. Ключевые инновации включают: 1. **Архитектура HRM:** Использует модули с медленной (H) и быстрой (L) временной шкалой, выполняющие несколько рекуррентных обновлений на один токен. Это увеличивает вычислительную глубину без роста числа параметров. 2. **Целевая функция обучения:** Модель обучается непосредственно на парах "инструкция-ответ", вычисляя потери только для ответной части с использованием маски PrefixLM (двунаправленное внимание для инструкции, причинное — для ответа). 3. **Методы стабилизации:** MagicNorm (гибридная нормализация) и Warmup Deep Credit Assignment (постепенное увеличение глубины обратного распространения градиента) обеспечивают стабильность глубокого рекуррентного обучения. Эксперименты показывают, что HRM-Text 1B, обученная всего на 40B уникальных токенах с бюджетом около $1500, демонстрирует производительность, сопоставимую с открытыми моделями размером от 2B до 7B параметров. При этом она требует до 900 раз меньше токенов и до 432 раз меньше вычислений для обучения. Модель достигает, например, 60.7% на MMLU и 84.5% на GSM8K. Основные направления будущих исследований: разделение "знаний" и "рассуждений", внедрение адаптивного времени вычислений для снижения затрат на вывод, проверка масштабируемости на больших моделях и оптимизация развёртывания архитектуры PrefixLM.

marsbit05/26 03:17

Альма-матер 'Цинхуа' выпускник 00-х Ван Гуан представил новую работу: разрушение парадигмы предобучения Transformer с использованием 1/900 токенов и 1/432 вычислительной мощности

marsbit05/26 03:17

AI-суперзвезда Karpathy присоединяется к Anthropic. Зачем?

Андрей Карпати, один из сооснователей OpenAI и ведущий специалист в области ИИ, объявил о переходе в компанию Anthropic. Он возглавит новую команду, сосредоточенную на фундаментальных исследованиях в области предобучения моделей, с целью использовать Claude для ускорения прогресса в этом направлении. Этот шаг происходит на фоне растущего успеха Anthropic: в апреле компания впервые обогнала OpenAI по уровню внедрения в корпоративном сегменте, запустила версию Claude для малого бизнеса и заключила партнёрство с Фондом Гейтса. Переход Карпати, обладающего уникальным сочетанием технического авторитета и влияния на сообщество, рассматривается как сильный сигнал для индустрии. Он отражает продолжающуюся конкуренцию за лучшие умы в ИИ и, возможно, сдвиг в приоритетах исследователей в сторону компаний, уделяющих больше внимания фундаментальным исследованиям и безопасности ИИ. Вместо того чтобы сосредотачиваться на прикладных задачах, таких как рассуждения или агенты, Anthropic делает стратегическую ставку на прорыв в предобучении — фундаменте возможностей больших языковых моделей. Задача Карпати — исследовать, как существующая модель Claude может помочь в создании следующего, более совершенного поколения ИИ.

marsbit05/21 08:03

AI-суперзвезда Karpathy присоединяется к Anthropic. Зачем?

marsbit05/21 08:03

活动图片