# Сопутствующие статьи по теме Трансформер

Новостной центр HTX предлагает последние статьи и углубленный анализ по "Трансформер", охватывающие рыночные тренды, новости проектов, развитие технологий и политику регулирования в криптоиндустрии.

10 000 часов человеческих данных позволили создать первую в мире неявную мировую модель действия для полного мобильного манипулирования роботом-гуманоидом

За последние два года фокус в разработке человекоподобных роботов сместился с аппаратной части на моделирование их способностей. Ключевым вызовом стало создание модели, способной понимать окружение, предсказывать изменения и координировать все тело для выполнения задач. Компания «Чжицзай Уцзе» представила Being-M0.7 — первую в мире скрытую мировую модель действия (Latent WAM), предназначенную для полноценного мобильного манипулирования человекоподобными роботами. Модель предварительно обучалась на более чем 10000 часов данных, сфокусированных на человеке (видео от первого лица и данные о движении), а затем донастраивалась на небольшом наборе реальных демонстрационных данных с робота. Being-M0.7 использует архитектуру Mixture of Transformers (MoT), которая позволяет совместно обучаться на спаренных (видео+движение) и одиночных (только видео или только движение) данных, эффективно решая проблему дефицита дорогостоящих данных с реальных роботов. Модель предсказывает будущие состояния среды и траектории движения в скрытом пространстве, что снижает вычислительные затраты по сравнению с предсказанием пикселей. Для контроля используется «эксперт по действиям», который преобразует высокоуровневые прогнозы модели в низкоуровневые команды для конкретного робота. Возможности модели были продемонстрированы на реальном роботе Unitree G1 в сложных задачах, требующих координации всего тела: ловля рыбы в аквариуме (взаимодействие с жидкостью), взятие предмета с использованием зеркала (пространственное рассуждение), длинная последовательность действий по переносу предметов и обход препятствий с грузом. В сравнительных тестах Being-M0.7 показала результаты, превосходящие или сопоставимые с другими моделями. Этот подход, развиваемый от ранее представленной модели для ловких манипуляций Being-H, предлагает путь к масштабируемому обучению роботов за счет использования богатого опыта человеческих действий, прежде чем адаптировать знания к конкретной роботизированной платформе.

marsbit07/15 01:50

10 000 часов человеческих данных позволили создать первую в мире неявную мировую модель действия для полного мобильного манипулирования роботом-гуманоидом

marsbit07/15 01:50

Преобразуем Transformer, и большие языковые модели становятся умнее

В новой статье исследователей из Mila, Корнелльского и Монреальского университетов предлагается радикально простой способ улучшить большие языковые модели (LLM) без увеличения параметров или вычислительных затрат. Вместо равномерного распределения параметров по всем слоям модели, авторы предлагают использовать «конические языковые модели» (Tapered Language Models, TLM), где емкость (например, ширина прямого распространения) монотонно уменьшается от ранних слоев к более поздним. Эксперименты на моделях размером от 440M до 1.3B параметров показывают, что оптимальное распределение (уменьшение по косинусоидальной кривой) дает значительное улучшение. Например, для модели на 440M параметров perplexity снизился с 16.28 до 14.44, что соответствует улучшению на 1.84 пункта. Этот результат воспроизведен на четырех различных архитектурах, включая Transformer, модели с управляемым вниманием и архитектуры с долговременной памятью. Ключевое обоснование заключается в том, что ранние слои модели обрабатывают фундаментальную информацию (например, синтаксис) и нуждаются в большей емкости, в то время как более глубокие слои часто лишь повторяют или уточняют уже сформированные представления. Таким образом, перераспределение ресурсов в пользу начальных слоев повышает общую эффективность модели без дополнительных затрат. Исследователи отмечают, что этот принцип может быть применен не только к языковым моделям, но и к другим архитектурам, таким как Vision Transformer или диффузионные модели, где также исторически используется равномерное распределение параметров по слоям. Работа открывает новое, практически бесплатное направление для оптимизации современных нейронных сетей.

marsbit06/29 12:54

Преобразуем Transformer, и большие языковые модели становятся умнее

marsbit06/29 12:54

Восемь отцов Transformer: где они сегодня?

В статье рассказывается о восьми соавторах знаменитой статьи 2017 года «Attention Is All You Need», в которой был представлен архитектурный блок Transformer, ставший основой для современных больших языковых моделей. Все они изначально работали в Google, но с тех пор покинули компанию и разошлись по разным направлениям. Теперь их пути разошлись: Ашиш Вашвани основал Essential AI, а Нуам Шазер ушел в OpenAI. Ники Пармар присоединилась к Anthropic. Якоб Ушкорэит основал биотех-компанию Inceptive, а Ллион Джонс стал соучредителем Sakana AI в Токио. Эйдан Н. Гомес руководит Cohere, компанией, ориентированной на корпоративные решения. Лукаш Кайзер продолжает фундаментальные исследования в OpenAI, а Илья Полосухин перешел в блокчейн, основав NEAR Protocol. Статья подчеркивает, что, несмотря на огромное влияние Transformer, его создатели не считают эту архитектуру конечной точкой развития ИИ и продолжают искать новые, более эффективные решения в своих разнообразных областях.

marsbit06/28 05:32

Восемь отцов Transformer: где они сегодня?

marsbit06/28 05:32

Новая работа команды Хэ Каймина: после удаления VAE и приватных данных генерация текста в изображениях стала ещё лучше

Новая работа команды Хэ Каймина, MiniT2I, представляет собой минималистскую базовую модель для генерации изображений по тексту, которая бросает вызов существующим сложным подходам. В отличие от популярных моделей, таких как Stable Diffusion, MiniT2I отказывается от использования VAE, сложных механизмов введения условий (AdaLN), вспомогательных функций потерь, приватных данных и этапов выравнивания RL/DPO. Модель работает непосредственно в пространстве пикселей, используя потоковое согласование. Архитектура MM-JiT основана на чистом Transformer с двумя адаптерами для текста и без AdaLN. Обучение проводится в два этапа на полностью открытых данных: предварительное обучение на LLaVA-recaptioned CC12M и тонкая настройка на наборе высококачественных пар изображение-текст. Несмотря на небольшой размер (например, версия B/16 с 258 млн параметров), MiniT2I показывает конкурентоспособные результаты на бенчмарках GenEval (0.87) и DPG-Bench (84.2), превосходя более крупные модели. Модель L/16 (912 млн параметров) демонстрирует хорошее качество в стилях, композиции и воображении, приближаясь к SD3-Medium. Работа также честно указывает на текущие ограничения: артефакты на границах патчей, побочные эффекты CFG в пиксельном пространстве, потолок разрешения и отставание в рендеринге текста из-за использования только открытых данных. MiniT2I доказывает, что создание мощных тексто-графических моделей может быть более простым, эффективным и доступным, отмечая возможный переход от парадигмы «нагромождения» к парадигме «очищения».

marsbit06/22 10:18

Новая работа команды Хэ Каймина: после удаления VAE и приватных данных генерация текста в изображениях стала ещё лучше

marsbit06/22 10:18

Утечка талантов ИИ в Google: стресс-тест или начало «заката»?

Три ведущих специалиста по ИИ покинули Google: Ноам Шазер (соавтор архитектуры Transformer) перешел в OpenAI, Джон Джампер (соавтор AlphaFold) — в Anthropic, а Даниэль Де Фрейтас (сооснователь Character.AI) также ушел. Эти потери затрагивают ключевые направления ИИ: трансформеры, диалоговые системы и научные приложения. Однако автор считает, что это не «некролог» для Google, а скорее стресс-тест. Google остается одним из крупнейших центров ИИ-талантов, и его конкуренты активно переманивают оттуда специалистов перед своими IPO. В отличие от OpenAI и Anthropic, которые сосредоточены на моделях, Google обладает полным стеком: инфраструктура (TPU, облако), модели (Gemini, AlphaFold), продукты (Поиск, YouTube, Android) и миллиарды пользователей. Его сила — в интеграции ИИ в уже существующие сервисы, а не только в соревновании моделей. Кроме того, Google является стратегическим инвестором и инфраструктурным партнером для Anthropic, получая выгоду даже от успехов конкурентов. Хотя Google сталкивается с дилеммой инноватора, замедляясь из-за масштаба основного бизнеса (Поиск), компания показывает способность адаптироваться, как видно на примере сделки по возвращению команды Character.AI. Итог: уход талантов — серьезный сигнал, но Google, с его ресурсами, дистрибуцией и долгосрочной стратегией, остается ключевым игроком в многолетней гонке ИИ.

marsbit06/21 08:56

Утечка талантов ИИ в Google: стресс-тест или начало «заката»?

marsbit06/21 08:56

За три дня потеряли двух легенд: дамба AI-талантов Google трещит по швам?

За последние три дня Google потеряла двух ведущих специалистов по ИИ: Ноама Шазера, одного из авторов архитектуры Transformer, присоединившегося к OpenAI, и Джона Джампера, руководителя проекта AlphaFold и нобелевского лауреата, перешедшего в Anthropic. Эти события не являются изолированными случаями — они отражают устойчивую тенденцию оттока ключевых талантов из Google в сторону OpenAI и Anthropic. Основная причина — фундаментальное несоответствие миссий. Коммерческие цели Google, ориентированные на рекламный бизнес, ограничивают фундаментальные исследования, в то время как OpenAI и Anthropic предлагают фокус на развитии ИИ и безопасности. Кроме того, перспектива скорого IPO OpenAI и Anthropic сулит сотрудникам значительный финансовый рост, чего не может предложить зрелый гигант вроде Google. Слияние Google Brain и DeepMind в 2023 году, предназначенное для консолидации усилий, на практике усилило внутренние трения между исследовательской и продуктовой культурами, увеличив давление коммерциализации на науку. Этот структурный отток талантов перекраивает ландшафт индустрии. Несмотря на сохраняющиеся преимущества в вычислительных ресурсах и данных, Google рискует проиграть в гонке, где ключевым активом являются люди, продвигающие технологические границы. Способность удерживать этих людей становится для компании самой сложной задачей.

marsbit06/20 04:04

За три дня потеряли двух легенд: дамба AI-талантов Google трещит по швам?

marsbit06/20 04:04

Все рукоплещут приходу Ноама, но счет убытков OpenAI стал еще на страницу толще

Ведущий исследователь в области искусственного интеллекта Ноам Шейзер, один из авторов архитектуры Transformer, присоединился к OpenAI. Это событие было встречено с большим энтузиазмом. Однако одновременно были обнародованы финансовые результаты компании за 2025 год: выручка составила 13,07 миллиарда долларов при операционном убытке в 20,92 миллиарда. Чистый убыток, включая разовые списания, приблизился к 39 миллиардам. В первом квартале 2026 года денежные расходы достигли 3,7 миллиарда. OpenAI сталкивается с серьезными проблемами: массовый отток ключевых исследователей, смещение фокуса с фундаментальных исследований на разработку продуктов и огромные расходы на вычислительные мощности (аренда у Microsoft обошлась в 10,59 миллиарда в 2025 году). При этом из 900 миллионов еженедельных активных пользователей лишь 50 миллионов являются платными. На этом фоне найм звездного исследователя выглядит скорее стратегией для поддержания высокой оценки перед потенциальным IPO, чем решением фундаментальных проблем. В отличие от OpenAI, компания Anthropic демонстрирует более устойчивую бизнес-модель, ориентированную на корпоративных клиентов, и, по сообщениям, уже вышла на прибыльность. Вывод: несмотря на громкое назначение, основная проблема OpenAI — отсутствие устойчивой бизнес-модели, способной покрыть колоссальные затраты. Время, отпущенное компании для ожидания результатов исследований Шейзера, ограничено ее финансовыми ресурсами.

marsbit06/19 02:28

Все рукоплещут приходу Ноама, но счет убытков OpenAI стал еще на страницу толще

marsbit06/19 02:28

Внезапно, сокрушительный удар для Google: ведущий сопредседатель Gemini переходит в OpenAI

Внезапная новость: Ноам Шейзер, один из соавторов знаменитой статьи «Attention Is All You Need», в которой был представлен архитектурный подход Transformer, и сопредседатель проекта Gemini в Google DeepMind, перешел в OpenAI. Он займет должность руководителя исследований в области архитектуры (Lead for Architecture Research), где будет заниматься изучением архитектур следующего поколения для ИИ-моделей и развитием Transformer. Шейзер проработал в Google почти 18 лет и сыграл ключевую роль в создании многих фундаментальных технологий, включая смешанных экспертов (MoE). В 2021 году он покинул Google и стал соучредителем Character.AI. В 2024 году Google вернул его и часть команды в DeepMind в рамках сделки на сумму около 27 миллиардов долларов, где он стал одним из руководителей Gemini. Его переход в OpenAI рассматривается как серьезный удар для Google и значительное усиление для OpenAI, особенно на фоне жесткой конкуренции с Anthropic. Шейзеру предстоит исследовать возможные преемники архитектуры Transformer, которая почти десять лет лежит в основе современных больших языковых моделей. Это событие подчеркивает остроту битвы за ведущие таланты в сфере искусственного интеллекта.

marsbit06/18 04:20

Внезапно, сокрушительный удар для Google: ведущий сопредседатель Gemini переходит в OpenAI

marsbit06/18 04:20

10 лет спустя, Олтман наконец получил человека, которого хотел

Нойм Шазер, один из ключевых авторов революционной архитектуры Transformer и бывший ведущий инженер Google, объявил о переходе в OpenAI. Это решение он подтвердил в своём аккаунте в X, отметив сложность ухода из Google и выразив гордость за работу с командой. Сэм Олтман, CEO OpenAI, заявил, что Шазер был одним из людей, с которыми он больше всего хотел сотрудничать с момента основания компании, и что «ожидание в 10 лет того стоило». Шазер займёт в OpenAI должность руководителя архитектурных исследований. Нойм Шазер — легендарная фигура в области ИИ. Помимо соавторства в основополагающей работе «Attention Is All You Need», его исследования в области смешанных экспертных моделей (MoE) и эффективного декодирования заложили фундамент для современных больших языковых моделей. В 2021 году он покинул Google из-за разочарования в бюрократии и стал сооснователем Character.AI, но в 2024 году вернулся в Google DeepMind в рамках сделки на 2,7 млрд долларов, чтобы возглавить техническое направление Gemini. Его новый уход менее чем через два года считается значительной потерей для проекта Gemini. В сообществе это событие восприняли неоднозначно: некоторые видят в этом серьёзный удар по конкурентоспособности Gemini, другие же иронично отмечают, что OpenAI получила экспертизу Шазера практически бесплатно. Этот переход считается важной победой OpenAI в войне за таланты в сфере ИИ.

marsbit06/18 04:16

10 лет спустя, Олтман наконец получил человека, которого хотел

marsbit06/18 04:16

Альма-матер 'Цинхуа' выпускник 00-х Ван Гуан представил новую работу: разрушение парадигмы предобучения Transformer с использованием 1/900 токенов и 1/432 вычислительной мощности

Новая работа выпускника Университета Цинхуа, Ван Гуана (р. 2000), предлагает альтернативу дорогому и ресурсоёмкому предварительному обучению больших языковых моделей. Исследователи представили HRM-Text — эффективную модель, основанную на иерархической рекуррентной архитектуре (HRM), которая заменяет стандартный Transformer. Ключевые инновации включают: 1. **Архитектура HRM:** Использует модули с медленной (H) и быстрой (L) временной шкалой, выполняющие несколько рекуррентных обновлений на один токен. Это увеличивает вычислительную глубину без роста числа параметров. 2. **Целевая функция обучения:** Модель обучается непосредственно на парах "инструкция-ответ", вычисляя потери только для ответной части с использованием маски PrefixLM (двунаправленное внимание для инструкции, причинное — для ответа). 3. **Методы стабилизации:** MagicNorm (гибридная нормализация) и Warmup Deep Credit Assignment (постепенное увеличение глубины обратного распространения градиента) обеспечивают стабильность глубокого рекуррентного обучения. Эксперименты показывают, что HRM-Text 1B, обученная всего на 40B уникальных токенах с бюджетом около $1500, демонстрирует производительность, сопоставимую с открытыми моделями размером от 2B до 7B параметров. При этом она требует до 900 раз меньше токенов и до 432 раз меньше вычислений для обучения. Модель достигает, например, 60.7% на MMLU и 84.5% на GSM8K. Основные направления будущих исследований: разделение "знаний" и "рассуждений", внедрение адаптивного времени вычислений для снижения затрат на вывод, проверка масштабируемости на больших моделях и оптимизация развёртывания архитектуры PrefixLM.

marsbit05/26 03:17

Альма-матер 'Цинхуа' выпускник 00-х Ван Гуан представил новую работу: разрушение парадигмы предобучения Transformer с использованием 1/900 токенов и 1/432 вычислительной мощности

marsbit05/26 03:17

活动图片