Запуск MoE на смартфоне? Meta предлагает MobileMoE, ускорение на iPhone 16 Pro до 3.8 раза

marsbitОпубликовано 2026-06-01Обновлено 2026-06-01

Введение

Мета представила MobileMoE — первую эффективную реализацию модели смешанных экспертов (MoE) для инференса на коммерческих смартфонах. Традиционно MoE использовались в облачных больших языковых моделях (LLM), тогда как на мобильных устройствах применялись плотные архитектуры из-за ограничений памяти и вычислительных ресурсов. MobileMoE заменяет плотные слои в Transformer на MoE-слои. Маршрутизатор выбирает для каждого токена несколько наиболее релевантных экспертов, при этом один общий эксперт участвует в вычислениях всегда. Обучение модели включает четыре этапа: предварительное обучение, промежуточное обучение, контролируемое тонкое обучение (SFT) и обучение с учётом квантизации. Результаты показывают, что MobileMoE-S/M при сопоставимом использовании памяти требует в 2–4 раза меньше вычислений, чем плотные базовые модели, достигая аналогичной или более высокой точности в 14 базовых тестах. На iPhone 16 Pro инференс ускорился до 3,8 раз на этапе ввода и до 3,4 раз на этапе генерации. После квантизации до INT4 модель сохраняет конкурентоспособность, а пиковое использование памяти на Samsung Galaxy S25 ниже, чем у аналогов. Несмотря на преимущества в коде и математике, MobileMoE пока уступает Qwen3.5 2B в следовании инструкциям и сложных рассуждениях. Для дальнейшего улучшения необходимы дистилляция, постобучение и мультимодальное расширение. Также требуются исследования для оптимизации памяти при изменяющихся входных данных и использования NPU на мобильных устройствах.

В последние годы модели смешанных экспертов (MoE) широко используются в облачных больших моделях. Но на стороне мобильных устройств большие языковые модели (LLM) по-прежнему в основном имеют плотную архитектуру. Раньше ограничения памяти, вычислительной мощности и задержек на мобильных устройствах были более строгими, и систематические исследования MoE для мобильных устройств в диапазоне до миллиарда активных параметров отсутствовали. Теперь, с увеличением объема DRAM на мобильных устройствах, MoE также получили возможность развертывания на смартфонах.

Предложенная командой Meta модель MobileMoE впервые реализует эффективный вывод MoE на коммерческих смартфонах. Результаты показывают, что в 14 базовых тестах MobileMoE-S/M при сопоставимом объеме памяти, используя лишь от 1/2 до 1/4 объема вычислений для вывода по сравнению с плотным базовым уровнем, достигает сравнимой или даже более высокой средней точности. В реальных тестах MobileMoE-S на GPU/MLX бэкенде iPhone 16 Pro показала наиболее заметное ускорение, максимальное ускорение на этапе ввода достигает 3.8 раза.

Ссылка на статью: https://arxiv.org/abs/2605.27358

Исследовательская группа также предложила набор правил масштабирования MoE для мобильных устройств, чтобы определить более подходящую для развертывания на смартфонах архитектуру модели. MobileMoE устанавливает новый Парето-фронт для мобильных больших языковых моделей, достигая лучших результатов в компромиссе между точностью и вычислительными затратами на вывод.

Рис. | MobileMoE устанавливает новый Парето-фронт для мобильных больших языковых моделей.

Как спроектирована MobileMoE?

MobileMoE можно понять так: это класс языковых моделей MoE, разработанных для развертывания на мобильных устройствах. В целом это все еще трансформер только с декодером (decoder-only Transformer), но исходный плотный слой прямого распространения заменен на слой MoE. Маршрутизатор для каждого токена выбирает небольшое число экспертов с наивысшими баллами для участия в вычислениях, также есть общий эксперт, который всегда участвует в вычислениях. Весь процесс обучения состоит из четырех шагов: предобучение, промежуточное обучение, контролируемое тонкое настройка и обучение с учетом квантования.

Предобучение: Исследовательская группа провела предобучение на примерно 6 трлн токенов данных с открытой лицензией при длине контекста 2048, данные в основном из Интернета, а также охватывают области математики, кода, знаний и науки.

Промежуточное обучение: Исследовательская группа расширила длину контекста до 8192 и дополнительно увеличила долю высококачественных данных в области знаний, кода, математики и науки, общий объем составил около 500 млрд токенов.

Контролируемое тонкое настройка (SFT): Исследовательская группа провела тонкую настройку MobileMoE-Base на более чем 80 миллионах образцов данных с открытой лицензией для инструктивного тонкого настройки.

Обучение с учетом квантования: Исследовательская группа квантовала линейные слои и эмбеддинги до INT4, динамически квантовала активации до INT8, а маршрутизатор сохранила точность FP32.

Рис. | Четыре этапа обучения MobileMoE.

Результаты экспериментов

Результаты анализа влияния (абляции)

Исследовательская группа сначала сравнила три архитектурные переменные: количество экспертов E, гранулярность экспертов g и наличие общего эксперта.

Рис. | Масштабирование количества экспертов E.

При фиксированном бюджете памяти, когда память превышает примерно 0.25 ГБ, потери MoE начинают быть ниже, чем у соответствующей плотной модели. Продолжая увеличивать количество экспертов E, потери продолжают снижаться, но когда E увеличивается до 8, предельная выгода уже заметно ослабевает. Эксперименты с гранулярностью экспертов g показали, что более мелкозернистая конфигурация экспертов в целом лучше, где g=8 обеспечивает хороший баланс между эффективностью и затратами на обучение; когда g увеличивается с 8 до 16, улучшение потерь составляет менее 0.01, но время обучения увеличивается примерно на 50%. При том же вычислительном бюджете добавление общего эксперта дополнительно снижает потери модели.

На основе результатов анализа влияния исследовательская группа в итоге приняла конфигурацию с E=8, g=8 и общим экспертом, то есть 60 экспертов с мелкозернистой маршрутизацией, топ-4 маршрутизацией и 1 общим экспертом, и использовала эту структуру для трех версий: MobileMoE-S/M/L.

Рис. | Масштабирование моделей MoE в условиях вычислительной оптимальности.

Рис. | Эффективность обучения архитектуры MoE.

14 базовых оценок: установление нового Парето-фронта для мобильных устройств

Исследовательская группа в пяти категориях — здравый смысл и рассуждения, знания, наука, чтение и рассуждения — всего 14 базовых оценках, провела повторную оценку MobileMoE вместе с моделями Gemma 3, SmolLM2, Qwen3.5, OLMo 2, OLMoE-1B-7B в единых условиях.

Рис. | Траектория предобучения MobileMoE.

Результаты сравнения базовых моделей показывают, что средний балл MobileMoE-M выше, чем у Qwen3.5 2B, средний балл MobileMoE-L выше, чем у OLMoE-1B-7B, при этом требуемый размер модели также меньше; исследовательская группа также отмечает, что средний балл базовой версии MobileMoE-L уже выше, чем у инструктивной версии OLMoE-1B-7B. По объему обучения MobileMoE использует около 6 трлн токенов предобучения, что меньше, чем 9 трлн у Llama 3.2 1B и 11 трлн у SmolLM2 1.7B. В общем сравнении моделей после инструктивного тонкого настройки средняя точность MobileMoE-M уже близка к OLMoE-1B-7B, но активные параметры и общее количество параметров меньше примерно на 60%.

Рис. | Сравнение базовых моделей MobileMoE-Base.

Расширенные оценки: преимущества более заметны в задачах кода и математики

В расширенных оценках после инструктивного тонкого настройки MobileMoE показывает более выдающиеся результаты в задачах кода и математики. Например, MobileMoE-L в обеих категориях оценок — код и математика — имеет средний балл выше, чем у Qwen3.5 2B и OLMoE-1B-7B. Однако исследовательская группа также отмечает, что в способностях следования инструкциям и рассуждений на основе знаний Qwen3.5 2B все еще сильнее.

Рис. | Сравнение инструктивных моделей на расширенных тестах.

Квантование и развертывание на устройствах: сохраняет конкурентоспособность после INT4, заметное ускорение на смартфонах

После квантования общий средний балл MobileMoE-S/M/L по сравнению с их версиями BF16 снизился, но снижение примерно составляет от 2 до 3 баллов. Тем не менее, производительность INT4 версии MobileMoE-L все еще выше, чем у инструктивной версии OLMoE-1B-7B в BF16.

Исследовательская группа также развернула MobileMoE на Samsung Galaxy S25 и iPhone 16 Pro для тестирования. Результаты показывают, что при сопоставимых условиях памяти для INT4 весов, MobileMoE-S по сравнению с MobileLLM-Pro ускоряет этап ввода в 1.8-3.8 раза, этап генерации по токенам — в 2.2-3.4 раза.

Что касается потребления памяти, на Samsung Galaxy S25 при длине контекста 8K и реальном промпте пиковое значение RSS для MobileMoE-S составило 1.49 ГБ, что ниже 1.91 ГБ у MobileLLM-Pro.

Рис. | Задержка выполнения на устройстве.

Недостатки и направления на будущее

В настоящее время, в более продвинутых способностях следования инструкциям, а также в знаниях и рассуждениях, инструктивно настроенная MobileMoE все еще отстает от Qwen3.5 2B. Исследовательская группа считает, что этот разрыв может быть связан с более совершенным пост-обучением последней. В будущем, чтобы сократить этот разрыв, со стороны обучения потребуется усилить дистилляцию, пост-обучение, ориентированное на рассуждения, а также многомодальное расширение.

Кроме того, исследовательская группа указывает, что потребление памяти MoE на смартфоне меняется в зависимости от входных данных. По сравнению с фиксированным шаблонным вводом, реальный ввод обычно приводит к более высокому потреблению памяти. Если тестирование основывается только на шаблонном вводе, это может недооценивать нагрузку на память в реальных сценариях развертывания. В будущем, для более точной оценки реальных характеристик памяти мобильного MoE, все еще потребуются реальные данные тестирования.

Между тем, исследовательская группа уже завершила систематическое тестирование на реальных устройствах для бэкендов CPU и GPU, но путь NPU еще предстоит изучить. В то же время, потребление памяти во время выполнения MoE довольно чувствительно к входным данным. В будущем, динамическая маршрутизация, обрезка экспертов, смешанное квантование по точности, а также развертывание на мобильных NPU — все это направления для дальнейшего повышения эффективности на устройствах.

Более подробную техническую информацию см. в исходной статье.

Эта статья взята из официального аккаунта WeChat "Академические заголовки" (ID: SciTouTiao), автор: Ся Цяньсы.

Связанные с этим вопросы

QЧто такое MobileMoE и какое основное достижение представила команда Meta?

AMobileMoE — это тип моделей языка на основе смеси экспертов (MoE), разработанный для развертывания на мобильных устройствах. Исследовательская группа Meta впервые реализовала эффективный вывод MoE на коммерческих смартфонах. Основное достижение заключается в том, что MobileMoE-S/M при схожем объеме памяти использует всего от 1/2 до 1/4 вычислительных затрат на вывод по сравнению с плотными базовыми моделями, достигая сопоставимой или более высокой средней точности в 14 базовых тестах. На iPhone 16 Pro скорость ввода увеличилась до 3.8 раза.

QКакой подход к обучению использовался для MobileMoE?

AОбучение MobileMoE состояло из четырех этапов: 1) Предварительное обучение на примерно 6 триллионах токенов с контекстом 2048, 2) Среднесрочное обучение с расширением контекста до 8192 и увеличением доли высококачественных данных (около 500 миллиардов токенов), 3) Контролируемая тонкая настройка (SFT) на более чем 80 миллионах образцов, 4) Квантованное обучение с осознанием: линейные слои и эмбеддинги квантовались до INT4, активации — до INT8, а маршрутизатор сохранял точность FP32.

QКаковы были результаты абляционных исследований по архитектуре MobileMoE?

AАбляционные исследования показали, что при фиксированном бюджете памяти MoE начинает превосходить плотные модели, когда память превышает примерно 0.25 ГБ. Оптимальной конфигурацией стали 8 экспертов (E=8) и гранулярность эксперта 8 (g=8) с добавлением одного общего эксперта. Это обеспечило хороший баланс между качеством и вычислительными затратами. Использование общего эксперта при одинаковом вычислительном бюджете дополнительно снизило потери модели.

QНасколько эффективен MobileMoE после квантования и в мобильном развертывании?

AПосле квантования до INT4 модели MobileMoE-S/M/L показали снижение среднего балла примерно на 2-3 пункта по сравнению с версиями BF16, но MobileMoE-L в INT4 все равно превзошел модель OLMoE-1B-7B Instruct в BF16. При развертывании на Samsung Galaxy S25 и iPhone 16 Pro, MobileMoE-S в условиях сопоставимой памяти весов INT4 показал ускорение фазы ввода в 1.8-3.8 раза и ускорение генерации по токенам в 2.2-3.4 раза по сравнению с MobileLLM-Pro. Пиковое использование памяти (RSS) на Galaxy S25 у MobileMoE-S было ниже (1.49 ГБ против 1.91 ГБ).

QКакие ограничения и будущие направления исследований упоминаются в статье?

AТекущие ограничения включают отставание в способностях следовать сложным инструкциям и в знаниях/рассуждениях по сравнению с Qwen3.5 2B. Для улучшения необходимы более совершенное последующее обучение, дистилляция и мультимодальное расширение. Также отмечается, что использование памяти MoE на телефоне чувствительно к входным данным, поэтому для точной оценки требуются тесты на реальных данных. Будущие направления: исследование маршрутизации на NPU, динамическая маршрутизация, обрезка экспертов, смешанная точность квантования и оптимизация для мобильных NPU.

Похожее

Диалог с Далио: Сейчас мы находимся в пузыре ИИ, 1% моего инвестиционного портфеля — это биткоин

Источник: интервью Рэя Далио, основателя Bridgewater Associates, для подкаста "The Diary Of A CEO". Далио, предсказавший кризис 2008 года, обсуждает "большой цикл" — концепцию, охватывающую долговые проблемы, растущее неравенство и геополитические сдвиги. Он указывает, что текущий ажиотаж вокруг ИИ демонстрирует классические признаки пузыря, который может лопнуть из-за высокой долговой нагрузки, роста процентных ставок и чрезмерной эмиссии акций, что способно привести к рецессии. Для защиты личного капитала в неопределенные времена Далио советует диверсификацию: вместо хранения наличных инвестировать в акции, золото, облигации. Сам он держит около 1% портфеля в биткоине, считая его "твердыми деньгами", но предпочитает физическое золото из-за его статуса резервного актива и независимости от технологических рисков. Говоря о влиянии ИИ, Далио отмечает, что технология заменяет не только физический труд, но и элементы мышления, что увеличит разрыв между капиталом и трудом. Ключевыми останутся человеческие качества — эмоции и интуиция, а успеха добьются те, кто научится работать в партнерстве с ИИ. На геополитической арене, по его мнению, мир движется к регионализации с центрами в виде США и Китая. Вовлечение США в конфликты, подобные иранскому, обнажает снижение их абсолютного влияния. Внутренние вызовы, такие как дебаты о налогах на богатство, риск капитального бегства и низкая производительность, также ставят под вопрос стабильность традиционных держав в текущей фазе цикла.

marsbit2 ч. назад

Диалог с Далио: Сейчас мы находимся в пузыре ИИ, 1% моего инвестиционного портфеля — это биткоин

marsbit2 ч. назад

7.2 трлн вон за один день: иностранные инвесторы установили рекорд чистых покупок в пятницу! Уолл-Стрит: встречный ветер в плане ликвидности на южнокорейском рынке уже утих

Капиталы возвращаются на южнокорейский рынок акций. 31 июля иностранные инвесторы осуществили чистые покупки акций KOSPI на рекордные 7,2 трлн вон за один день, что стало самым высоким показателем в истории. По данным Citigroup, эта цифра знаменует собой кардинальный разворот после месяцев масштабного оттока средств нерезидентов. В июле чистые продажи иностранными инвесторами значительно сократились до 9,8 трлн вон по сравнению с 48,4 трлн и 44,5 трлн вон в июне и мае соответственно. Одновременно внутренние пенсионные и инвестиционные фонды в июле вернулись к чистым покупкам на 1,0 трлн вон. Дополнительным фактором снижения волатильности стали новые правила Комиссии по финансовым услугам (FSC), ужесточившие с 31 июля доступ розничных инвесторов к ETF с плечом на отдельные акции. После введения норм торговый оборот таких инструментов упал примерно вдвое. Citigroup сохраняет целевую точку для KOSPI на уровне 10000 пунктов, отмечая ослабление давления со стороны движения капиталов. Аналитики видят поддержку рынку в устойчивости фундаментальных показателей сектора чипов памяти, низких оценках KOSPI, сильной экономике и благоприятной политике властей, включая возможные меры по поддержке ликвидности.

marsbit2 ч. назад

7.2 трлн вон за один день: иностранные инвесторы установили рекорд чистых покупок в пятницу! Уолл-Стрит: встречный ветер в плане ликвидности на южнокорейском рынке уже утих

marsbit2 ч. назад

Как стать человеком, которого искусственный интеллект никогда не сможет заменить

В статье рассматривается вопрос о том, как остаться незаменимым в эпоху искусственного интеллекта. Автор утверждает, что вместо страха перед ИИ следует сосредоточиться на развитии качеств, которые машины не смогут заменить. Он критикует «зарплатное рабство» — зависимость от работы, не приносящей удовлетворения, и предлагает путь к финансовой независимости через создание собственного дела. Ключ к успеху — развитие пяти элементов: самостоятельности (агентности), вкуса, умения убеждать, упорства и способности к итерациям. Главное — не просто создавать что-либо (сегодня это может каждый), а создавать что-то ценное, востребованное и уметь это продвигать. Автор считает, что наиболее важным навыком будущего является создание контента (медиа), а не просто написание кода, поскольку ценность контента субъективна и требует уникального человеческого вкуса и суждения. ИИ может помочь в производстве, но не заменит оригинальность мысли и связь с аудиторией. В качестве практического шага предлагается упражнение: за 15 минут ответить на вопросы, чтобы обнаружить свои уникальные знания, опыт и точку зрения, которые станут основой для личного бренда и дела жизни. Первый шаг — немедленно опубликовать свою основную идею, чтобы получить обратную связь от реального мира и начать процесс роста. Цель — стать «непригодным для найма», построив жизнь вокруг собственного творчества и экспертизы.

marsbit4 ч. назад

Как стать человеком, которого искусственный интеллект никогда не сможет заменить

marsbit4 ч. назад

Благодаря броскам кубиков ключи от биткоинов хранятся в автономном режиме, но не все будут этим заниматься

Статья посвящена практике генерации сид-фраз для биткоин-кошельков с помощью бросков кубиков в свете уязвимости, обнаруженной в аппаратных кошельках Coldcard. Подчеркивается, что физический бросок кубика (дающий около 2.6 бит энтропии за бросок) создает высококачественную случайность, поскольку предсказать результат практически невозможно из-за множества переменных. Для создания стандартной сид-фразы из 12 слов (128 бит энтропии) требуется около 50 бросков, а для повышенной безопасности рекомендуется 99 и более. В связи с инцидентом Coldcard, когда неисправный генератор случайных чисел в прошивке (2021-2026 гг.) мог создавать предсказуемые ключи, выяснилось, что сид-фразы, сгенерированные вручную через кубики, были защищены от этой уязвимости. Однако исследование показало, что другие функции устройства (создание бумажных кошельков, ключей для мультиподписи, паролей и т.д.) по-прежнему использовали скомпрометированный генератор, подвергая риску владельцев даже с безопасной основной сид-фразой. Автор отмечает, что, хотя метод с кубиками криптографически надежен, он непрактичен для массового использования из-за трудоемкости, высокой вероятности ошибок при вводе и необходимости строгой дисциплины для сохранения секретности процесса. Делается вывод, что будущее безопасности лежит в создании надежных аппаратных генераторов случайных чисел и понятных интерфейсов, а ручные методы остаются нишевым инструментом для опытных пользователей. Владельцам Coldcard рекомендуется обновить прошивку и проверить/заменить все ключи, сгенерированные уязвимыми функциями.

cryptonews.ru8 ч. назад

Благодаря броскам кубиков ключи от биткоинов хранятся в автономном режиме, но не все будут этим заниматься

cryptonews.ru8 ч. назад

Торговля

Спот
活动图片