Запуск MoE на смартфоне? Meta предлагает MobileMoE, ускорение на iPhone 16 Pro до 3.8 раза

marsbitОпубликовано 2026-06-01Обновлено 2026-06-01

Введение

Мета представила MobileMoE — первую эффективную реализацию модели смешанных экспертов (MoE) для инференса на коммерческих смартфонах. Традиционно MoE использовались в облачных больших языковых моделях (LLM), тогда как на мобильных устройствах применялись плотные архитектуры из-за ограничений памяти и вычислительных ресурсов. MobileMoE заменяет плотные слои в Transformer на MoE-слои. Маршрутизатор выбирает для каждого токена несколько наиболее релевантных экспертов, при этом один общий эксперт участвует в вычислениях всегда. Обучение модели включает четыре этапа: предварительное обучение, промежуточное обучение, контролируемое тонкое обучение (SFT) и обучение с учётом квантизации. Результаты показывают, что MobileMoE-S/M при сопоставимом использовании памяти требует в 2–4 раза меньше вычислений, чем плотные базовые модели, достигая аналогичной или более высокой точности в 14 базовых тестах. На iPhone 16 Pro инференс ускорился до 3,8 раз на этапе ввода и до 3,4 раз на этапе генерации. После квантизации до INT4 модель сохраняет конкурентоспособность, а пиковое использование памяти на Samsung Galaxy S25 ниже, чем у аналогов. Несмотря на преимущества в коде и математике, MobileMoE пока уступает Qwen3.5 2B в следовании инструкциям и сложных рассуждениях. Для дальнейшего улучшения необходимы дистилляция, постобучение и мультимодальное расширение. Также требуются исследования для оптимизации памяти при изменяющихся входных данных и использования NPU на мобильных устройствах.

В последние годы модели смешанных экспертов (MoE) широко используются в облачных больших моделях. Но на стороне мобильных устройств большие языковые модели (LLM) по-прежнему в основном имеют плотную архитектуру. Раньше ограничения памяти, вычислительной мощности и задержек на мобильных устройствах были более строгими, и систематические исследования MoE для мобильных устройств в диапазоне до миллиарда активных параметров отсутствовали. Теперь, с увеличением объема DRAM на мобильных устройствах, MoE также получили возможность развертывания на смартфонах.

Предложенная командой Meta модель MobileMoE впервые реализует эффективный вывод MoE на коммерческих смартфонах. Результаты показывают, что в 14 базовых тестах MobileMoE-S/M при сопоставимом объеме памяти, используя лишь от 1/2 до 1/4 объема вычислений для вывода по сравнению с плотным базовым уровнем, достигает сравнимой или даже более высокой средней точности. В реальных тестах MobileMoE-S на GPU/MLX бэкенде iPhone 16 Pro показала наиболее заметное ускорение, максимальное ускорение на этапе ввода достигает 3.8 раза.

Ссылка на статью: https://arxiv.org/abs/2605.27358

Исследовательская группа также предложила набор правил масштабирования MoE для мобильных устройств, чтобы определить более подходящую для развертывания на смартфонах архитектуру модели. MobileMoE устанавливает новый Парето-фронт для мобильных больших языковых моделей, достигая лучших результатов в компромиссе между точностью и вычислительными затратами на вывод.

Рис. | MobileMoE устанавливает новый Парето-фронт для мобильных больших языковых моделей.

Как спроектирована MobileMoE?

MobileMoE можно понять так: это класс языковых моделей MoE, разработанных для развертывания на мобильных устройствах. В целом это все еще трансформер только с декодером (decoder-only Transformer), но исходный плотный слой прямого распространения заменен на слой MoE. Маршрутизатор для каждого токена выбирает небольшое число экспертов с наивысшими баллами для участия в вычислениях, также есть общий эксперт, который всегда участвует в вычислениях. Весь процесс обучения состоит из четырех шагов: предобучение, промежуточное обучение, контролируемое тонкое настройка и обучение с учетом квантования.

Предобучение: Исследовательская группа провела предобучение на примерно 6 трлн токенов данных с открытой лицензией при длине контекста 2048, данные в основном из Интернета, а также охватывают области математики, кода, знаний и науки.

Промежуточное обучение: Исследовательская группа расширила длину контекста до 8192 и дополнительно увеличила долю высококачественных данных в области знаний, кода, математики и науки, общий объем составил около 500 млрд токенов.

Контролируемое тонкое настройка (SFT): Исследовательская группа провела тонкую настройку MobileMoE-Base на более чем 80 миллионах образцов данных с открытой лицензией для инструктивного тонкого настройки.

Обучение с учетом квантования: Исследовательская группа квантовала линейные слои и эмбеддинги до INT4, динамически квантовала активации до INT8, а маршрутизатор сохранила точность FP32.

Рис. | Четыре этапа обучения MobileMoE.

Результаты экспериментов

Результаты анализа влияния (абляции)

Исследовательская группа сначала сравнила три архитектурные переменные: количество экспертов E, гранулярность экспертов g и наличие общего эксперта.

Рис. | Масштабирование количества экспертов E.

При фиксированном бюджете памяти, когда память превышает примерно 0.25 ГБ, потери MoE начинают быть ниже, чем у соответствующей плотной модели. Продолжая увеличивать количество экспертов E, потери продолжают снижаться, но когда E увеличивается до 8, предельная выгода уже заметно ослабевает. Эксперименты с гранулярностью экспертов g показали, что более мелкозернистая конфигурация экспертов в целом лучше, где g=8 обеспечивает хороший баланс между эффективностью и затратами на обучение; когда g увеличивается с 8 до 16, улучшение потерь составляет менее 0.01, но время обучения увеличивается примерно на 50%. При том же вычислительном бюджете добавление общего эксперта дополнительно снижает потери модели.

На основе результатов анализа влияния исследовательская группа в итоге приняла конфигурацию с E=8, g=8 и общим экспертом, то есть 60 экспертов с мелкозернистой маршрутизацией, топ-4 маршрутизацией и 1 общим экспертом, и использовала эту структуру для трех версий: MobileMoE-S/M/L.

Рис. | Масштабирование моделей MoE в условиях вычислительной оптимальности.

Рис. | Эффективность обучения архитектуры MoE.

14 базовых оценок: установление нового Парето-фронта для мобильных устройств

Исследовательская группа в пяти категориях — здравый смысл и рассуждения, знания, наука, чтение и рассуждения — всего 14 базовых оценках, провела повторную оценку MobileMoE вместе с моделями Gemma 3, SmolLM2, Qwen3.5, OLMo 2, OLMoE-1B-7B в единых условиях.

Рис. | Траектория предобучения MobileMoE.

Результаты сравнения базовых моделей показывают, что средний балл MobileMoE-M выше, чем у Qwen3.5 2B, средний балл MobileMoE-L выше, чем у OLMoE-1B-7B, при этом требуемый размер модели также меньше; исследовательская группа также отмечает, что средний балл базовой версии MobileMoE-L уже выше, чем у инструктивной версии OLMoE-1B-7B. По объему обучения MobileMoE использует около 6 трлн токенов предобучения, что меньше, чем 9 трлн у Llama 3.2 1B и 11 трлн у SmolLM2 1.7B. В общем сравнении моделей после инструктивного тонкого настройки средняя точность MobileMoE-M уже близка к OLMoE-1B-7B, но активные параметры и общее количество параметров меньше примерно на 60%.

Рис. | Сравнение базовых моделей MobileMoE-Base.

Расширенные оценки: преимущества более заметны в задачах кода и математики

В расширенных оценках после инструктивного тонкого настройки MobileMoE показывает более выдающиеся результаты в задачах кода и математики. Например, MobileMoE-L в обеих категориях оценок — код и математика — имеет средний балл выше, чем у Qwen3.5 2B и OLMoE-1B-7B. Однако исследовательская группа также отмечает, что в способностях следования инструкциям и рассуждений на основе знаний Qwen3.5 2B все еще сильнее.

Рис. | Сравнение инструктивных моделей на расширенных тестах.

Квантование и развертывание на устройствах: сохраняет конкурентоспособность после INT4, заметное ускорение на смартфонах

После квантования общий средний балл MobileMoE-S/M/L по сравнению с их версиями BF16 снизился, но снижение примерно составляет от 2 до 3 баллов. Тем не менее, производительность INT4 версии MobileMoE-L все еще выше, чем у инструктивной версии OLMoE-1B-7B в BF16.

Исследовательская группа также развернула MobileMoE на Samsung Galaxy S25 и iPhone 16 Pro для тестирования. Результаты показывают, что при сопоставимых условиях памяти для INT4 весов, MobileMoE-S по сравнению с MobileLLM-Pro ускоряет этап ввода в 1.8-3.8 раза, этап генерации по токенам — в 2.2-3.4 раза.

Что касается потребления памяти, на Samsung Galaxy S25 при длине контекста 8K и реальном промпте пиковое значение RSS для MobileMoE-S составило 1.49 ГБ, что ниже 1.91 ГБ у MobileLLM-Pro.

Рис. | Задержка выполнения на устройстве.

Недостатки и направления на будущее

В настоящее время, в более продвинутых способностях следования инструкциям, а также в знаниях и рассуждениях, инструктивно настроенная MobileMoE все еще отстает от Qwen3.5 2B. Исследовательская группа считает, что этот разрыв может быть связан с более совершенным пост-обучением последней. В будущем, чтобы сократить этот разрыв, со стороны обучения потребуется усилить дистилляцию, пост-обучение, ориентированное на рассуждения, а также многомодальное расширение.

Кроме того, исследовательская группа указывает, что потребление памяти MoE на смартфоне меняется в зависимости от входных данных. По сравнению с фиксированным шаблонным вводом, реальный ввод обычно приводит к более высокому потреблению памяти. Если тестирование основывается только на шаблонном вводе, это может недооценивать нагрузку на память в реальных сценариях развертывания. В будущем, для более точной оценки реальных характеристик памяти мобильного MoE, все еще потребуются реальные данные тестирования.

Между тем, исследовательская группа уже завершила систематическое тестирование на реальных устройствах для бэкендов CPU и GPU, но путь NPU еще предстоит изучить. В то же время, потребление памяти во время выполнения MoE довольно чувствительно к входным данным. В будущем, динамическая маршрутизация, обрезка экспертов, смешанное квантование по точности, а также развертывание на мобильных NPU — все это направления для дальнейшего повышения эффективности на устройствах.

Более подробную техническую информацию см. в исходной статье.

Эта статья взята из официального аккаунта WeChat "Академические заголовки" (ID: SciTouTiao), автор: Ся Цяньсы.

Связанные с этим вопросы

QЧто такое MobileMoE и какое основное достижение представила команда Meta?

AMobileMoE — это тип моделей языка на основе смеси экспертов (MoE), разработанный для развертывания на мобильных устройствах. Исследовательская группа Meta впервые реализовала эффективный вывод MoE на коммерческих смартфонах. Основное достижение заключается в том, что MobileMoE-S/M при схожем объеме памяти использует всего от 1/2 до 1/4 вычислительных затрат на вывод по сравнению с плотными базовыми моделями, достигая сопоставимой или более высокой средней точности в 14 базовых тестах. На iPhone 16 Pro скорость ввода увеличилась до 3.8 раза.

QКакой подход к обучению использовался для MobileMoE?

AОбучение MobileMoE состояло из четырех этапов: 1) Предварительное обучение на примерно 6 триллионах токенов с контекстом 2048, 2) Среднесрочное обучение с расширением контекста до 8192 и увеличением доли высококачественных данных (около 500 миллиардов токенов), 3) Контролируемая тонкая настройка (SFT) на более чем 80 миллионах образцов, 4) Квантованное обучение с осознанием: линейные слои и эмбеддинги квантовались до INT4, активации — до INT8, а маршрутизатор сохранял точность FP32.

QКаковы были результаты абляционных исследований по архитектуре MobileMoE?

AАбляционные исследования показали, что при фиксированном бюджете памяти MoE начинает превосходить плотные модели, когда память превышает примерно 0.25 ГБ. Оптимальной конфигурацией стали 8 экспертов (E=8) и гранулярность эксперта 8 (g=8) с добавлением одного общего эксперта. Это обеспечило хороший баланс между качеством и вычислительными затратами. Использование общего эксперта при одинаковом вычислительном бюджете дополнительно снизило потери модели.

QНасколько эффективен MobileMoE после квантования и в мобильном развертывании?

AПосле квантования до INT4 модели MobileMoE-S/M/L показали снижение среднего балла примерно на 2-3 пункта по сравнению с версиями BF16, но MobileMoE-L в INT4 все равно превзошел модель OLMoE-1B-7B Instruct в BF16. При развертывании на Samsung Galaxy S25 и iPhone 16 Pro, MobileMoE-S в условиях сопоставимой памяти весов INT4 показал ускорение фазы ввода в 1.8-3.8 раза и ускорение генерации по токенам в 2.2-3.4 раза по сравнению с MobileLLM-Pro. Пиковое использование памяти (RSS) на Galaxy S25 у MobileMoE-S было ниже (1.49 ГБ против 1.91 ГБ).

QКакие ограничения и будущие направления исследований упоминаются в статье?

AТекущие ограничения включают отставание в способностях следовать сложным инструкциям и в знаниях/рассуждениях по сравнению с Qwen3.5 2B. Для улучшения необходимы более совершенное последующее обучение, дистилляция и мультимодальное расширение. Также отмечается, что использование памяти MoE на телефоне чувствительно к входным данным, поэтому для точной оценки требуются тесты на реальных данных. Будущие направления: исследование маршрутизации на NPU, динамическая маршрутизация, обрезка экспертов, смешанная точность квантования и оптимизация для мобильных NPU.

Похожее

ПОСЛЕДНИЕ НОВОСТИ: Дональд Трамп сделал резкое заявление по поводу Ирана! Он остановил атаки

Президент США Дональд Трамп заявил о приостановке запланированных масштабных военных действий против Ирана. Это решение было принято после обращения к нему Саудовской Аравии, ОАЭ, Катара и самого Ирана с просьбой предоставить время для дипломатических переговоров. Союзники в регионе полагают, что соглашение близко. Первоначальный этап переговоров будет сосредоточен на вопросах безопасности и возобновлении нормальной работы Ормузского пролива — ключевого маршрута для мировой нефтеторговли, чья безопасность критически важна для глобальных цен на энергоносители. После решения этих вопросов планируется начать переговоры по иранской ядерной программе. Новый раунд переговоров с Ираном начнётся завтра. В своём выступлении Трамп также коснулся темы валютного рынка, заявив, что США вмешались в поддержку японской иены, подчеркнув крепкие союзнические и взаимовыгодные экономические отношения с Японией.

cryptonews.ru1 ч. назад

ПОСЛЕДНИЕ НОВОСТИ: Дональд Трамп сделал резкое заявление по поводу Ирана! Он остановил атаки

cryptonews.ru1 ч. назад

Банк Италии не увидел системных преимуществ стейблкоинов в переводах

Исследование Банка Италии показало, что стейблкоины (на примере USDC) не демонстрируют устойчивых системных преимуществ в стоимости и скорости международных денежных переводов по сравнению с традиционными сервисами. Анализ транзакций на 200 USDC в 10 платежных коридорах (Италия — Бразилия, Аргентина, Япония, ОАЭ, ЮАР и др.) выявил, что финальная стоимость переводов варьировалась от 0,3% до почти 9%. Сроки исполнения колебались от менее 20 минут в коридорах с инфраструктурой мгновенных платежей до 1-2 рабочих дней в ее отсутствие. Ключевые издержки и задержки связаны не с комиссиями блокчейна, а с процессами конвертации в фиатные валюты и работой локальных платежных систем. Хотя в большинстве изучных направлений стоимость переводов со стейблкоинами была ниже среднемирового показателя в 6,65%, по сравнению с сервисом Wise преимущество наблюдалось только в трех из семи сопоставимых случаев. Авторы отмечают, что преимущества стейблкоинов могли бы быть более заметны, если бы их можно было напрямую тратить без конвертации. Также подчеркивается, что запретительное регулирование не устраняет спрос на стейблкоины, а излишне жесткие правила лишь усложняют их использование для розничных клиентов. В контексте исследования упоминается значительное снижение общей капитализации рынка стейблкоинов в июле.

cryptonews.ru2 ч. назад

Банк Италии не увидел системных преимуществ стейблкоинов в переводах

cryptonews.ru2 ч. назад

«Биткойн-бум» в разгаре: новое заявление Сэйлора вызвало спекуляции о покупках

Исполнительный председатель MicroStrategy Майкл Сэйлор 2 августа опубликовал сообщение «Bitcoin Drive engaged», что вызвало спекуляции о новой покупке биткойнов компанией. Его отчет показал, что резерв MicroStrategy составляет 843 775 BTC стоимостью около $53,25 млрд, со средней себестоимостью $75 653 и нереализованным убытком в $10,58 млрд. Ранее аналогичный сигнал предшествовал объявлению о пополнении долларового резерва. В то же время, реестр компании отразил две недавние продажи на общую сумму 3 588 BTC, сократив запасы. Эти продажи, согласно документам SEC, были проведены для финансирования выплат по привилегированным акциям. Неделей ранее компания не покупала биткойны, увеличив свой долларовый резерв примерно до $3,75 млрд. Финансовые риски остаются высокими после отчетности об операционном убытке в $8,33 млрд за второй квартал 2026 года. Ожидается, что обновление данных в понедельник покажет, означает ли сообщение Сэйлора возврат к накоплению биткойнов, поскольку компания балансирует между своими крупными запасами криптовалюты и растущими денежными обязательствами.

cryptonews.ru2 ч. назад

«Биткойн-бум» в разгаре: новое заявление Сэйлора вызвало спекуляции о покупках

cryptonews.ru2 ч. назад

Паттерн на графике биткоина «голоса и плечи» сулит подъём к $67,200

Несмотря на медленное снижение в начале августа, на графике биткоина формируется перевёрнутая разворотная модель «голова и плечи». Цена $BTC колеблется около $63,200, формируя правое плечо, что является основным поводом для краткосрочного оптимизма. Ключевой вопрос — хватит ли покупателям сил для рывка к уровню $67,200 для подтверждения разворота. В то же время в паре ETH/BTC уже пробито разворотное дно. Ethereum демонстрирует относительную силу, закрепился в восходящем тренде и движется к цели 0,0312, а против доллара тестирует уровень $1875, открывая путь к $2163. Эта ротация капитала в пользу ETH лишает биткоин объёма, необходимого для быстрого роста. Таким образом, ситуация для биткоина остаётся напряжённой: либо он в ближайшие дни последует примеру Ethereum и осуществит быстрый рост выше $67,200, либо, если атака на «шею» паттерна не состоится, медведи возьмут контроль и отправят цену к уровням поддержки $60,000 и $58,000.

cryptonews.ru2 ч. назад

Паттерн на графике биткоина «голоса и плечи» сулит подъём к $67,200

cryptonews.ru2 ч. назад

Акции компаний, занимающихся искусственным интеллектом, торгуются как «мемокоины», в то время как биткоин практически не меняет цены — обзор недели

В еженедельном обзоре рассматривается волатильность на рынках, вызванная распродажей в секторе ИИ и проблемами крупного хедж-фонда «Situational Awareness», что привело к значительным падениям на азиатских фондовых рынках. Акцентируется внимание на макроэкономических факторах, включая политику ФРС и интервенции Банка Японии. В криптосфере обсуждаются закрытие бирж BitMart и банкротство Storj Labs, трудности компаний вроде Coinbase, а также действия MicroStrategy по наращиванию резервов. Поднимаются темы инсайдерской торговли на Hyperliquid и отключения малопопулярных активов в Aave. Отдельно выделяется энтузиазм венчурных инвесторов вокруг Bittensor ($TAO). Завершается обзор серьёзным предупреждением об уязвимости аппаратных кошельков Coldcard, призывая пользователей к немедленным действиям и повышенной бдительности при самохранении активов.

cryptonews.ru2 ч. назад

Акции компаний, занимающихся искусственным интеллектом, торгуются как «мемокоины», в то время как биткоин практически не меняет цены — обзор недели

cryptonews.ru2 ч. назад

Торговля

Спот
活动图片