Запуск MoE на смартфоне? Meta предлагает MobileMoE, ускорение на iPhone 16 Pro до 3.8 раза

marsbitОпубликовано 2026-06-01Обновлено 2026-06-01

Введение

Мета представила MobileMoE — первую эффективную реализацию модели смешанных экспертов (MoE) для инференса на коммерческих смартфонах. Традиционно MoE использовались в облачных больших языковых моделях (LLM), тогда как на мобильных устройствах применялись плотные архитектуры из-за ограничений памяти и вычислительных ресурсов. MobileMoE заменяет плотные слои в Transformer на MoE-слои. Маршрутизатор выбирает для каждого токена несколько наиболее релевантных экспертов, при этом один общий эксперт участвует в вычислениях всегда. Обучение модели включает четыре этапа: предварительное обучение, промежуточное обучение, контролируемое тонкое обучение (SFT) и обучение с учётом квантизации. Результаты показывают, что MobileMoE-S/M при сопоставимом использовании памяти требует в 2–4 раза меньше вычислений, чем плотные базовые модели, достигая аналогичной или более высокой точности в 14 базовых тестах. На iPhone 16 Pro инференс ускорился до 3,8 раз на этапе ввода и до 3,4 раз на этапе генерации. После квантизации до INT4 модель сохраняет конкурентоспособность, а пиковое использование памяти на Samsung Galaxy S25 ниже, чем у аналогов. Несмотря на преимущества в коде и математике, MobileMoE пока уступает Qwen3.5 2B в следовании инструкциям и сложных рассуждениях. Для дальнейшего улучшения необходимы дистилляция, постобучение и мультимодальное расширение. Также требуются исследования для оптимизации памяти при изменяющихся входных данных и использования NPU на мобильных устройствах.

В последние годы модели смешанных экспертов (MoE) широко используются в облачных больших моделях. Но на стороне мобильных устройств большие языковые модели (LLM) по-прежнему в основном имеют плотную архитектуру. Раньше ограничения памяти, вычислительной мощности и задержек на мобильных устройствах были более строгими, и систематические исследования MoE для мобильных устройств в диапазоне до миллиарда активных параметров отсутствовали. Теперь, с увеличением объема DRAM на мобильных устройствах, MoE также получили возможность развертывания на смартфонах.

Предложенная командой Meta модель MobileMoE впервые реализует эффективный вывод MoE на коммерческих смартфонах. Результаты показывают, что в 14 базовых тестах MobileMoE-S/M при сопоставимом объеме памяти, используя лишь от 1/2 до 1/4 объема вычислений для вывода по сравнению с плотным базовым уровнем, достигает сравнимой или даже более высокой средней точности. В реальных тестах MobileMoE-S на GPU/MLX бэкенде iPhone 16 Pro показала наиболее заметное ускорение, максимальное ускорение на этапе ввода достигает 3.8 раза.

Ссылка на статью: https://arxiv.org/abs/2605.27358

Исследовательская группа также предложила набор правил масштабирования MoE для мобильных устройств, чтобы определить более подходящую для развертывания на смартфонах архитектуру модели. MobileMoE устанавливает новый Парето-фронт для мобильных больших языковых моделей, достигая лучших результатов в компромиссе между точностью и вычислительными затратами на вывод.

Рис. | MobileMoE устанавливает новый Парето-фронт для мобильных больших языковых моделей.

Как спроектирована MobileMoE?

MobileMoE можно понять так: это класс языковых моделей MoE, разработанных для развертывания на мобильных устройствах. В целом это все еще трансформер только с декодером (decoder-only Transformer), но исходный плотный слой прямого распространения заменен на слой MoE. Маршрутизатор для каждого токена выбирает небольшое число экспертов с наивысшими баллами для участия в вычислениях, также есть общий эксперт, который всегда участвует в вычислениях. Весь процесс обучения состоит из четырех шагов: предобучение, промежуточное обучение, контролируемое тонкое настройка и обучение с учетом квантования.

Предобучение: Исследовательская группа провела предобучение на примерно 6 трлн токенов данных с открытой лицензией при длине контекста 2048, данные в основном из Интернета, а также охватывают области математики, кода, знаний и науки.

Промежуточное обучение: Исследовательская группа расширила длину контекста до 8192 и дополнительно увеличила долю высококачественных данных в области знаний, кода, математики и науки, общий объем составил около 500 млрд токенов.

Контролируемое тонкое настройка (SFT): Исследовательская группа провела тонкую настройку MobileMoE-Base на более чем 80 миллионах образцов данных с открытой лицензией для инструктивного тонкого настройки.

Обучение с учетом квантования: Исследовательская группа квантовала линейные слои и эмбеддинги до INT4, динамически квантовала активации до INT8, а маршрутизатор сохранила точность FP32.

Рис. | Четыре этапа обучения MobileMoE.

Результаты экспериментов

Результаты анализа влияния (абляции)

Исследовательская группа сначала сравнила три архитектурные переменные: количество экспертов E, гранулярность экспертов g и наличие общего эксперта.

Рис. | Масштабирование количества экспертов E.

При фиксированном бюджете памяти, когда память превышает примерно 0.25 ГБ, потери MoE начинают быть ниже, чем у соответствующей плотной модели. Продолжая увеличивать количество экспертов E, потери продолжают снижаться, но когда E увеличивается до 8, предельная выгода уже заметно ослабевает. Эксперименты с гранулярностью экспертов g показали, что более мелкозернистая конфигурация экспертов в целом лучше, где g=8 обеспечивает хороший баланс между эффективностью и затратами на обучение; когда g увеличивается с 8 до 16, улучшение потерь составляет менее 0.01, но время обучения увеличивается примерно на 50%. При том же вычислительном бюджете добавление общего эксперта дополнительно снижает потери модели.

На основе результатов анализа влияния исследовательская группа в итоге приняла конфигурацию с E=8, g=8 и общим экспертом, то есть 60 экспертов с мелкозернистой маршрутизацией, топ-4 маршрутизацией и 1 общим экспертом, и использовала эту структуру для трех версий: MobileMoE-S/M/L.

Рис. | Масштабирование моделей MoE в условиях вычислительной оптимальности.

Рис. | Эффективность обучения архитектуры MoE.

14 базовых оценок: установление нового Парето-фронта для мобильных устройств

Исследовательская группа в пяти категориях — здравый смысл и рассуждения, знания, наука, чтение и рассуждения — всего 14 базовых оценках, провела повторную оценку MobileMoE вместе с моделями Gemma 3, SmolLM2, Qwen3.5, OLMo 2, OLMoE-1B-7B в единых условиях.

Рис. | Траектория предобучения MobileMoE.

Результаты сравнения базовых моделей показывают, что средний балл MobileMoE-M выше, чем у Qwen3.5 2B, средний балл MobileMoE-L выше, чем у OLMoE-1B-7B, при этом требуемый размер модели также меньше; исследовательская группа также отмечает, что средний балл базовой версии MobileMoE-L уже выше, чем у инструктивной версии OLMoE-1B-7B. По объему обучения MobileMoE использует около 6 трлн токенов предобучения, что меньше, чем 9 трлн у Llama 3.2 1B и 11 трлн у SmolLM2 1.7B. В общем сравнении моделей после инструктивного тонкого настройки средняя точность MobileMoE-M уже близка к OLMoE-1B-7B, но активные параметры и общее количество параметров меньше примерно на 60%.

Рис. | Сравнение базовых моделей MobileMoE-Base.

Расширенные оценки: преимущества более заметны в задачах кода и математики

В расширенных оценках после инструктивного тонкого настройки MobileMoE показывает более выдающиеся результаты в задачах кода и математики. Например, MobileMoE-L в обеих категориях оценок — код и математика — имеет средний балл выше, чем у Qwen3.5 2B и OLMoE-1B-7B. Однако исследовательская группа также отмечает, что в способностях следования инструкциям и рассуждений на основе знаний Qwen3.5 2B все еще сильнее.

Рис. | Сравнение инструктивных моделей на расширенных тестах.

Квантование и развертывание на устройствах: сохраняет конкурентоспособность после INT4, заметное ускорение на смартфонах

После квантования общий средний балл MobileMoE-S/M/L по сравнению с их версиями BF16 снизился, но снижение примерно составляет от 2 до 3 баллов. Тем не менее, производительность INT4 версии MobileMoE-L все еще выше, чем у инструктивной версии OLMoE-1B-7B в BF16.

Исследовательская группа также развернула MobileMoE на Samsung Galaxy S25 и iPhone 16 Pro для тестирования. Результаты показывают, что при сопоставимых условиях памяти для INT4 весов, MobileMoE-S по сравнению с MobileLLM-Pro ускоряет этап ввода в 1.8-3.8 раза, этап генерации по токенам — в 2.2-3.4 раза.

Что касается потребления памяти, на Samsung Galaxy S25 при длине контекста 8K и реальном промпте пиковое значение RSS для MobileMoE-S составило 1.49 ГБ, что ниже 1.91 ГБ у MobileLLM-Pro.

Рис. | Задержка выполнения на устройстве.

Недостатки и направления на будущее

В настоящее время, в более продвинутых способностях следования инструкциям, а также в знаниях и рассуждениях, инструктивно настроенная MobileMoE все еще отстает от Qwen3.5 2B. Исследовательская группа считает, что этот разрыв может быть связан с более совершенным пост-обучением последней. В будущем, чтобы сократить этот разрыв, со стороны обучения потребуется усилить дистилляцию, пост-обучение, ориентированное на рассуждения, а также многомодальное расширение.

Кроме того, исследовательская группа указывает, что потребление памяти MoE на смартфоне меняется в зависимости от входных данных. По сравнению с фиксированным шаблонным вводом, реальный ввод обычно приводит к более высокому потреблению памяти. Если тестирование основывается только на шаблонном вводе, это может недооценивать нагрузку на память в реальных сценариях развертывания. В будущем, для более точной оценки реальных характеристик памяти мобильного MoE, все еще потребуются реальные данные тестирования.

Между тем, исследовательская группа уже завершила систематическое тестирование на реальных устройствах для бэкендов CPU и GPU, но путь NPU еще предстоит изучить. В то же время, потребление памяти во время выполнения MoE довольно чувствительно к входным данным. В будущем, динамическая маршрутизация, обрезка экспертов, смешанное квантование по точности, а также развертывание на мобильных NPU — все это направления для дальнейшего повышения эффективности на устройствах.

Более подробную техническую информацию см. в исходной статье.

Эта статья взята из официального аккаунта WeChat "Академические заголовки" (ID: SciTouTiao), автор: Ся Цяньсы.

Связанные с этим вопросы

QЧто такое MobileMoE и какое основное достижение представила команда Meta?

AMobileMoE — это тип моделей языка на основе смеси экспертов (MoE), разработанный для развертывания на мобильных устройствах. Исследовательская группа Meta впервые реализовала эффективный вывод MoE на коммерческих смартфонах. Основное достижение заключается в том, что MobileMoE-S/M при схожем объеме памяти использует всего от 1/2 до 1/4 вычислительных затрат на вывод по сравнению с плотными базовыми моделями, достигая сопоставимой или более высокой средней точности в 14 базовых тестах. На iPhone 16 Pro скорость ввода увеличилась до 3.8 раза.

QКакой подход к обучению использовался для MobileMoE?

AОбучение MobileMoE состояло из четырех этапов: 1) Предварительное обучение на примерно 6 триллионах токенов с контекстом 2048, 2) Среднесрочное обучение с расширением контекста до 8192 и увеличением доли высококачественных данных (около 500 миллиардов токенов), 3) Контролируемая тонкая настройка (SFT) на более чем 80 миллионах образцов, 4) Квантованное обучение с осознанием: линейные слои и эмбеддинги квантовались до INT4, активации — до INT8, а маршрутизатор сохранял точность FP32.

QКаковы были результаты абляционных исследований по архитектуре MobileMoE?

AАбляционные исследования показали, что при фиксированном бюджете памяти MoE начинает превосходить плотные модели, когда память превышает примерно 0.25 ГБ. Оптимальной конфигурацией стали 8 экспертов (E=8) и гранулярность эксперта 8 (g=8) с добавлением одного общего эксперта. Это обеспечило хороший баланс между качеством и вычислительными затратами. Использование общего эксперта при одинаковом вычислительном бюджете дополнительно снизило потери модели.

QНасколько эффективен MobileMoE после квантования и в мобильном развертывании?

AПосле квантования до INT4 модели MobileMoE-S/M/L показали снижение среднего балла примерно на 2-3 пункта по сравнению с версиями BF16, но MobileMoE-L в INT4 все равно превзошел модель OLMoE-1B-7B Instruct в BF16. При развертывании на Samsung Galaxy S25 и iPhone 16 Pro, MobileMoE-S в условиях сопоставимой памяти весов INT4 показал ускорение фазы ввода в 1.8-3.8 раза и ускорение генерации по токенам в 2.2-3.4 раза по сравнению с MobileLLM-Pro. Пиковое использование памяти (RSS) на Galaxy S25 у MobileMoE-S было ниже (1.49 ГБ против 1.91 ГБ).

QКакие ограничения и будущие направления исследований упоминаются в статье?

AТекущие ограничения включают отставание в способностях следовать сложным инструкциям и в знаниях/рассуждениях по сравнению с Qwen3.5 2B. Для улучшения необходимы более совершенное последующее обучение, дистилляция и мультимодальное расширение. Также отмечается, что использование памяти MoE на телефоне чувствительно к входным данным, поэтому для точной оценки требуются тесты на реальных данных. Будущие направления: исследование маршрутизации на NPU, динамическая маршрутизация, обрезка экспертов, смешанная точность квантования и оптимизация для мобильных NPU.

Похожее

Паркер Льюис ответил, почему биткоин остаётся лучшими деньгами

Известный биткоин-аналитик Паркер Льюис раскритиковал стратегии публичных компаний, позиционирующих себя как криптовалютные казначейства. Он заявил, что продажа ими «цифрового кредита» в виде бессрочных привилегированных акций искажает суть биткоина, который не генерирует фиатный доход на алгоритмическом уровне. Льюис подчеркнул, что выплата дивидендов в этой модели часто зависит от притока новых инвесторов, что несёт высокие риски, наглядно демонстрируемые скромным размером рынка таких акций ($1 трлн) на фоне глобального кредитного рынка ($300 трлн). Эксперт также опроверг тезис о чрезмерной волатильности биткоина, объяснив её как естественное следствие массового принятия актива с жёстко ограниченным предложением. Он призвал инвесторов покупать биткоины напрямую, а не акции компаний вроде MicroStrategy, что математически безопаснее. Льюис указал на главную угрозу — инфляцию фиатных денег, проиллюстрировав её личным «Индексом рибая», показывающим рост цен на 12–13% годовых. В итоге, наиболее надёжной стратегией защиты сбережений он назвал прямое владение биткоином и контроль над приватными ключами, предостерегая от скрытых рисков погони за корпоративной доходностью через деривативы.

cryptonews.ru3 мин. назад

Паркер Льюис ответил, почему биткоин остаётся лучшими деньгами

cryptonews.ru3 мин. назад

Почему биткоин удерживает $64 000 после жесткой паузы ФРС

Федеральная резервная система США оставила ключевую ставку без изменений, но жесткая риторика и голосование (9 против 3) показали готовность к дальнейшему ужесточению, что ограничивает аппетит к рисковым активам. Несмотря на это, биткоин демонстрирует устойчивость, удерживаясь около уровня $64 000 после волатильной реакции на заявление ФРС. Ключевая поддержка находится в зоне $63 000–63 500, сопротивление — около $66 000. На рынке наблюдается ротация капитала: спотовые Bitcoin-ETF после серии оттоков показали чистый приток в $32,1 млн, тогда как фонды на Ethereum продолжили терять средства. Интерес институциональных инвесторов сместился в сторону биткоина как основного актива, хотя отдельные альткоины, такие как Solana, также привлекают капитал. Рыночная доля Ethereum снижается, несмотря на сильные фундаментальные показатели сети, включая растущую очередь на стейкинг. Законодательная инициатива CLARITY Act была отложена Сенатом США до осени, что снизило рыночные ожидания относительно её принятия в 2026 году. В последний день июля внимание инвесторов будет приковано к макроэкономической статистике из США. Устойчивость биткоина выше $63 000, закрепление Ethereum над $1 860 и продолжение притоков в ETF могут стать сигналами для формирования базы восстановления во второй половине года.

cryptonews.ru3 мин. назад

Почему биткоин удерживает $64 000 после жесткой паузы ФРС

cryptonews.ru3 мин. назад

Компания ARK Invest Кэти Вуд купила 109,129 акций Circle на $6,83 млн

Компания ARK Invest Кэти Вуд приобрела 109 129 акций компании Circle на сумму около 6,83 млн долларов США. Покупка была осуществлена через три ее биржевых фонда: ARK Innovation, ARK Next Generation Internet и ARK Fintech Innovation. Эта сделка произошла вскоре после того, как Circle получила лицензию на доверительное управление от Департамента финансовых услуг штата Нью-Йорк для своей дочерней компании Circle New York Trust. Генеральный директор Circle Джереми Аллер назвал получение лицензии долгосрочной целью компании. Однако, несмотря на это регулирующее одобрение, акции Circle (CRCL) 31 июля снизились на 2,54%, что, вероятно, указывает на сдержанную реакцию инвесторов на данную новость. Параллельно ARK Invest также совершила крупные покупки акций Tesla, SpaceX и Nvidia на общую сумму около 40,2 млн долларов, одновременно сократив свои доли в таких компаниях, как Shopify, Cloudflare и CrowdStrike.

cryptonews.ru5 мин. назад

Компания ARK Invest Кэти Вуд купила 109,129 акций Circle на $6,83 млн

cryptonews.ru5 мин. назад

Арестованы участники мошеннической схемы с XRP, похитившие 9 млн долларов у 71 инвестора

Полиция Сеула арестовала трех участников мошеннической инвестиционной платформы, похитивших примерно 3,4 млн XRP (около 9 млн долларов) у 71 инвестора. Группа продвигала сайт Fxrpntwork.com через блоги и YouTube, обещая гарантированную сохранность вкладов и ежемесячный доход до 1,8%, после чего исчезла с деньгами. Мошенники использовали названия и брендинг легитимных проектов Flare Network и FXRP для создания видимости надежности. Полиция предупреждает инвесторов о необходимости проверять официальные источники и не доверять непроверенной информации в интернете. Дело передано прокуратуре, ведется розыск еще одного подозреваемого за рубежом с помощью Интерпола. В ходе расследования были заморожены активы на крупную сумму и выявлены дополнительные транзакции, что указывает на возможных новых потерпевших и соучастников. Этот случай иллюстрирует распространенность мошеннических схем с гарантированной доходностью в криптосфере.

cryptonews.ru6 мин. назад

Арестованы участники мошеннической схемы с XRP, похитившие 9 млн долларов у 71 инвестора

cryptonews.ru6 мин. назад

Эксперты зафиксировали потенциальную продажу биткоинов Trump Media после миллиардных инвестиций

Аналитики Lookonchain сообщили 2 августа 2026 года, что компания Trump Media & Technology Group (TMTG), вероятно, продала еще 2628 биткоинов на сумму около $165 млн. С начала распродажи семь месяцев назад компания уже реализовала 7281 BTC на $545 млн по средней цене $74 855, что значительно ниже средней цены покупки в $118 522. Общие реализованные и нереализованные убытки от биткоин-портфеля оцениваются примерно в $555 млн. В настоящее время у TMTG остается 9542 BTC стоимостью около $603 млн, что делает ее 14-й крупнейшей публичной компанией по корпоративным резервам биткоина. Нереализованный убыток на оставшиеся активы составляет около $528 млн (46,7%). Продажи продолжаются после масштабных инвестиций компании в биткоин на сумму около $2 млрд, объявленных в июле 2025 года. Рынок криптовалют остается в смешанном состоянии, демонстрируя осторожность инвесторов.

cryptonews.ru7 мин. назад

Эксперты зафиксировали потенциальную продажу биткоинов Trump Media после миллиардных инвестиций

cryptonews.ru7 мин. назад

Торговля

Спот
活动图片