Запуск MoE на смартфоне? Meta предлагает MobileMoE, ускорение на iPhone 16 Pro до 3.8 раза

marsbitОпубликовано 2026-06-01Обновлено 2026-06-01

Введение

Мета представила MobileMoE — первую эффективную реализацию модели смешанных экспертов (MoE) для инференса на коммерческих смартфонах. Традиционно MoE использовались в облачных больших языковых моделях (LLM), тогда как на мобильных устройствах применялись плотные архитектуры из-за ограничений памяти и вычислительных ресурсов. MobileMoE заменяет плотные слои в Transformer на MoE-слои. Маршрутизатор выбирает для каждого токена несколько наиболее релевантных экспертов, при этом один общий эксперт участвует в вычислениях всегда. Обучение модели включает четыре этапа: предварительное обучение, промежуточное обучение, контролируемое тонкое обучение (SFT) и обучение с учётом квантизации. Результаты показывают, что MobileMoE-S/M при сопоставимом использовании памяти требует в 2–4 раза меньше вычислений, чем плотные базовые модели, достигая аналогичной или более высокой точности в 14 базовых тестах. На iPhone 16 Pro инференс ускорился до 3,8 раз на этапе ввода и до 3,4 раз на этапе генерации. После квантизации до INT4 модель сохраняет конкурентоспособность, а пиковое использование памяти на Samsung Galaxy S25 ниже, чем у аналогов. Несмотря на преимущества в коде и математике, MobileMoE пока уступает Qwen3.5 2B в следовании инструкциям и сложных рассуждениях. Для дальнейшего улучшения необходимы дистилляция, постобучение и мультимодальное расширение. Также требуются исследования для оптимизации памяти при изменяющихся входных данных и использования NPU на мобильных устройствах.

В последние годы модели смешанных экспертов (MoE) широко используются в облачных больших моделях. Но на стороне мобильных устройств большие языковые модели (LLM) по-прежнему в основном имеют плотную архитектуру. Раньше ограничения памяти, вычислительной мощности и задержек на мобильных устройствах были более строгими, и систематические исследования MoE для мобильных устройств в диапазоне до миллиарда активных параметров отсутствовали. Теперь, с увеличением объема DRAM на мобильных устройствах, MoE также получили возможность развертывания на смартфонах.

Предложенная командой Meta модель MobileMoE впервые реализует эффективный вывод MoE на коммерческих смартфонах. Результаты показывают, что в 14 базовых тестах MobileMoE-S/M при сопоставимом объеме памяти, используя лишь от 1/2 до 1/4 объема вычислений для вывода по сравнению с плотным базовым уровнем, достигает сравнимой или даже более высокой средней точности. В реальных тестах MobileMoE-S на GPU/MLX бэкенде iPhone 16 Pro показала наиболее заметное ускорение, максимальное ускорение на этапе ввода достигает 3.8 раза.

Ссылка на статью: https://arxiv.org/abs/2605.27358

Исследовательская группа также предложила набор правил масштабирования MoE для мобильных устройств, чтобы определить более подходящую для развертывания на смартфонах архитектуру модели. MobileMoE устанавливает новый Парето-фронт для мобильных больших языковых моделей, достигая лучших результатов в компромиссе между точностью и вычислительными затратами на вывод.

Рис. | MobileMoE устанавливает новый Парето-фронт для мобильных больших языковых моделей.

Как спроектирована MobileMoE?

MobileMoE можно понять так: это класс языковых моделей MoE, разработанных для развертывания на мобильных устройствах. В целом это все еще трансформер только с декодером (decoder-only Transformer), но исходный плотный слой прямого распространения заменен на слой MoE. Маршрутизатор для каждого токена выбирает небольшое число экспертов с наивысшими баллами для участия в вычислениях, также есть общий эксперт, который всегда участвует в вычислениях. Весь процесс обучения состоит из четырех шагов: предобучение, промежуточное обучение, контролируемое тонкое настройка и обучение с учетом квантования.

Предобучение: Исследовательская группа провела предобучение на примерно 6 трлн токенов данных с открытой лицензией при длине контекста 2048, данные в основном из Интернета, а также охватывают области математики, кода, знаний и науки.

Промежуточное обучение: Исследовательская группа расширила длину контекста до 8192 и дополнительно увеличила долю высококачественных данных в области знаний, кода, математики и науки, общий объем составил около 500 млрд токенов.

Контролируемое тонкое настройка (SFT): Исследовательская группа провела тонкую настройку MobileMoE-Base на более чем 80 миллионах образцов данных с открытой лицензией для инструктивного тонкого настройки.

Обучение с учетом квантования: Исследовательская группа квантовала линейные слои и эмбеддинги до INT4, динамически квантовала активации до INT8, а маршрутизатор сохранила точность FP32.

Рис. | Четыре этапа обучения MobileMoE.

Результаты экспериментов

Результаты анализа влияния (абляции)

Исследовательская группа сначала сравнила три архитектурные переменные: количество экспертов E, гранулярность экспертов g и наличие общего эксперта.

Рис. | Масштабирование количества экспертов E.

При фиксированном бюджете памяти, когда память превышает примерно 0.25 ГБ, потери MoE начинают быть ниже, чем у соответствующей плотной модели. Продолжая увеличивать количество экспертов E, потери продолжают снижаться, но когда E увеличивается до 8, предельная выгода уже заметно ослабевает. Эксперименты с гранулярностью экспертов g показали, что более мелкозернистая конфигурация экспертов в целом лучше, где g=8 обеспечивает хороший баланс между эффективностью и затратами на обучение; когда g увеличивается с 8 до 16, улучшение потерь составляет менее 0.01, но время обучения увеличивается примерно на 50%. При том же вычислительном бюджете добавление общего эксперта дополнительно снижает потери модели.

На основе результатов анализа влияния исследовательская группа в итоге приняла конфигурацию с E=8, g=8 и общим экспертом, то есть 60 экспертов с мелкозернистой маршрутизацией, топ-4 маршрутизацией и 1 общим экспертом, и использовала эту структуру для трех версий: MobileMoE-S/M/L.

Рис. | Масштабирование моделей MoE в условиях вычислительной оптимальности.

Рис. | Эффективность обучения архитектуры MoE.

14 базовых оценок: установление нового Парето-фронта для мобильных устройств

Исследовательская группа в пяти категориях — здравый смысл и рассуждения, знания, наука, чтение и рассуждения — всего 14 базовых оценках, провела повторную оценку MobileMoE вместе с моделями Gemma 3, SmolLM2, Qwen3.5, OLMo 2, OLMoE-1B-7B в единых условиях.

Рис. | Траектория предобучения MobileMoE.

Результаты сравнения базовых моделей показывают, что средний балл MobileMoE-M выше, чем у Qwen3.5 2B, средний балл MobileMoE-L выше, чем у OLMoE-1B-7B, при этом требуемый размер модели также меньше; исследовательская группа также отмечает, что средний балл базовой версии MobileMoE-L уже выше, чем у инструктивной версии OLMoE-1B-7B. По объему обучения MobileMoE использует около 6 трлн токенов предобучения, что меньше, чем 9 трлн у Llama 3.2 1B и 11 трлн у SmolLM2 1.7B. В общем сравнении моделей после инструктивного тонкого настройки средняя точность MobileMoE-M уже близка к OLMoE-1B-7B, но активные параметры и общее количество параметров меньше примерно на 60%.

Рис. | Сравнение базовых моделей MobileMoE-Base.

Расширенные оценки: преимущества более заметны в задачах кода и математики

В расширенных оценках после инструктивного тонкого настройки MobileMoE показывает более выдающиеся результаты в задачах кода и математики. Например, MobileMoE-L в обеих категориях оценок — код и математика — имеет средний балл выше, чем у Qwen3.5 2B и OLMoE-1B-7B. Однако исследовательская группа также отмечает, что в способностях следования инструкциям и рассуждений на основе знаний Qwen3.5 2B все еще сильнее.

Рис. | Сравнение инструктивных моделей на расширенных тестах.

Квантование и развертывание на устройствах: сохраняет конкурентоспособность после INT4, заметное ускорение на смартфонах

После квантования общий средний балл MobileMoE-S/M/L по сравнению с их версиями BF16 снизился, но снижение примерно составляет от 2 до 3 баллов. Тем не менее, производительность INT4 версии MobileMoE-L все еще выше, чем у инструктивной версии OLMoE-1B-7B в BF16.

Исследовательская группа также развернула MobileMoE на Samsung Galaxy S25 и iPhone 16 Pro для тестирования. Результаты показывают, что при сопоставимых условиях памяти для INT4 весов, MobileMoE-S по сравнению с MobileLLM-Pro ускоряет этап ввода в 1.8-3.8 раза, этап генерации по токенам — в 2.2-3.4 раза.

Что касается потребления памяти, на Samsung Galaxy S25 при длине контекста 8K и реальном промпте пиковое значение RSS для MobileMoE-S составило 1.49 ГБ, что ниже 1.91 ГБ у MobileLLM-Pro.

Рис. | Задержка выполнения на устройстве.

Недостатки и направления на будущее

В настоящее время, в более продвинутых способностях следования инструкциям, а также в знаниях и рассуждениях, инструктивно настроенная MobileMoE все еще отстает от Qwen3.5 2B. Исследовательская группа считает, что этот разрыв может быть связан с более совершенным пост-обучением последней. В будущем, чтобы сократить этот разрыв, со стороны обучения потребуется усилить дистилляцию, пост-обучение, ориентированное на рассуждения, а также многомодальное расширение.

Кроме того, исследовательская группа указывает, что потребление памяти MoE на смартфоне меняется в зависимости от входных данных. По сравнению с фиксированным шаблонным вводом, реальный ввод обычно приводит к более высокому потреблению памяти. Если тестирование основывается только на шаблонном вводе, это может недооценивать нагрузку на память в реальных сценариях развертывания. В будущем, для более точной оценки реальных характеристик памяти мобильного MoE, все еще потребуются реальные данные тестирования.

Между тем, исследовательская группа уже завершила систематическое тестирование на реальных устройствах для бэкендов CPU и GPU, но путь NPU еще предстоит изучить. В то же время, потребление памяти во время выполнения MoE довольно чувствительно к входным данным. В будущем, динамическая маршрутизация, обрезка экспертов, смешанное квантование по точности, а также развертывание на мобильных NPU — все это направления для дальнейшего повышения эффективности на устройствах.

Более подробную техническую информацию см. в исходной статье.

Эта статья взята из официального аккаунта WeChat "Академические заголовки" (ID: SciTouTiao), автор: Ся Цяньсы.

Связанные с этим вопросы

QЧто такое MobileMoE и какое основное достижение представила команда Meta?

AMobileMoE — это тип моделей языка на основе смеси экспертов (MoE), разработанный для развертывания на мобильных устройствах. Исследовательская группа Meta впервые реализовала эффективный вывод MoE на коммерческих смартфонах. Основное достижение заключается в том, что MobileMoE-S/M при схожем объеме памяти использует всего от 1/2 до 1/4 вычислительных затрат на вывод по сравнению с плотными базовыми моделями, достигая сопоставимой или более высокой средней точности в 14 базовых тестах. На iPhone 16 Pro скорость ввода увеличилась до 3.8 раза.

QКакой подход к обучению использовался для MobileMoE?

AОбучение MobileMoE состояло из четырех этапов: 1) Предварительное обучение на примерно 6 триллионах токенов с контекстом 2048, 2) Среднесрочное обучение с расширением контекста до 8192 и увеличением доли высококачественных данных (около 500 миллиардов токенов), 3) Контролируемая тонкая настройка (SFT) на более чем 80 миллионах образцов, 4) Квантованное обучение с осознанием: линейные слои и эмбеддинги квантовались до INT4, активации — до INT8, а маршрутизатор сохранял точность FP32.

QКаковы были результаты абляционных исследований по архитектуре MobileMoE?

AАбляционные исследования показали, что при фиксированном бюджете памяти MoE начинает превосходить плотные модели, когда память превышает примерно 0.25 ГБ. Оптимальной конфигурацией стали 8 экспертов (E=8) и гранулярность эксперта 8 (g=8) с добавлением одного общего эксперта. Это обеспечило хороший баланс между качеством и вычислительными затратами. Использование общего эксперта при одинаковом вычислительном бюджете дополнительно снизило потери модели.

QНасколько эффективен MobileMoE после квантования и в мобильном развертывании?

AПосле квантования до INT4 модели MobileMoE-S/M/L показали снижение среднего балла примерно на 2-3 пункта по сравнению с версиями BF16, но MobileMoE-L в INT4 все равно превзошел модель OLMoE-1B-7B Instruct в BF16. При развертывании на Samsung Galaxy S25 и iPhone 16 Pro, MobileMoE-S в условиях сопоставимой памяти весов INT4 показал ускорение фазы ввода в 1.8-3.8 раза и ускорение генерации по токенам в 2.2-3.4 раза по сравнению с MobileLLM-Pro. Пиковое использование памяти (RSS) на Galaxy S25 у MobileMoE-S было ниже (1.49 ГБ против 1.91 ГБ).

QКакие ограничения и будущие направления исследований упоминаются в статье?

AТекущие ограничения включают отставание в способностях следовать сложным инструкциям и в знаниях/рассуждениях по сравнению с Qwen3.5 2B. Для улучшения необходимы более совершенное последующее обучение, дистилляция и мультимодальное расширение. Также отмечается, что использование памяти MoE на телефоне чувствительно к входным данным, поэтому для точной оценки требуются тесты на реальных данных. Будущие направления: исследование маршрутизации на NPU, динамическая маршрутизация, обрезка экспертов, смешанная точность квантования и оптимизация для мобильных NPU.

Похожее

После трёх кварталов падения: получится ли у крипторынка стабилизироваться в третьем квартале?

Криптовалютный рынок пережил худший квартал с 2022 года, общая капитализация упала на 12,6% до $2,1 трлн, а дневные объемы торгов снизились на 20,9%. Впервые за три года сократилась и капитализация стейблкоинов. Основные факторы спада — отток средств из биткоин-ETF, распродажа биткоинов корпоративным казначейством Strategy и ужесточение монетарной политики ФРС. Второй квартал завершился чистым оттоком $46,7 млрд из ETF, при этом в июне отток достиг рекордных $45 млрд. Ключевым событием третьего квартала станет заседание ФРС 28–29 июля. Мягкий сигнал может поддержать биткоин в диапазоне $68 000–84 000 и вернуть приток в ETF, тогда как жесткая риторика способна сместить торговый диапазон к $50 000–56 000. Законодательная неопределенность также давит на рынок: прогресс по закону CLARITY Act, определяющему регуляторные границы, замедлился, и вероятность его принятия в 2026 году упала до 40–45%. Несмотря на общий спад, два сегмента показали рост: объемы на рынках предсказаний выросли на 48,7%, а торговля токенизированными коллекционными предметами увеличилась на 143%. Сектор RWA продолжает стабильно развиваться, достигнув $28,1 млрд. Рынок, вероятно, миновал фазу острой распродажи, но для устойчивого восстановления необходимы ясность от ФРС и регуляторный прогресс.

marsbit4 ч. назад

После трёх кварталов падения: получится ли у крипторынка стабилизироваться в третьем квартале?

marsbit4 ч. назад

BIT Торговые часы: BTC по-прежнему под давлением 200 EMA на недельном графике, после отскока возможен перезапуск нисходящего движения; секторы хранения данных и полупроводников, выросшие ночью, начали падение в вечерней сессии

**Краткий обзор рынка: BTC под давлением, коррекция на рынке акций, внимание к данным и событиям** Рынок криптовалют демонстрирует осторожное восстановление. Bitcoin торгуется около $66 000, сталкиваясь со значительным сопротивлением в районе $68 000, где сосредоточены объемные "застрявшие" позиции. Ключевые технические уровни — 200-недельная скользящая средняя (~$63 333) и 200-недельная EMA (~$68 328). Аналитики отмечают низкую ликвидность, характерную для летнего периода. На фондовом рынке после сильного роста во вторник наблюдается коррекция. Фьючерсы на основные индексы США снижаются. Акции полупроводниковой и памяти, которые резко выросли накануне, падают в ночных торгах. Исключением стал SMCI, который вырос более чем на 15% после оптимистичного прогноза. На общий настрой негативно влияют рост цен на нефть (более $91 за баррель Brent) и доходности государственных облигаций США (10-летние — около 4,64%), что возрождает инфляционные опасения. Азиатские рынки показали нестабильную динамику. Индекс KOSPI в Корее вырос на 0,74%, а японский Nikkei 225 снизился на 0,18%. Основной риск для региона — ослабление японской иены до минимумов с 1986 года, что повышает вероятность вмешательства властей. **Ключевые события для наблюдения:** * **24 июля:** Финансовые отчеты Alphabet (Google), Tesla, IBM. Событие AMD, посвященное ИИ. * **25 июля:** Решение по процентной ставке ЕЦБ и пресс-конференция Кристин Лагард. Финансовые отчеты Intel, American Airlines, Honeywell и других. Данные по числу первичных заявок на пособие по безработице в США.

marsbit4 ч. назад

BIT Торговые часы: BTC по-прежнему под давлением 200 EMA на недельном графике, после отскока возможен перезапуск нисходящего движения; секторы хранения данных и полупроводников, выросшие ночью, начали падение в вечерней сессии

marsbit4 ч. назад

Бывший глава CFTC и президент Circle Тарберт: призывает к долгосрочной стратегии, но сам выводит $30 млн

Бывший председатель CFTC и президент Circle Хит Тарберт, публично пропагандируя долгосрочное видение компании для инвесторов на фоне падения акций на 70% с пиковых значений, сам активно распродавал свои акции CRCL. С момента IPO Circle он по плану 10b5-1 продал более 360 тысяч акций, выручив около 30 миллионов долларов, и при этом ни разу не докупал акции на открытом рынке. Эта разница между его публичными заявлениями и личными действиями вызвала критику. Карьера Тарберта демонстрирует классическое использование «вращающейся двери» между регулирующими органами и частным сектором. Уйдя с поста председателя CFTC в 2021 году, через 27 дней он занял должность главного юрисконсульта в маркет-мейкере Citadel Securities, который в тот момент находился под пристальным вниманием из-за скандала с акциями GameStop. Позже, уже работая в Citadel, Тарберт выступал за расширение полномочий CFTC на крипторынок, в то время как его работодатель планировал выход на этот рынок. В 2023 году Тарберт присоединился к Circle, где его опыт и связи сыграли ключевую роль в успешном проведении IPO компании в 2025 году. Однако его последующие массовые продажи акций, совпавшие с падением котировок и его же призывами к долгосрочным инвестициям, ставят под сомнение искренность его уверенности в будущем компании. Критики видят в его карьере образец превращения регуляторного опыта и политических связей в личную выгоду, в то время как риски несут обычные инвесторы, верящие его нарративам.

marsbit4 ч. назад

Бывший глава CFTC и президент Circle Тарберт: призывает к долгосрочной стратегии, но сам выводит $30 млн

marsbit4 ч. назад

Gate Research: Взлет «уолл-стритизации» криптофинансовых продуктов — это конкуренция или интеграция?

**Аналитический обзор Gate Research Institute: Волна "уолл-стритизации" криптофинансовых продуктов — конкуренция или интеграция?** Создание биткоина в 2009 году было ответом на финансовый кризис и стремлением построить децентрализованную систему без доверенных посредников. Однако к 2026 году значительная часть биткоинов (около 7,14%) хранится через ETF таких гигантов, как BlackRock. Это символизирует глубокую интеграцию традиционных финансов (TradFi) и крипторынка. С появлением биткоин-ETF, фьючерсов, RWA (токенизированных реальных активов) и государственных облигаций на блокчейне, традиционные институты получают всё больше влияния на выпуск, ценообразование, кастодию и дистрибуцию криптоактивов. Однако это не одностороннее поглощение, а взаимодополняющая конвергенция. Криптосфера приносит TradFi глобальную 24/7 ликвидность и программируемость, а TradFi предоставляет криптосфере регулируемые каналы, институциональное доверие и массовый доступ. Яркий пример — две противоположные, но ведущие к одной цели траектории: * **Путь А:** Криптобиржи, такие как Gate, начинают с токенизированных акций и CFD, а затем напрямую подключаются к инфраструктуре традиционных брокеров, предлагая реальную торговлю акциями США, Гонконга и Кореи за стейблкоины. * **Путь Б:** Традиционные брокеры, такие как Robinhood, интегрируют криптоактивы, а затем создают собственные Layer 2 для токенизации своих акций, стремясь к круглосуточной торговле. Обе стратегии нацелены на создание **универсального финансового аккаунта будущего** — единой точки доступа к акциям, криптовалютам, ETF, токенизированным облигациям и другим активам. Ключевой конкурентной борьбой становится не между CEX и брокерами, а между этими "супераккаунтами". Параллельно, слой RWA и токенизированных гособлигаций растёт даже на медвежьем рынке, становясь "прослойкой" для объединения капиталов. Хотя этот рынок (около $150 млрд токенизированных казначейских облигаций) ещё мал по сравнению с традиционным ($30 трлн), он демонстрирует устойчивый структурный тренд, привлекающий крупнейшие финансовые институты (JPMorgan, DTCC и др.). **Вывод:** "Уолл-стритизация" — это не поражение идеалов децентрализации, а формирование новой гибридной модели. Децентрализованные протоколы продолжают работать на базовом уровне, в то время как на уровне приложений и пользовательского опыта формируется более эффективный, глобальный и свободный объединённый рынок капитала, где активы TradFi и DeFi торгуются бок о бок в одном интерфейсе. Уолл-стрит не завоевала криптосферу, а криптосфера не обошла Уолл-стрит — они совместно строят новые финансовые рельсы.

marsbit4 ч. назад

Gate Research: Взлет «уолл-стритизации» криптофинансовых продуктов — это конкуренция или интеграция?

marsbit4 ч. назад

S&P Dow Jones и Pantera выпускают криптоиндекс, биткоин оставлен за бортом из-за «отсутствия прибыли»

Стандард энд Пурс (S&P Dow Jones Indices) совместно с Pantera Capital запускает индекс S&P Pantera Digital Asset Index. Новый индекс включает 18 токенов, но исключает биткоин, XRP и мем-токены. Критерием отбора послужила «финансовая жизнеспособность», по аналогии с S&P 500: протокол должен демонстрировать положительный доход в течение нескольких кварталов и распределять стоимость среди держателей токенов. Это первое применение фундаментального подхода к оценке криптоактивов со стороны крупнейшего в мире провайдера индексов. В первую пятерку активов вошли Ethereum (ETH), BNB, Solana (SOL), TRON (TRX) и Hyperliquid (HYPE). Pantera отмечает, что совокупный годовой доход всех протоколов индекса превышает $30 млрд. Биткоин был исключен по трем причинам: он рассматривается как монетарный актив, доступный через отдельные ETF; он не генерирует доход протокола; а смешивание его в индексе с доходными активами затрудняет фундаментальный анализ для институциональных инвесторов. Пока индекс является эталонным, но Pantera ведет переговоры о создании на его основе ETF и других инвестиционных продуктов. Компания также отмечает значительный разрыв на рынке: многие институциональные инвесторы готовы к аллокации в криптоактивы, но им не хватает структурированных продуктов, фокусирующихся на активах с реальной экономической деятельностью.

marsbit4 ч. назад

S&P Dow Jones и Pantera выпускают криптоиндекс, биткоин оставлен за бортом из-за «отсутствия прибыли»

marsbit4 ч. назад

Торговля

Спот
活动图片