В последние годы модели смешанных экспертов (MoE) широко используются в облачных больших моделях. Но на стороне мобильных устройств большие языковые модели (LLM) по-прежнему в основном имеют плотную архитектуру. Раньше ограничения памяти, вычислительной мощности и задержек на мобильных устройствах были более строгими, и систематические исследования MoE для мобильных устройств в диапазоне до миллиарда активных параметров отсутствовали. Теперь, с увеличением объема DRAM на мобильных устройствах, MoE также получили возможность развертывания на смартфонах.
Предложенная командой Meta модель MobileMoE впервые реализует эффективный вывод MoE на коммерческих смартфонах. Результаты показывают, что в 14 базовых тестах MobileMoE-S/M при сопоставимом объеме памяти, используя лишь от 1/2 до 1/4 объема вычислений для вывода по сравнению с плотным базовым уровнем, достигает сравнимой или даже более высокой средней точности. В реальных тестах MobileMoE-S на GPU/MLX бэкенде iPhone 16 Pro показала наиболее заметное ускорение, максимальное ускорение на этапе ввода достигает 3.8 раза.

Ссылка на статью: https://arxiv.org/abs/2605.27358
Исследовательская группа также предложила набор правил масштабирования MoE для мобильных устройств, чтобы определить более подходящую для развертывания на смартфонах архитектуру модели. MobileMoE устанавливает новый Парето-фронт для мобильных больших языковых моделей, достигая лучших результатов в компромиссе между точностью и вычислительными затратами на вывод.

Рис. | MobileMoE устанавливает новый Парето-фронт для мобильных больших языковых моделей.
Как спроектирована MobileMoE?
MobileMoE можно понять так: это класс языковых моделей MoE, разработанных для развертывания на мобильных устройствах. В целом это все еще трансформер только с декодером (decoder-only Transformer), но исходный плотный слой прямого распространения заменен на слой MoE. Маршрутизатор для каждого токена выбирает небольшое число экспертов с наивысшими баллами для участия в вычислениях, также есть общий эксперт, который всегда участвует в вычислениях. Весь процесс обучения состоит из четырех шагов: предобучение, промежуточное обучение, контролируемое тонкое настройка и обучение с учетом квантования.
Предобучение: Исследовательская группа провела предобучение на примерно 6 трлн токенов данных с открытой лицензией при длине контекста 2048, данные в основном из Интернета, а также охватывают области математики, кода, знаний и науки.
Промежуточное обучение: Исследовательская группа расширила длину контекста до 8192 и дополнительно увеличила долю высококачественных данных в области знаний, кода, математики и науки, общий объем составил около 500 млрд токенов.
Контролируемое тонкое настройка (SFT): Исследовательская группа провела тонкую настройку MobileMoE-Base на более чем 80 миллионах образцов данных с открытой лицензией для инструктивного тонкого настройки.
Обучение с учетом квантования: Исследовательская группа квантовала линейные слои и эмбеддинги до INT4, динамически квантовала активации до INT8, а маршрутизатор сохранила точность FP32.

Рис. | Четыре этапа обучения MobileMoE.
Результаты экспериментов
Результаты анализа влияния (абляции)
Исследовательская группа сначала сравнила три архитектурные переменные: количество экспертов E, гранулярность экспертов g и наличие общего эксперта.

Рис. | Масштабирование количества экспертов E.
При фиксированном бюджете памяти, когда память превышает примерно 0.25 ГБ, потери MoE начинают быть ниже, чем у соответствующей плотной модели. Продолжая увеличивать количество экспертов E, потери продолжают снижаться, но когда E увеличивается до 8, предельная выгода уже заметно ослабевает. Эксперименты с гранулярностью экспертов g показали, что более мелкозернистая конфигурация экспертов в целом лучше, где g=8 обеспечивает хороший баланс между эффективностью и затратами на обучение; когда g увеличивается с 8 до 16, улучшение потерь составляет менее 0.01, но время обучения увеличивается примерно на 50%. При том же вычислительном бюджете добавление общего эксперта дополнительно снижает потери модели.
На основе результатов анализа влияния исследовательская группа в итоге приняла конфигурацию с E=8, g=8 и общим экспертом, то есть 60 экспертов с мелкозернистой маршрутизацией, топ-4 маршрутизацией и 1 общим экспертом, и использовала эту структуру для трех версий: MobileMoE-S/M/L.

Рис. | Масштабирование моделей MoE в условиях вычислительной оптимальности.

Рис. | Эффективность обучения архитектуры MoE.
14 базовых оценок: установление нового Парето-фронта для мобильных устройств
Исследовательская группа в пяти категориях — здравый смысл и рассуждения, знания, наука, чтение и рассуждения — всего 14 базовых оценках, провела повторную оценку MobileMoE вместе с моделями Gemma 3, SmolLM2, Qwen3.5, OLMo 2, OLMoE-1B-7B в единых условиях.

Рис. | Траектория предобучения MobileMoE.
Результаты сравнения базовых моделей показывают, что средний балл MobileMoE-M выше, чем у Qwen3.5 2B, средний балл MobileMoE-L выше, чем у OLMoE-1B-7B, при этом требуемый размер модели также меньше; исследовательская группа также отмечает, что средний балл базовой версии MobileMoE-L уже выше, чем у инструктивной версии OLMoE-1B-7B. По объему обучения MobileMoE использует около 6 трлн токенов предобучения, что меньше, чем 9 трлн у Llama 3.2 1B и 11 трлн у SmolLM2 1.7B. В общем сравнении моделей после инструктивного тонкого настройки средняя точность MobileMoE-M уже близка к OLMoE-1B-7B, но активные параметры и общее количество параметров меньше примерно на 60%.

Рис. | Сравнение базовых моделей MobileMoE-Base.
Расширенные оценки: преимущества более заметны в задачах кода и математики
В расширенных оценках после инструктивного тонкого настройки MobileMoE показывает более выдающиеся результаты в задачах кода и математики. Например, MobileMoE-L в обеих категориях оценок — код и математика — имеет средний балл выше, чем у Qwen3.5 2B и OLMoE-1B-7B. Однако исследовательская группа также отмечает, что в способностях следования инструкциям и рассуждений на основе знаний Qwen3.5 2B все еще сильнее.

Рис. | Сравнение инструктивных моделей на расширенных тестах.
Квантование и развертывание на устройствах: сохраняет конкурентоспособность после INT4, заметное ускорение на смартфонах
После квантования общий средний балл MobileMoE-S/M/L по сравнению с их версиями BF16 снизился, но снижение примерно составляет от 2 до 3 баллов. Тем не менее, производительность INT4 версии MobileMoE-L все еще выше, чем у инструктивной версии OLMoE-1B-7B в BF16.
Исследовательская группа также развернула MobileMoE на Samsung Galaxy S25 и iPhone 16 Pro для тестирования. Результаты показывают, что при сопоставимых условиях памяти для INT4 весов, MobileMoE-S по сравнению с MobileLLM-Pro ускоряет этап ввода в 1.8-3.8 раза, этап генерации по токенам — в 2.2-3.4 раза.
Что касается потребления памяти, на Samsung Galaxy S25 при длине контекста 8K и реальном промпте пиковое значение RSS для MobileMoE-S составило 1.49 ГБ, что ниже 1.91 ГБ у MobileLLM-Pro.

Рис. | Задержка выполнения на устройстве.
Недостатки и направления на будущее
В настоящее время, в более продвинутых способностях следования инструкциям, а также в знаниях и рассуждениях, инструктивно настроенная MobileMoE все еще отстает от Qwen3.5 2B. Исследовательская группа считает, что этот разрыв может быть связан с более совершенным пост-обучением последней. В будущем, чтобы сократить этот разрыв, со стороны обучения потребуется усилить дистилляцию, пост-обучение, ориентированное на рассуждения, а также многомодальное расширение.
Кроме того, исследовательская группа указывает, что потребление памяти MoE на смартфоне меняется в зависимости от входных данных. По сравнению с фиксированным шаблонным вводом, реальный ввод обычно приводит к более высокому потреблению памяти. Если тестирование основывается только на шаблонном вводе, это может недооценивать нагрузку на память в реальных сценариях развертывания. В будущем, для более точной оценки реальных характеристик памяти мобильного MoE, все еще потребуются реальные данные тестирования.
Между тем, исследовательская группа уже завершила систематическое тестирование на реальных устройствах для бэкендов CPU и GPU, но путь NPU еще предстоит изучить. В то же время, потребление памяти во время выполнения MoE довольно чувствительно к входным данным. В будущем, динамическая маршрутизация, обрезка экспертов, смешанное квантование по точности, а также развертывание на мобильных NPU — все это направления для дальнейшего повышения эффективности на устройствах.
Более подробную техническую информацию см. в исходной статье.
Эта статья взята из официального аккаунта WeChat "Академические заголовки" (ID: SciTouTiao), автор: Ся Цяньсы.





