# Сопутствующие статьи по теме Квантование

Новостной центр HTX предлагает последние статьи и углубленный анализ по "Квантование", охватывающие рыночные тренды, новости проектов, развитие технологий и политику регулирования в криптоиндустрии.

На Reddit взорвался вирусный график: через 2 года Fable 5 будет работать на вашем ноутбуке

Красочное обсуждение в сообществе r/LocalLLaMA породило прогноз: возможности искусственного интеллекта уровня Fable 5, сопоставимые с будущими топовыми моделями вроде Mythos, могут стать доступны для локального запуска на мощных ноутбуках примерно к июлю 2028 года. Этот вывод основан на анализе тенденций: с момента появления таких флагманских моделей, как GPT-3, GPT-4 и Claude 3.5 Sonnet, до появления их эффективных открытых аналогов, работающих на потребительском оборудовании, в среднем проходит около 24 месяцев. Так, модель Gemma 4 на 31 млрд параметров уже демонстрирует результаты, близкие к Claude 3.5 Sonnet. Прогресс в архитектурах (например, MoE), методах сжатия моделей (квантование) и их оптимизации ускоряет этот процесс. Это означает движение к децентрализации ИИ: через два года передовые возможности, сегодня доступные по подписке в облаке и регулируемые, могут работать локально — без интернета, с полной приватностью данных и за разовую стоимость оборудования. Таким образом, ограничения доступа к самым мощным моделям могут быть временными, поскольку технологии демократизируются.

marsbit07/07 07:31

На Reddit взорвался вирусный график: через 2 года Fable 5 будет работать на вашем ноутбуке

marsbit07/07 07:31

Запуск MoE на смартфоне? Meta предлагает MobileMoE, ускорение на iPhone 16 Pro до 3.8 раза

Мета представила MobileMoE — первую эффективную реализацию модели смешанных экспертов (MoE) для инференса на коммерческих смартфонах. Традиционно MoE использовались в облачных больших языковых моделях (LLM), тогда как на мобильных устройствах применялись плотные архитектуры из-за ограничений памяти и вычислительных ресурсов. MobileMoE заменяет плотные слои в Transformer на MoE-слои. Маршрутизатор выбирает для каждого токена несколько наиболее релевантных экспертов, при этом один общий эксперт участвует в вычислениях всегда. Обучение модели включает четыре этапа: предварительное обучение, промежуточное обучение, контролируемое тонкое обучение (SFT) и обучение с учётом квантизации. Результаты показывают, что MobileMoE-S/M при сопоставимом использовании памяти требует в 2–4 раза меньше вычислений, чем плотные базовые модели, достигая аналогичной или более высокой точности в 14 базовых тестах. На iPhone 16 Pro инференс ускорился до 3,8 раз на этапе ввода и до 3,4 раз на этапе генерации. После квантизации до INT4 модель сохраняет конкурентоспособность, а пиковое использование памяти на Samsung Galaxy S25 ниже, чем у аналогов. Несмотря на преимущества в коде и математике, MobileMoE пока уступает Qwen3.5 2B в следовании инструкциям и сложных рассуждениях. Для дальнейшего улучшения необходимы дистилляция, постобучение и мультимодальное расширение. Также требуются исследования для оптимизации памяти при изменяющихся входных данных и использования NPU на мобильных устройствах.

marsbit06/01 06:10

Запуск MoE на смартфоне? Meta предлагает MobileMoE, ускорение на iPhone 16 Pro до 3.8 раза

marsbit06/01 06:10

Новая статья AMD меняет представления: нестабильность обучения с FP4 вызвана не недостатком случайности

Новый документ AMD меняет представления: нестабильность обучения в формате FP4 вызвана не недостатком случайности, а накоплением структурных ошибок микромасштабирования. Исследователи AMD и Университета Пенсильвании провели полное предобучение модели Llama 3.1-8B на аппаратном обеспечении AMD Instinct MI355X, поддерживающем FP4, используя формат MXFP4 (Microscaling). Ключевой вывод: основная причина нестабильности при обучении с FP4 — не недостаток случайности, как считалось ранее, а структурные ошибки квантования, которые накапливаются и усиливаются, особенно на критическом пути градиента весов (Wgrad). Эксперименты показали, что замена операций прямого распространения (Fprop) и градиента активации (Dgrad) на MXFP4 незначительно влияет на сходимость. Однако квантование градиента весов (Wgrad) до 4 бит приводит к значительному ухудшению. Стратегии, добавляющие случайность (стохастическое округление, рандомизированное преобразование Адамара), не стабилизируют процесс, а усугубляют его. Напротив, **детерминированное преобразование Адамара** устраняет нестабильность, обеспечивая согласованный шаблон ошибок на каждом шаге. С использованием детерминированного преобразования Адамара и полного конвейера MXFP4, обучение завершилось всего на 8-9% большим числом токенов по сравнению с базовым FP8, при этом производительность на шаг выросла на 20%. Итоговое ускорение от начала до конца составило 9-10%. Работа имеет важное значение: 1) Даёт чёткий диагноз проблемы структурных ошибок. 2) Делает FP4 пригодным не только для вывода, но и для обучения, потенциально удваивая эффективную производительность аппаратного обеспечения. 3) Основана на открытом стандарте OCP Microscaling, обеспечивая переносимость между разными аппаратными платформами.

marsbit05/27 06:21

Новая статья AMD меняет представления: нестабильность обучения с FP4 вызвана не недостатком случайности

marsbit05/27 06:21

活动图片