# Сопутствующие статьи по теме MLX

Новостной центр HTX предлагает последние статьи и углубленный анализ по "MLX", охватывающие рыночные тренды, новости проектов, развитие технологий и политику регулирования в криптоиндустрии.

DeepSeek переносит новую технологию на чипы Apple, ускоряя локальные большие модели на Mac на 60%

Технология DeepSeek DSpark, недавно представленная для серверных GPU, теперь адаптирована для чипов Apple Silicon в проекте mlx-dspark. Это первая нативная реализация, ускоряющая генерацию текста локальными большими языковыми моделями (LLM) на Mac. Инженер Abdur Rahim перенёс технологию "спекулятивного декодирования" (speculative decoding) в экосистему MLX. Этот метод использует небольшую "черновую" модель для быстрого создания нескольких кандидатов-токенов, которые затем проверяются основной целевой моделью. В результате модели Gemma-4 12B и Qwen3-4B на чипе M4 Pro показывают ускорение генерации примерно в 1.6 и 1.4 раза соответственно (до 30 и 73 токенов в секунду), сохраняя при этом точное соответствие выходным данным исходных моделей. Ключевые особенности реализации: * Поддержка как жадного декодирования, так и стохастической семплирующей генерации с температурой, что обеспечивает высокое качество и разнообразие вывода. * Использование 4-битной квантизации для черновой модели (размер ~1.8 ГБ) и 8-битной — для основной модели для оптимального баланса скорости и точности. * Интеграция альтернативного метода DFlash (от z-lab), который показывает ещё большее ускорение (до ~2.1x) на структурированных задачах, таких как генерация кода и математические вычисления, за счёт параллельного декодирования целых блоков токенов. Таким образом, mlx-dspark предоставляет гибкий инструмент для значительного ускорения работы LLM на устройствах Apple, поддерживая различные сценарии — от чата до программирования.

marsbit07/03 12:23

DeepSeek переносит новую технологию на чипы Apple, ускоряя локальные большие модели на Mac на 60%

marsbit07/03 12:23

Запуск Gemma 4 на iPhone стал вирусным: как далеко эра нулевых токенов?

Новая модель Gemma 4 от Google, основанная на архитектуре Gemini 3, поддерживает нативные мультимодальные возможности и занимает третье место в рейтинге Arena AI. Её компактные версии (E2B и E4B) могут работать локально на смартфонах, таких как iPhone и Samsung Galaxy, с контекстным окном до 128K и скоростью генерации более 40 токенов в секунду. Это открывает возможности для использования в медицине и других чувствительных сферах. Хотя модель демонстрирует высокую производительность в простых задачах, таких как генерация текста и кода, она испытывает трудности с сложными задачами, например, при работе в качестве агента с инструментами и структурированным выводом. Несмотря на некоторые ограничения, появление таких моделей, как Gemma 4, может изменить индустрию ИИ, переместив выполнение повседневных задач на локальные устройства и сократив зависимость от облачных API. В будущем локальные модели могут стать достаточно мощными, чтобы конкурировать с облачными решениями, что приведёт к пересмотру бизнес-моделей в отрасли.

marsbit04/06 05:54

Запуск Gemma 4 на iPhone стал вирусным: как далеко эра нулевых токенов?

marsbit04/06 05:54

活动图片