# Сопутствующие статьи по теме Ускорение

Новостной центр HTX предлагает последние статьи и углубленный анализ по "Ускорение", охватывающие рыночные тренды, новости проектов, развитие технологий и политику регулирования в криптоиндустрии.

Fable 5 вручную создаёт свой первый CUDA «суперъядерный код», за 2,5 часа получая прирост в 18,7 раз

Fable 5 в рамках теста KernelBench-Mega самостоятельно, «вручную», написал и оптимизировал высокоэффективное ядро CUDA для задачи декодирования Kimi-Linear (W4A16). На RTX PRO 6000 его решение показало ускорение в 18.7 раз по сравнению с базовой линией, значительно опередив модели вроде Claude Opus 4.8 (14.4x) и GPT-5.5 (4.34x). Ключевым достижением стало создание первого в истории бенчмарка «мега-ядра»: Fable 5 объединил все этапы вычислений для одного токена (деквантование int4, свёртку, внимание и т.д.) в один запуск GPU-ядра с 14 барьерными синхронизациями, тогда как другие модели требовали от 4 до 14 отдельных запусков. Это минимизировало накладные расходы и позволило производительности масштабироваться с ростом контекста. Весь процесс создания кода занял 2.5 часа и около 550 тысяч токенов, причём модель 64% времени потратила на анализ производительности и микро-бенчмаркинг перед написанием кода. Соучредитель Anthropic Джек Кларк назвал это началом цикла «рекурсивного самосовершенствования» (RSI), когда ИИ, улучшая собственные вычислительные инструменты, ускоряет своё же развитие, создавая самоподдерживающийся цикл прогресса.

marsbit07/07 07:37

Fable 5 вручную создаёт свой первый CUDA «суперъядерный код», за 2,5 часа получая прирост в 18,7 раз

marsbit07/07 07:37

DeepSeek переносит новую технологию на чипы Apple, ускоряя локальные большие модели на Mac на 60%

Технология DeepSeek DSpark, недавно представленная для серверных GPU, теперь адаптирована для чипов Apple Silicon в проекте mlx-dspark. Это первая нативная реализация, ускоряющая генерацию текста локальными большими языковыми моделями (LLM) на Mac. Инженер Abdur Rahim перенёс технологию "спекулятивного декодирования" (speculative decoding) в экосистему MLX. Этот метод использует небольшую "черновую" модель для быстрого создания нескольких кандидатов-токенов, которые затем проверяются основной целевой моделью. В результате модели Gemma-4 12B и Qwen3-4B на чипе M4 Pro показывают ускорение генерации примерно в 1.6 и 1.4 раза соответственно (до 30 и 73 токенов в секунду), сохраняя при этом точное соответствие выходным данным исходных моделей. Ключевые особенности реализации: * Поддержка как жадного декодирования, так и стохастической семплирующей генерации с температурой, что обеспечивает высокое качество и разнообразие вывода. * Использование 4-битной квантизации для черновой модели (размер ~1.8 ГБ) и 8-битной — для основной модели для оптимального баланса скорости и точности. * Интеграция альтернативного метода DFlash (от z-lab), который показывает ещё большее ускорение (до ~2.1x) на структурированных задачах, таких как генерация кода и математические вычисления, за счёт параллельного декодирования целых блоков токенов. Таким образом, mlx-dspark предоставляет гибкий инструмент для значительного ускорения работы LLM на устройствах Apple, поддерживая различные сценарии — от чата до программирования.

marsbit07/03 12:23

DeepSeek переносит новую технологию на чипы Apple, ускоряя локальные большие модели на Mac на 60%

marsbit07/03 12:23

Новый открытый исходный код NVIDIA MoE: одна строка import, ускорение тонкой настройки в 3,7 раза

NVIDIA представила открытую библиотеку NeMo AutoModel, которая значительно ускоряет тонкую настройку MoE-моделей. Достаточно добавить одну строку импорта в код на основе Hugging Face Transformers v5, чтобы получить прирост производительности до 3.7 раз и сократить использование видеопамяти GPU на 29-32%. Библиотека совместима с API Transformers и вводит три ключевые оптимизации: Expert Parallelism (EP) для распределения параметров экспертов по GPU и снижения нагрузки на память, DeepEP для совмещения вычислений и коммуникаций, а также Transformer Engine для ускорения базовых операций. На примере модели Qwen3-30B-A3B на 8 GPU H100 скорость обучения выросла с 3075 до 11340 токенов в секунду на GPU. Для очень крупных моделей, таких как Nemotron 3 Ultra 550B, NeMo AutoModel позволяет проводить тонкую настройку там, где стандартный Transformers v5 исчерпывает доступную память. Проект доступен на GitHub, предоставляя простой способ ускорения работы с MoE-архитектурами без серьёзных изменений кода.

marsbit06/26 07:29

Новый открытый исходный код NVIDIA MoE: одна строка import, ускорение тонкой настройки в 3,7 раза

marsbit06/26 07:29

Anthropic бьёт глобальную тревогу, OpenAI пересёк «порог надёжности»: запущен процесс самоускорения ИИ

Корпорация Anthropic предупреждает о потенциально неконтролируемом развитии ИИ, близком к порогу рекурсивного самоулучшения. Одновременно Ян Дюбуа из OpenAI раскрывает концепцию «порога надежности». По его словам, способности ИИ растут линейно, но полезность для пользователей резко возрастает после преодоления этого порога, что и произошло у OpenAI примерно в декабре. После этого ИИ перестал быть игрушкой и превратился в надежного помощника, способного даже ускорять собственные разработки. Дюбуа сравнивает создание ИИ больше с ремеслом или даже «алхимией», чем с чистой наукой, полагаясь на опыт и интуицию. Он также утверждает, что, сосредоточившись на «последней миле» — интеграции, подключении к данным и системам, — уже сегодня можно добиться эффекта, схожего с ОИИ (AGI) во многих вертикальных сферах, даже с текущими моделями. Главные вызовы сейчас — это повышение надежности автономных агентов и реализация непрерывного обучения, чтобы ИИ адаптировался к задачам пользователя, а не оставался статичным.

marsbit06/06 23:26

Anthropic бьёт глобальную тревогу, OpenAI пересёк «порог надёжности»: запущен процесс самоускорения ИИ

marsbit06/06 23:26

Запуск MoE на смартфоне? Meta предлагает MobileMoE, ускорение на iPhone 16 Pro до 3.8 раза

Мета представила MobileMoE — первую эффективную реализацию модели смешанных экспертов (MoE) для инференса на коммерческих смартфонах. Традиционно MoE использовались в облачных больших языковых моделях (LLM), тогда как на мобильных устройствах применялись плотные архитектуры из-за ограничений памяти и вычислительных ресурсов. MobileMoE заменяет плотные слои в Transformer на MoE-слои. Маршрутизатор выбирает для каждого токена несколько наиболее релевантных экспертов, при этом один общий эксперт участвует в вычислениях всегда. Обучение модели включает четыре этапа: предварительное обучение, промежуточное обучение, контролируемое тонкое обучение (SFT) и обучение с учётом квантизации. Результаты показывают, что MobileMoE-S/M при сопоставимом использовании памяти требует в 2–4 раза меньше вычислений, чем плотные базовые модели, достигая аналогичной или более высокой точности в 14 базовых тестах. На iPhone 16 Pro инференс ускорился до 3,8 раз на этапе ввода и до 3,4 раз на этапе генерации. После квантизации до INT4 модель сохраняет конкурентоспособность, а пиковое использование памяти на Samsung Galaxy S25 ниже, чем у аналогов. Несмотря на преимущества в коде и математике, MobileMoE пока уступает Qwen3.5 2B в следовании инструкциям и сложных рассуждениях. Для дальнейшего улучшения необходимы дистилляция, постобучение и мультимодальное расширение. Также требуются исследования для оптимизации памяти при изменяющихся входных данных и использования NPU на мобильных устройствах.

marsbit06/01 06:10

Запуск MoE на смартфоне? Meta предлагает MobileMoE, ускорение на iPhone 16 Pro до 3.8 раза

marsbit06/01 06:10

Pipe Network запускает SolanaCDN: бесплатный клиент валидатора с открытым исходным кодом и встроенным ускорением для Solana

Pipe Network анонсировала запуск SolanaCDN — бесплатного клиента для валидаторов Solana с открытым исходным кодом и встроенным CDN-ускорением. Решение, созданное на базе Agave от Anza, использует глобальную сеть из более чем 35 000 узлов для ускорения распространения данных (shred propagation) в 3,8 раза по сравнению со стандартным механизмом Turbine. SolanaCDN решает проблему географической зависимости производительности валидаторов, обеспечивая более быстрое распространение фрагментов данных и голосов через распределённую сеть Pipe. Это позволяет валидаторам в удалённых регионах работать эффективнее, сокращать задержки и повышать доходность. Клиент полностью совместим с Agave, не требует изменений в консенсусе и может быть активирован одним флагом в конфигурации. Все операции CDN являются опциональными и отказоустойчивыми. Проект развивается как общественное благо для экосистемы Solana: чем больше валидаторов используют SolanaCDN, тем выше становится общая производительность сети. SolanaCDN уже доступен для использования в mainnet-beta. Исходный код опубликован на GitHub.

TheNewsCrypto02/26 14:24

Pipe Network запускает SolanaCDN: бесплатный клиент валидатора с открытым исходным кодом и встроенным ускорением для Solana

TheNewsCrypto02/26 14:24

Pipe Network представляет SolanaCDN: бесплатный, открытый клиент Solana-валидатора со встроенным ускорением

Pipe Network представила SolanaCDN — бесплатный клиент для валидаторов Solana с открытым исходным кодом и встроенным CDN-ускорением. Основанный на форке клиента Agave от Anza, SolanaCDN использует глобальную сеть из 35 000 узлов Pipe для ускорения распространения шардов (shreds) между валидаторами. Решение устраняет зависимость производительности валидаторов от их географического положения, обеспечивая более быстрое распространение данных через параллельный CDN-канал поверх native gossip-протокола. Задержки передачи данных сокращены в 3.8 раза (P50 ~78 мс против ~300 мс). Клиент также предлагает встроенные оптимизации: Fast Shreds, ускоренную загрузку снепшотов и мониторинг прогресса синхронизации. SolanaCDN работает как публичная инфраструктура — чем больше валидаторов его используют, тем выше скорость и стабильность всей сети Solana. Проект полностью совместим с Agave, не влияет на консенсус и доступен для использования в mainnet-beta. Исходный код опубликован на GitHub.

marsbit02/26 14:09

Pipe Network представляет SolanaCDN: бесплатный, открытый клиент Solana-валидатора со встроенным ускорением

marsbit02/26 14:09

活动图片