# Сопутствующие статьи по теме Transformers

Новостной центр HTX предлагает последние статьи и углубленный анализ по "Transformers", охватывающие рыночные тренды, новости проектов, развитие технологий и политику регулирования в криптоиндустрии.

ACL 2026: Превосходство китайских исследователей. Все авторы лучших статей - китайцы, в выдающихся статьях они почти монополия

В статье освещаются ключевые итоги конференции ACL 2026. Главное внимание уделяется беспрецедентному доминированию китайских исследователей: все три работы, удостоенные премии Best Paper Award, а также большинство из 18 работ, отмеченных как Outstanding Paper, были подготовлены учеными китайского происхождения. Конференция побила рекорды по масштабу: 12148 поданых работ, рост на 45%, что отражает общую тенденцию доминирования исследований, связанных с большими языковыми моделями (LLM). Доля авторов из материкового Китая составила 54%. Три лучшие работы затрагивают фундаментальные вопросы: первая («The Imperfective Paradox in Large Language Models») выявляет систематическую ошибку LLM в логическом выводе на основе лингвистических парадоксов; вторая («Memory efficiency and resource-rational encoding…») предлагает модель ограниченной рабочей памяти, делая ИИ более «человекоподобным»; третья («Characterizing the Expressivity of Local Attention…») формально доказывает преимущества гибридной (глобальной и локальной) архитектуры внимания в Transformers. Статья также подчеркивает, что, несмотря на тотальную ориентацию конференции на LLM, высшие награды получили исследования, критически и фундаментально исследующие их природу, а не просто применяющие их.

marsbit07/09 11:59

ACL 2026: Превосходство китайских исследователей. Все авторы лучших статей - китайцы, в выдающихся статьях они почти монополия

marsbit07/09 11:59

Новый открытый исходный код NVIDIA MoE: одна строка import, ускорение тонкой настройки в 3,7 раза

NVIDIA представила открытую библиотеку NeMo AutoModel, которая значительно ускоряет тонкую настройку MoE-моделей. Достаточно добавить одну строку импорта в код на основе Hugging Face Transformers v5, чтобы получить прирост производительности до 3.7 раз и сократить использование видеопамяти GPU на 29-32%. Библиотека совместима с API Transformers и вводит три ключевые оптимизации: Expert Parallelism (EP) для распределения параметров экспертов по GPU и снижения нагрузки на память, DeepEP для совмещения вычислений и коммуникаций, а также Transformer Engine для ускорения базовых операций. На примере модели Qwen3-30B-A3B на 8 GPU H100 скорость обучения выросла с 3075 до 11340 токенов в секунду на GPU. Для очень крупных моделей, таких как Nemotron 3 Ultra 550B, NeMo AutoModel позволяет проводить тонкую настройку там, где стандартный Transformers v5 исчерпывает доступную память. Проект доступен на GitHub, предоставляя простой способ ускорения работы с MoE-архитектурами без серьёзных изменений кода.

marsbit06/26 07:29

Новый открытый исходный код NVIDIA MoE: одна строка import, ускорение тонкой настройки в 3,7 раза

marsbit06/26 07:29

活动图片