# Сопутствующие статьи по теме дообучение

Новостной центр HTX предлагает последние статьи и углубленный анализ по "дообучение", охватывающие рыночные тренды, новости проектов, развитие технологий и политику регулирования в криптоиндустрии.

ТОП моделей Hugging Face, теперь я признаю только yuxinlu1

**Персональный разработчик взлетел на трендовые позиции Hugging Face, обойдя крупные компании** Личный аккаунт **yuxinlu1** (разработчик Лу Юйсинь) неожиданно занял высокие места в трендовом рейтинге моделей Hugging Face, расположившись среди таких гигантов, как Zhipu GLM-5.2, Baidu Unlimited-OCR, Qwen и NVIDIA. Его два GGUF-квантованных варианта модели на базе **Gemma4-12B** набрали **207 тыс.** и **536 тыс.** загрузок соответственно. **Суть моделей:** * **Версия 1 (Coder):** Сфокусирована на генерации и проверке исполняемого кода. Обучалась на "верифицируемых" данных, где каждая цепочка рассуждений подтверждалась прохождением тестов. Для обучения использовались данные Cursor Composer 2.5 и Fable 5. * **Версия 2 (Agentic):** Добавлена способность к многошаговому вызову инструментов (tool use), что позволяет использовать модель как локального агента. **Ключевые преимущества:** 1. **Локальный запуск:** Модели в формате GGUF можно запускать локально с помощью llama.cpp, Ollama и др., что обеспечивает **конфиденциальность** данных (код не уходит в облако) и **нулевую стоимость** API-вызовов. 2. **Низкий порог входа:** Минимальная версия (Q2_K) занимает около **4.5 ГБ** памяти, что делает её доступной для пользователей с потребительскими видеокартами или Mac с 8 ГБ унифицированной памяти. **История создателя:** Лу Юйсинь — аспирант, изучающий ИИ. Эти модели — его **личный некоммерческий проект**, созданный для самообразования в быстроразвивающейся области. Процесс занял около 40 часов интенсивной работы (включая сжигание целого пакета Claude Max 20×) на одной видеокарте RTX 5090. Самой трудоёмкой частью была обработка и "нарезка" длинных диалоговых данных для обучения в условиях ограниченной памяти. **Философия и успех:** По словам разработчика, успех основан на **честности** (чётком указании сильных и слабых сторон модели) и **решении конкретной практической задачи** — создании эффективного и доступного локального помощника для программирования. Он активно взаимодействует с сообществом, отвечая на отзывы. Лу Юйсинь считает, что у индивидуальных разработчиков есть своя ниша: они могут быть более сфокусированными и гибкими, чем крупные компании, для которых выпуск моделей часто связан с более широкими бизнес-задачами. Ссылка на модели: https://huggingface.co/yuxinlu1

marsbit06/28 01:53

ТОП моделей Hugging Face, теперь я признаю только yuxinlu1

marsbit06/28 01:53

Новый открытый исходный код NVIDIA MoE: одна строка import, ускорение тонкой настройки в 3,7 раза

NVIDIA представила открытую библиотеку NeMo AutoModel, которая значительно ускоряет тонкую настройку MoE-моделей. Достаточно добавить одну строку импорта в код на основе Hugging Face Transformers v5, чтобы получить прирост производительности до 3.7 раз и сократить использование видеопамяти GPU на 29-32%. Библиотека совместима с API Transformers и вводит три ключевые оптимизации: Expert Parallelism (EP) для распределения параметров экспертов по GPU и снижения нагрузки на память, DeepEP для совмещения вычислений и коммуникаций, а также Transformer Engine для ускорения базовых операций. На примере модели Qwen3-30B-A3B на 8 GPU H100 скорость обучения выросла с 3075 до 11340 токенов в секунду на GPU. Для очень крупных моделей, таких как Nemotron 3 Ultra 550B, NeMo AutoModel позволяет проводить тонкую настройку там, где стандартный Transformers v5 исчерпывает доступную память. Проект доступен на GitHub, предоставляя простой способ ускорения работы с MoE-архитектурами без серьёзных изменений кода.

marsbit06/26 07:29

Новый открытый исходный код NVIDIA MoE: одна строка import, ускорение тонкой настройки в 3,7 раза

marsbit06/26 07:29

Впервые: претренированная VLA для ловкого манипулирования на чисто человеческих видео успешно развертывается после тонкой настройки на небольшом количестве данных

Новаторский фреймворк VITRA от Microsoft Research Asia и Университета Цинхуа совершил прорыв в обучении роботов для ловких манипуляций. Ключевая инновация — полностью автоматизированный конвейер для преобразования неразмеченных видеозаписей реальных человеческих действий в структурированные данные, пригодные для обучения моделей «зрение-язык-действие» (VLA). Система извлекает 3D-траектории движения руки, сегментирует видео на атомарные действия и генерирует текстовые инструкции с помощью GPT-4. На созданном масштабном наборе данных (1 млн сегментов, 26 млн кадров) была предобучена VLA-модель. Она демонстрирует впечатляющую способность к нулевому обучению (zero-shot), точно предсказывая движения руки в незнакомых условиях. Для развёртывания на реальном роботе (например, с манипулятором StarMove XHAND1) модели требуется лишь небольшая тонкая настройка на ограниченном наборе данных (~1.2 тыс. демонстраций), после чего она успешно выполняет сложные задачи: захват, перемещение, высыпание, подметание, показывая высокую степень обобщения для новых объектов и окружения. Исследование подтверждает закон масштабирования: производительность модели стабильно растёт с увеличением объёма данных для предобучения. Этот подход открывает путь к созданию более универсальных и адаптивных роботов, способных учиться на обширных и разнообразных видеозаписях человеческой деятельности.

marsbit06/08 08:55

Впервые: претренированная VLA для ловкого манипулирования на чисто человеческих видео успешно развертывается после тонкой настройки на небольшом количестве данных

marsbit06/08 08:55

活动图片