Только что, DeepSeek V4 обновил DSpark, скорость вывода повысилась на 80%

marsbitОпубликовано 2026-06-27Обновлено 2026-06-27

Введение

DeepSeek выпустил фреймворк спекулятивного декодирования DSpark, который увеличивает скорость вывода DeepSeek-V4 на 80%. DSpark, развернутый в онлайн-трафике DeepSeek-V4 (Flash и Pro), сочетает высокопроизводительную «параллельную генерацию» с адаптивной «проверкой с учетом нагрузки». Он использует архитектуру полуавторегрессивной генерации для моделирования зависимостей внутри блоков токенов и аппаратно-ориентированное планирование проверки по уверенности для динамического определения оптимальной длины проверки для каждого запроса. В тестах DSpark превзошел современные авторегрессивные (Eagle3) и параллельные (DFlash) модели-черновики, повысив среднюю длину принятия на 26.7%-30.9% и 16.3%-18.4% соответственно. Вместе с DSpark был открыт исходный код DeepSpec — полного стека для обучения и оценки моделей-черновиков спекулятивного декодирования.

Только что, DeepSeek V4 выпустил обновление.

Была представлена новая фреймворк спекулятивного декодирования (Speculative Decoding) DSpark, а также одновременно был открыт исходный код полного стека фреймворка спекулятивного декодирования DeepSpec, поддерживающего эту версию.

DeepSeek-V4-Pro-DSpark не является моделью с совершенно новой архитектурой, а представляет собой DeepSeek-V4-Pro с добавленным модулем спекулятивного декодирования. Основное внимание в этом обновлении уделено инженерной реализации, а не итерации самих возможностей модели.

DSpark уже развернут в реальном онлайн-трафике DeepSeek-V4 (Flash и Pro), что значительно ускорило скорость вывода (инференса) больших языковых моделей (LLM).

Технический отчет: «DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation»

Ссылка на технический отчет: https://github.com/deepseek-ai/DeepSpec/blob/main/DSpark_paper.pdf

Основная цель DSpark — решить проблему узких мест в задержке и пропускной способности вывода LLM в производственных средах (особенно в сценариях с высокой параллельной нагрузкой). Проще говоря, DSpark успешно объединил высокопроизводительную «параллельную генерацию» с адаптивной «проверкой с учетом нагрузки».

Спекулятивное декодирование — это техника ускорения вывода больших языковых моделей без изменения распределения их вывода. Основная идея заключается во внедрении легковесной «черновой модели» (draft model), которая предварительно генерирует несколько кандидатных токенов, а затем целевая модель (target model) выполняет пакетную проверку и принятие этих кандидатов. Это преобразует последовательную потокенную генерацию в параллельную пакетную проверку, значительно снижая сквозную задержку.

На этой основе инновация DSpark заключается во внедрении архитектуры полуавторегрессивной генерации (Semi-Autoregressive Generation): она сохраняет преимущества высокой пропускной способности параллельной черновой модели, одновременно добавляя легковесный последовательный модуль для моделирования зависимостей между токенами внутри блока, чтобы смягчить проблему снижения процента принятия (acceptance rate), которая часто возникает у параллельной черновой модели на последующих позициях.

Кроме того, используется аппаратно-зависимая проверка по расписанию на основе уверенности (Confidence-Scheduled Verification): в предыдущих реализациях спекулятивного декодирования обычно все сгенерированные черновые токены вслепую отправлялись на проверку. При высокой нагрузке на систему эти хвостовые токены, которые с высокой вероятностью будут отклонены, серьезно растрачивают ценную вычислительную мощность пакетной обработки. DSpark вводит голову уверенности (Confidence Head) для оценки вероятности «выживания» каждого токена. В сочетании с планировщиком префиксов, учитывающим аппаратное обеспечение, система может динамически определять оптимальную длину проверки для каждого запроса на основе характеристик текущей пропускной способности движка, выделяя вычислительные ресурсы только токенам с наивысшей ожидаемой отдачей.

Для развертывания в реальной онлайн-инфраструктуре планировщик DSpark использует асинхронный механизм для совместимости с планированием с нулевыми накладными расходами (ZOS) и непрерывным воспроизведением CUDA-графов. Он использует исторические прогнозы из предыдущих шагов для определения текущей динамической длины усечения, скрывая тем самым задержку планирования, предотвращая остановки конвейера GPU и гарантируя при этом полное и безошибочное восстановление выходного распределения целевой модели.

В тестах, охватывающих математические рассуждения, генерацию кода и повседневный диалог, DSpark значительно превзошел самые передовые авторегрессивные модели (Eagle3) и параллельные черновые модели (DFlash). Например, на целевых моделях серии Qwen3 (4B, 8B, 14B) средняя длина принятия увеличилась на 26,7%–30,9% по сравнению с Eagle3 и на 16,3%–18,4% по сравнению с DFlash.

По сравнению с базовым однотокенным производством предыдущего поколения (MTP-1), при сохранении той же общей пропускной способности DSpark повысил скорость генерации для пользователей на 60%–85% (модель Flash) и 57%–78% (модель Pro).

Вместе с DSpark также был открыт исходный код DeepSpec — это полноценный стек кодовой базы для обучения и оценки черновых моделей спекулятивного декодирования. Это «открытая инфраструктура», на которой реализованы данное решение и другие передовые алгоритмы, включая инструменты подготовки данных, реализацию черновой модели, код обучения и скрипты оценки.

DeepSpec разбивает общий процесс на три этапа: подготовка данных, обучение и оценка. Эти этапы необходимо выполнять последовательно, выходные данные предыдущего этапа служат входными для последующего.

На этапе подготовки данных необходимо загрузить данные промптов, повторно сгенерировать ответы с помощью движка вывода для целевой модели и построить целевой кеш (target cache). Примечательно, что для конфигурации по умолчанию, например, Qwen/Qwen3-4B, объем целевого кеша может достигать около 38 ТБ, поэтому перед использованием необходимо тщательно оценить ресурсы хранения.

Этап обучения можно запустить с помощью bash scripts/train/train.sh. Этот скрипт вызовет train.py и запустит worker для каждого видимого GPU. Пользователи могут выбрать различные конфигурации алгоритмов и целевых моделей в каталоге config/, указав config_path. Проект также поддерживает изменение настроек обучения путем переопределения config_path, target_cache_dir, а также использования --opts для изменения отдельных полей конфигурации.

Что касается аппаратного обеспечения, конфигурация и скрипты DeepSpec по умолчанию ориентированы на среду с одним узлом и 8 GPU. Если количество GPU меньше, пользователям необходимо соответственно уменьшить количество видимых GPU в CUDA_VISIBLE_DEVICES.

Этап оценки запускается с помощью bash scripts/eval/eval.sh. Скрипт оценки будет использовать контрольную точку обученной черновой модели для измерения процента принятия на нескольких задачах бенчмарка спекулятивного декодирования. В проекте в настоящее время перечислены наборы данных для оценки: GSM8K, MATH500, AIME25, HumanEval, MBPP, LiveCodeBench, MT-Bench, Alpaca и Arena-Hard-v2, охватывающие различные типы задач, такие как математические рассуждения, генерация кода, диалоговые способности и комплексные вопросы и ответы.

Что касается алгоритмов, DeepSpec в настоящее время включает три черновые модели: DSpark, DFlash и Eagle3. Что касается семейств целевых моделей, проект в настоящее время поддерживает Qwen3 и Gemma.

Открытие исходного кода DeepSpec объединило практики спекулятивного декодирования, ранее разрозненные внутри различных исследовательских групп, в стандартизированный, воспроизводимый и расширяемый инструментарий. Для исследователей и инженеров, желающих ускорить вывод собственных больших моделей, это означает, что они могут напрямую обучать пользовательские черновые модели на зрелой платформе, пропуская множество повторяющихся работ по созданию базовой инфраструктуры.

Ссылки для справки:

https://github.com/deepseek-ai/DeepSpec/blob/main/DSpark_paper.pdf

https://github.com/deepseek-ai/DeepSpec

Эта статья из официального аккаунта WeChat «Машинный разум» (ID:almosthuman2014), авторы: Цзэнань, Ян Вэнь

Связанные с этим вопросы

QЧто такое DSpark и какова его основная цель?

ADSpark — это фреймворк для спекулятивного декодирования (speculative decoding), представленный DeepSeek для ускорения логического вывода больших языковых моделей (LLM). Его основная цель — решить проблемы задержки и пропускной способности в производственных средах, особенно в сценариях с высокой параллельной нагрузкой, сочетая высокопроизводительную «параллельную генерацию» с адаптивной «верификацией с учетом нагрузки».

QКакие ключевые инновации предлагает DSpark по сравнению с предыдущими подходами к спекулятивному декодированию?

ADSpark вводит две ключевые инновации: 1) Архитектуру полуавторегрессионной генерации (Semi-Autoregressive Generation), которая моделирует зависимости между токенами внутри блока для улучшения коэффициента принятия. 2) Аппаратно-ориентированную верификацию с планированием по уверенности (Confidence-Scheduled Verification), где «голова уверенности» оценивает вероятность выживания каждого токена, позволяя системе динамически оптимизировать длину верификации в зависимости от нагрузки и эффективно распределять вычислительные ресурсы.

QНасколько DSpark ускорил генерацию в моделях DeepSeek-V4 Flash и Pro?

AПо сравнению с базовым уровнем однотокенной генерации (MTP-1), DSpark повысил скорость генерации для пользователей на 60%-85% в модели Flash и на 57%-78% в модели Pro при сохранении одинаковой общей пропускной способности.

QЧто такое DeepSpec и какова его роль в экосистеме?

ADeepSpec — это полный стековый фреймворк с открытым исходным кодом для обучения и оценки моделей-черновиков (draft models) в спекулятивном декодировании. Он служит «инфраструктурой с открытым исходным кодом», которая объединяет инструменты подготовки данных, реализации моделей-черновиков, код обучения и скрипты оценки, позволяя исследователям и инженерам воспроизводить и расширять передовые методы ускорения логического вывода LLM.

QКакие алгоритмы и целевые модели в настоящее время поддерживает DeepSpec?

ADeepSpec в настоящее время поддерживает три алгоритма для моделей-черновиков: DSpark, DFlash и Eagle3. Что касается целевых моделей (target models), фреймворк поддерживает серии Qwen3 и Gemma.

Похожее

15 кошельков заработали $312 000 на фоне вероятного rug pull токена GOLD, который связывали с Трампом

Аналитики Lookonchain обнаружили вероятный rug pull с токеном GOLD в сети Solana. 15 кошельков, предположительно связанных с командой проекта, продали 224,5 млн GOLD за $330 000, получив прибыль около $312 000 при первоначальных затратах всего $18 657. Эти адреса контролировали 82,45% общего предложения токена. Интерес к GOLD был вызван продвижением через X-аккаунт @realtrumpcoins1, на который подписан официальный аккаунт Дональда Трампа, что создавало ложное впечатление о связи токена с семьей или бизнесом экс-президента. После распродажи связанные публикации были удалены. Компания Trump Coins официально опровергла свою причастность к GOLD, назвав выпуск мошенничеством и пообещав сотрудничество с органами для расследования. Инцидент произошел на фоне пристального внимания к криптопроектам, связанным с Дональдом Трампом.

cryptonews.ru1 мин. назад

15 кошельков заработали $312 000 на фоне вероятного rug pull токена GOLD, который связывали с Трампом

cryptonews.ru1 мин. назад

OpenAI показала собственный чип Jalapeño: ускоритель в 1,5–2 раза эффективнее Nvidia

OpenAI представила собственный ускоритель для инференса под названием Jalapeño, который, по результатам тестов на бенчмарке InferenceX, в 1,5–1,9 раза эффективнее по вычислениям на ватт и сокращает задержку в 1,7–3,6 раза по сравнению с системами на чипах Nvidia GB200/GB300. Чип мощностью до 700 Вт предназначен для оптимизации массового инференса собственных сервисов OpenAI, таких как ChatGPT. Разработанный совместно с Broadcom и Celestica за девять месяцев, Jalapeño является частью масштабной программы по развертыванию 10 ГВт собственных ускорителей к 2029 году. Это позволяет компании снизить зависимость от универсальных решений Nvidia и контролировать затраты на самый массовый поток вычислений. Хотя OpenAI продолжит использовать внешние ускорители для обучения моделей, переход на специализированный чип для инференса направлен на прямое сокращение себестоимости обработки запросов. Это повторяет отраслевую тенденцию, когда крупные игроки переходят на кастомные решения при достижении достаточного объёма предсказуемых workloads. Однако такая специализация несёт риски потери гибкости и создания зависимости от партнёров по производству.

cryptonews.ru1 мин. назад

OpenAI показала собственный чип Jalapeño: ускоритель в 1,5–2 раза эффективнее Nvidia

cryptonews.ru1 мин. назад

Недавний всплеск активности биткоина — это пузырь или здоровый пузырь?

Недавний рост биткоина с примерно 63 500 до более 80 000 долларов обусловлен в основном спотовым спросом, а не спекуляциями с использованием кредитного плеча. Согласно анализу QCP Capital, за период роста в спотовые биткоин-ETF поступило около 2,8 млрд долларов чистого притока, в то время как объём открытых позиций по фьючерсам и ставки финансирования снизились. Это указывает на более здоровую и устойчивую структуру рынка. На макроэкономическом фронте сохраняется неопределённость. Хотя вероятность повышения ставок ФРС в сентябре оценивается в 35%, поддержку рискованным активам, включая биткоин, оказало объявление Минфина США об увеличении программы обратного выкупа долгосрочных облигаций для поддержания ликвидности. Это привело к снижению доходности облигаций и ослаблению доллара. Росту также способствовали устойчивые финансовые показатели Nvidia. Ключевым для биткоина в краткосрочной перспективе будет вопрос сохранения высокого спотового спроса.

cryptonews.ru3 ч. назад

Недавний всплеск активности биткоина — это пузырь или здоровый пузырь?

cryptonews.ru3 ч. назад

Сбер рассматривает кредиты под залог USDT и ставит под сомнение спрос на цифровой рубль

Крупнейший российский банк «Сбер» планирует расширить предложение кредитов под залог криптоактивов, включив в качестве залога стейблкоин USDT от Tether и Ethereum, наряду с Bitcoin. Об этом заявил заместитель председателя правления банка Анатолий Попов. Расширение продуктовой линейки будет происходить по мере вступления в силу нового российского закона о криптовалютах. Банк начнет принимать эти активы после того, как Банк России разрешит их публичный торги на регулируемых площадках. Новый закон, подписанный президентом Владимиром Путиным 4 августа, создает регулируемый рынок криптоактивов в России. Банк России, получивший полномочия определять, какие криптоактивы могут торговаться, уже предложил для торгов Bitcoin, Ether и USDT. При этом «Сбер» скептически оценивает спрос на цифровой рубль — цифровую валюту центрального банка (CBDC). По словам финансового директора банка Тараса Скворцова, нет явных свидетельств широкого интереса к этому инструменту со стороны розничных и корпоративных клиентов или финансовых институтов, помимо самого ЦБ.

cointelegraph5 ч. назад

Сбер рассматривает кредиты под залог USDT и ставит под сомнение спрос на цифровой рубль

cointelegraph5 ч. назад

Торговля

Спот
活动图片