Только что, DeepSeek V4 обновил DSpark, скорость вывода повысилась на 80%

marsbitОпубликовано 2026-06-27Обновлено 2026-06-27

Введение

DeepSeek выпустил фреймворк спекулятивного декодирования DSpark, который увеличивает скорость вывода DeepSeek-V4 на 80%. DSpark, развернутый в онлайн-трафике DeepSeek-V4 (Flash и Pro), сочетает высокопроизводительную «параллельную генерацию» с адаптивной «проверкой с учетом нагрузки». Он использует архитектуру полуавторегрессивной генерации для моделирования зависимостей внутри блоков токенов и аппаратно-ориентированное планирование проверки по уверенности для динамического определения оптимальной длины проверки для каждого запроса. В тестах DSpark превзошел современные авторегрессивные (Eagle3) и параллельные (DFlash) модели-черновики, повысив среднюю длину принятия на 26.7%-30.9% и 16.3%-18.4% соответственно. Вместе с DSpark был открыт исходный код DeepSpec — полного стека для обучения и оценки моделей-черновиков спекулятивного декодирования.

Только что, DeepSeek V4 выпустил обновление.

Была представлена новая фреймворк спекулятивного декодирования (Speculative Decoding) DSpark, а также одновременно был открыт исходный код полного стека фреймворка спекулятивного декодирования DeepSpec, поддерживающего эту версию.

DeepSeek-V4-Pro-DSpark не является моделью с совершенно новой архитектурой, а представляет собой DeepSeek-V4-Pro с добавленным модулем спекулятивного декодирования. Основное внимание в этом обновлении уделено инженерной реализации, а не итерации самих возможностей модели.

DSpark уже развернут в реальном онлайн-трафике DeepSeek-V4 (Flash и Pro), что значительно ускорило скорость вывода (инференса) больших языковых моделей (LLM).

Технический отчет: «DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation»

Ссылка на технический отчет: https://github.com/deepseek-ai/DeepSpec/blob/main/DSpark_paper.pdf

Основная цель DSpark — решить проблему узких мест в задержке и пропускной способности вывода LLM в производственных средах (особенно в сценариях с высокой параллельной нагрузкой). Проще говоря, DSpark успешно объединил высокопроизводительную «параллельную генерацию» с адаптивной «проверкой с учетом нагрузки».

Спекулятивное декодирование — это техника ускорения вывода больших языковых моделей без изменения распределения их вывода. Основная идея заключается во внедрении легковесной «черновой модели» (draft model), которая предварительно генерирует несколько кандидатных токенов, а затем целевая модель (target model) выполняет пакетную проверку и принятие этих кандидатов. Это преобразует последовательную потокенную генерацию в параллельную пакетную проверку, значительно снижая сквозную задержку.

На этой основе инновация DSpark заключается во внедрении архитектуры полуавторегрессивной генерации (Semi-Autoregressive Generation): она сохраняет преимущества высокой пропускной способности параллельной черновой модели, одновременно добавляя легковесный последовательный модуль для моделирования зависимостей между токенами внутри блока, чтобы смягчить проблему снижения процента принятия (acceptance rate), которая часто возникает у параллельной черновой модели на последующих позициях.

Кроме того, используется аппаратно-зависимая проверка по расписанию на основе уверенности (Confidence-Scheduled Verification): в предыдущих реализациях спекулятивного декодирования обычно все сгенерированные черновые токены вслепую отправлялись на проверку. При высокой нагрузке на систему эти хвостовые токены, которые с высокой вероятностью будут отклонены, серьезно растрачивают ценную вычислительную мощность пакетной обработки. DSpark вводит голову уверенности (Confidence Head) для оценки вероятности «выживания» каждого токена. В сочетании с планировщиком префиксов, учитывающим аппаратное обеспечение, система может динамически определять оптимальную длину проверки для каждого запроса на основе характеристик текущей пропускной способности движка, выделяя вычислительные ресурсы только токенам с наивысшей ожидаемой отдачей.

Для развертывания в реальной онлайн-инфраструктуре планировщик DSpark использует асинхронный механизм для совместимости с планированием с нулевыми накладными расходами (ZOS) и непрерывным воспроизведением CUDA-графов. Он использует исторические прогнозы из предыдущих шагов для определения текущей динамической длины усечения, скрывая тем самым задержку планирования, предотвращая остановки конвейера GPU и гарантируя при этом полное и безошибочное восстановление выходного распределения целевой модели.

В тестах, охватывающих математические рассуждения, генерацию кода и повседневный диалог, DSpark значительно превзошел самые передовые авторегрессивные модели (Eagle3) и параллельные черновые модели (DFlash). Например, на целевых моделях серии Qwen3 (4B, 8B, 14B) средняя длина принятия увеличилась на 26,7%–30,9% по сравнению с Eagle3 и на 16,3%–18,4% по сравнению с DFlash.

По сравнению с базовым однотокенным производством предыдущего поколения (MTP-1), при сохранении той же общей пропускной способности DSpark повысил скорость генерации для пользователей на 60%–85% (модель Flash) и 57%–78% (модель Pro).

Вместе с DSpark также был открыт исходный код DeepSpec — это полноценный стек кодовой базы для обучения и оценки черновых моделей спекулятивного декодирования. Это «открытая инфраструктура», на которой реализованы данное решение и другие передовые алгоритмы, включая инструменты подготовки данных, реализацию черновой модели, код обучения и скрипты оценки.

DeepSpec разбивает общий процесс на три этапа: подготовка данных, обучение и оценка. Эти этапы необходимо выполнять последовательно, выходные данные предыдущего этапа служат входными для последующего.

На этапе подготовки данных необходимо загрузить данные промптов, повторно сгенерировать ответы с помощью движка вывода для целевой модели и построить целевой кеш (target cache). Примечательно, что для конфигурации по умолчанию, например, Qwen/Qwen3-4B, объем целевого кеша может достигать около 38 ТБ, поэтому перед использованием необходимо тщательно оценить ресурсы хранения.

Этап обучения можно запустить с помощью bash scripts/train/train.sh. Этот скрипт вызовет train.py и запустит worker для каждого видимого GPU. Пользователи могут выбрать различные конфигурации алгоритмов и целевых моделей в каталоге config/, указав config_path. Проект также поддерживает изменение настроек обучения путем переопределения config_path, target_cache_dir, а также использования --opts для изменения отдельных полей конфигурации.

Что касается аппаратного обеспечения, конфигурация и скрипты DeepSpec по умолчанию ориентированы на среду с одним узлом и 8 GPU. Если количество GPU меньше, пользователям необходимо соответственно уменьшить количество видимых GPU в CUDA_VISIBLE_DEVICES.

Этап оценки запускается с помощью bash scripts/eval/eval.sh. Скрипт оценки будет использовать контрольную точку обученной черновой модели для измерения процента принятия на нескольких задачах бенчмарка спекулятивного декодирования. В проекте в настоящее время перечислены наборы данных для оценки: GSM8K, MATH500, AIME25, HumanEval, MBPP, LiveCodeBench, MT-Bench, Alpaca и Arena-Hard-v2, охватывающие различные типы задач, такие как математические рассуждения, генерация кода, диалоговые способности и комплексные вопросы и ответы.

Что касается алгоритмов, DeepSpec в настоящее время включает три черновые модели: DSpark, DFlash и Eagle3. Что касается семейств целевых моделей, проект в настоящее время поддерживает Qwen3 и Gemma.

Открытие исходного кода DeepSpec объединило практики спекулятивного декодирования, ранее разрозненные внутри различных исследовательских групп, в стандартизированный, воспроизводимый и расширяемый инструментарий. Для исследователей и инженеров, желающих ускорить вывод собственных больших моделей, это означает, что они могут напрямую обучать пользовательские черновые модели на зрелой платформе, пропуская множество повторяющихся работ по созданию базовой инфраструктуры.

Ссылки для справки:

https://github.com/deepseek-ai/DeepSpec/blob/main/DSpark_paper.pdf

https://github.com/deepseek-ai/DeepSpec

Эта статья из официального аккаунта WeChat «Машинный разум» (ID:almosthuman2014), авторы: Цзэнань, Ян Вэнь

Связанные с этим вопросы

QЧто такое DSpark и какова его основная цель?

ADSpark — это фреймворк для спекулятивного декодирования (speculative decoding), представленный DeepSeek для ускорения логического вывода больших языковых моделей (LLM). Его основная цель — решить проблемы задержки и пропускной способности в производственных средах, особенно в сценариях с высокой параллельной нагрузкой, сочетая высокопроизводительную «параллельную генерацию» с адаптивной «верификацией с учетом нагрузки».

QКакие ключевые инновации предлагает DSpark по сравнению с предыдущими подходами к спекулятивному декодированию?

ADSpark вводит две ключевые инновации: 1) Архитектуру полуавторегрессионной генерации (Semi-Autoregressive Generation), которая моделирует зависимости между токенами внутри блока для улучшения коэффициента принятия. 2) Аппаратно-ориентированную верификацию с планированием по уверенности (Confidence-Scheduled Verification), где «голова уверенности» оценивает вероятность выживания каждого токена, позволяя системе динамически оптимизировать длину верификации в зависимости от нагрузки и эффективно распределять вычислительные ресурсы.

QНасколько DSpark ускорил генерацию в моделях DeepSeek-V4 Flash и Pro?

AПо сравнению с базовым уровнем однотокенной генерации (MTP-1), DSpark повысил скорость генерации для пользователей на 60%-85% в модели Flash и на 57%-78% в модели Pro при сохранении одинаковой общей пропускной способности.

QЧто такое DeepSpec и какова его роль в экосистеме?

ADeepSpec — это полный стековый фреймворк с открытым исходным кодом для обучения и оценки моделей-черновиков (draft models) в спекулятивном декодировании. Он служит «инфраструктурой с открытым исходным кодом», которая объединяет инструменты подготовки данных, реализации моделей-черновиков, код обучения и скрипты оценки, позволяя исследователям и инженерам воспроизводить и расширять передовые методы ускорения логического вывода LLM.

QКакие алгоритмы и целевые модели в настоящее время поддерживает DeepSpec?

ADeepSpec в настоящее время поддерживает три алгоритма для моделей-черновиков: DSpark, DFlash и Eagle3. Что касается целевых моделей (target models), фреймворк поддерживает серии Qwen3 и Gemma.

Похожее

SEC и CFTC подали в суд на Goliath Ventures из-за криптопирамиды на $400 млн

Комиссия по ценным бумагам и биржам (SEC) и Комиссия по торговле товарными фьючерсами (CFTC) США подали в суд на компанию Goliath Ventures и ее основателя Кристофера Дельгадо в связи с предполагаемой криптовалютной пирамидой, собравшей около $400 млн. SEC заявляет, что Goliath Ventures привлекла не менее $425 млн от более чем 1300 инвесторов через незарегистрированное предложение ценных бумаг. Средства якобы должны были инвестироваться в криптовалютные ликвидные пулы, но, по данным регулятора, этого не произошло. Дельгадо присвоил не менее $51 млн для личного пользования. CFTC в отдельном иске указывает, что около 1600 клиентов внесли не менее $397 млн для торговли биткоином и эфиром. Дельгадо уже признал себя виновным по уголовным статьям о мошенничестве и отмывании денег в конце июня и согласился на конфискацию имущества, счетов и криптоактивов. Теперь он также согласился урегулировать гражданский иск SEC, что предполагает постоянный запрет на нарушение законов о ценных бумагах. Сумма штрафов и реституции будет определена судом. Схема обещала инвесторам ежемесячную доходность 3-10% с гарантией本金, но выплаты осуществлялись за счет средств новых вкладчиков. К ноябрю 2025 года компания не смогла привлекать новые средства для выплат и прекратила деятельность.

cointelegraph1 ч. назад

SEC и CFTC подали в суд на Goliath Ventures из-за криптопирамиды на $400 млн

cointelegraph1 ч. назад

FlightAware отзывает иск против Kalshi через день после подачи

Компания FlightAware, занимающаяся отслеживанием полетов в реальном времени, добровольно отозвала иск против платформы прогнозных рынков Kalshi всего через день после его подачи. Иск, поданный в Окружной суд США Южного округа Нью-Йорка, обвинял Kalshi в использовании торгового наименования и данных FlightAware для проведения рынков прогнозов об отменах рейсов, что, по мнению истца, являлось нарушением торговой марки и недобросовестной конкуренцией. Примечательно, что после подачи иска Kalshi изменила формулировки в своих контрактах, заменив название «FlightAware» на «Primary Source Agency» и добавив отказ от одобрения или аффилированности. Хотя быстрая отмена иска может указывать на внесудебное урегулирование, ни одна из компаний публично не прокомментировала ситуацию. Этот случай происходит на фоне более широкого правового противостояния вокруг прогнозных рынков в США. Комиссия по торговле товарными фьючерсами (CFTC) настаивает на своей исключительной юрисдикции в этой сфере и даже использовала чрезвычайные полномочия, чтобы заблокировать попытку властей штата Нью-Йорк ограничить деятельность Kalshi. Компания также сталкивается с исками от регуляторов других штатов, что ставит её в сложное положение между федеральными и государственными требованиями.

cointelegraph1 ч. назад

FlightAware отзывает иск против Kalshi через день после подачи

cointelegraph1 ч. назад

Внимание: Крупный инвестор совершил огромную продажу альткоина на сумму 33 миллиона долларов! Цена падает

Согласно данным блокчейна, крупный инвестор Uniswap перевел 9,295 млн токенов UNI (на сумму около 33,46 млн долларов) на кошелек Coinbase Prime. Этот инвестор ранее фиксировал прибыль во время роста цены UNI, например, после внедрения механизма переключения комиссий в ноябре прошлого года. Текущая транзакция совпала с падением цены UNI примерно на 8%, хотя прямая связь с продажей не подтверждена. Параллельно известный крупный игрок Мачи Биг Бразер понес убытки около 2,5 млн долларов из-за ликвидации двух своих длинных позиций по Ethereum, открытых с высоким кредитным плечом. Однако вскоре после этого он открыл новую длинную позицию по ETH на сумму около 4,6 млн долларов с эффективным кредитным плечом примерно 25x.

cryptonews.ru2 ч. назад

Внимание: Крупный инвестор совершил огромную продажу альткоина на сумму 33 миллиона долларов! Цена падает

cryptonews.ru2 ч. назад

Если бы Ethereum не перешел с PoW на PoS: несостоявшаяся игра

**Резюме** Если бы Ethereum не перешёл с механизма консенсуса Proof-of-Work (PoW) на Proof-of-Stake (PoS) в 2022 году, его развитие могло бы пойти по совершенно иному пути. Сегодня, когда вычислительные мощности GPU стали стратегическим ресурсом в эпоху ИИ, сохранившаяся PoW-инфраструктура Ethereum — миллионы GPU-майнеров — теоретически могла бы сформировать крупнейшую в мире распределённую сеть вычислений. Это позволило бы экосистеме занять уникальную позицию на рынке децентрализованных ИИ-сервисов, подобных облачным решениям. Однако у сохранения PoW была бы и обратная сторона. Сеть столкнулась бы с постоянным высоким уровнем инфляции (около 13 000 ETH в день против ~3 000 ETH после перехода на PoS) и продажами со стороны майнеров, что создавало бы постоянное давление на курс ETH. Кроме того, PoW мог бы стать структурным ограничением для масштабируемости, затрудняя реализацию таких современных решений, как Rollups, и повышая общие энергозатраты, что осложнило бы институциональное внедрение. Таким образом, исторический выбор Ethereum был не просто техническим обновлением, а стратегической ставкой. PoW потенциально открывал путь к созданию «цифрового товара» с мощной вычислительной сетью. PoS, пожертвовав этой возможностью, дал сети более низкую инфляцию, эффективность капитала и гибкость для становления глобальной расчетной инфраструктурой. Вопрос сегодня не в том, какой путь был лучше, а в том, сможет ли выбранный путь PoS помочь Ethereum захватить значительную долю стоимости в развивающихся сферах DeFi, RWA и цепочек ИИ.

marsbit2 ч. назад

Если бы Ethereum не перешел с PoW на PoS: несостоявшаяся игра

marsbit2 ч. назад

Торговля

Спот
活动图片