Il y a quelques instants, DeepSeek V4 a mis à jour DSpark, augmentant la vitesse d'inférence de 80 %

marsbitPublié le 2026-06-27Dernière mise à jour le 2026-06-27

Résumé

DeepSeek a annoncé une mise à jour majeure de son modèle DeepSeek-V4-Pro avec le lancement de DSpark, un nouveau cadre de décodage spéculatif (Speculative Decoding) open source, accompagné de l'infrastructure complète DeepSpec. Cette mise à jour, axée sur l'ingénierie et non sur les capacités fondamentales du modèle, vise à accélérer considérablement l'inférence des LLM en production. Le cœur de DSpark est l'introduction d'une **génération semi-autorégressive**. Cela combine la génération parallèle à haut débit d'un modèle "brouillon" léger avec une modélisation des dépendances entre tokens pour améliorer le taux d'acceptation. De plus, un système de **vérification planifiée par confiance et conscient du matériel** (Confidence-Scheduled Verification) évalue dynamiquement la probabilité que chaque token généré soit accepté par le modèle cible. Il adapte ainsi la longueur de vérification en temps réel pour optimiser l'utilisation des ressources GPU, notamment en charge élevée. Les résultats sont significatifs : face aux méthodes de pointe comme Eagle3 et DFlash, DSpark augmente la longueur moyenne de tokens acceptés de 26.7% à 30.9% et de 16.3% à 18.4% respectivement sur les modèles Qwen3. En déploiement réel, par rapport à la génération token par token précédente (MTP-1), **DSpark améliore la vitesse de génération pour l'utilisateur de 60% à 85% pour le modèle Flash et de 57% à 78% pour le modèle Pro**, à débit total constant. Le projet open source **DeepSpec** fournit une ...

Il y a quelques instants, DeepSeek V4 a effectué une mise à jour.

Il a introduit un nouveau cadre de décodage spéculatif (Speculative Decoding) nommé DSpark, et a rendu open source en parallèle la pile complète du cadre de décodage spéculatif DeepSpec qui le soutient.

DeepSeek-V4-Pro-DSpark n'est pas un modèle architectural entièrement nouveau, mais plutôt DeepSeek-V4-Pro doté d'un module de décodage spéculatif. L'accent de cette mise à jour porte sur la mise en œuvre technique et non sur une évolution des capacités intrinsèques du modèle.

DSpark a déjà été déployé sur les flux de trafic en ligne réels de DeepSeek-V4 (Flash et Pro), accélérant considérablement la vitesse d'inférence des grands modèles de langage (LLM).

Rapport technique : « DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation »

Lien vers le rapport technique : https://github.com/deepseek-ai/DeepSpec/blob/main/DSpark_paper.pdf

L'objectif central de DSpark est de résoudre les goulets d'étranglement de latence et de débit auxquels est confrontée l'inférence des LLM dans des environnements de production (en particulier dans des scénarios à forte concurrence). En bref, DSpark combine avec succès une « génération parallèle » à haut débit avec une « validation adaptative à la charge ».

Le décodage spéculatif est une technique qui accélère l'inférence des grands modèles de langage sans modifier leur distribution de sortie. L'idée principale est d'introduire un « modèle de brouillon » (draft model) léger, qui prédit plusieurs tokens candidats, puis de faire valider et accepter par lots ces candidats par le modèle cible (target model). Cela transforme la génération token par token séquentielle en une vérification par lots parallèle, réduisant considérablement la latence de bout en bout.

Sur cette base, l'innovation de DSpark réside dans l'introduction d'une architecture de génération semi-autorégressive (Semi-Autoregressive Generation) : elle conserve l'avantage du haut débit du modèle de brouillon parallèle, tout en ajoutant un module séquentiel léger qui modélise les dépendances entre les tokens à l'intérieur d'un bloc, afin d'atténuer le problème de la dégradation du taux d'acceptation que rencontre souvent le modèle de brouillon parallèle pour les positions ultérieures.

En outre, il y a la vérification planifiée par confiance avec conscience matérielle (Confidence-Scheduled Verification) : les approches précédentes de décodage spéculatif envoyaient souvent tous les tokens de brouillon générés pour validation de manière aveugle. En cas de charge système élevée, ces derniers tokens, très susceptibles d'être rejetés, gaspillaient sérieusement la précieuse puissance de calcul du traitement par lots. DSpark introduit une tête de confiance (Confidence Head) pour évaluer la probabilité de survie de chaque token. En combinaison avec un planificateur de préfixe conscient du matériel, le système peut, en fonction des caractéristiques de débit en temps réel du moteur, définir dynamiquement la longueur de validation optimale pour chaque requête, en allouant la puissance de calcul uniquement aux tokens ayant la meilleure récompense attendue.

Pour être déployé dans une infrastructure en ligne réelle, le planificateur de DSpark adopte un mécanisme asynchrone, compatible avec le « zéro-overhead scheduling » (ZOS) et la relecture continue de graphes CUDA. Il utilise les prédictions historiques des deux étapes précédentes pour décider de la longueur de troncature dynamique actuelle, masquant ainsi la latence de planification, évitant les pauses dans le pipeline GPU, tout en garantissant une restitution parfaite et sans perte de la distribution de sortie du modèle cible.

Dans des tests couvrant plusieurs domaines comme le raisonnement mathématique, la génération de code et les dialogues quotidiens, DSpark a largement surpassé les modèles autorégressifs (Eagle3) et les modèles de brouillon parallèles (DFlash) les plus avancés actuels. Par exemple, sur des modèles cibles de la série Qwen3 (4B, 8B, 14B), la longueur moyenne d'acceptation a été améliorée de 26,7 % à 30,9 % par rapport à Eagle3, et de 16,3 % à 18,4 % par rapport à DFlash.

Par rapport à la référence de production single-token précédemment déployée (MTP-1), tout en maintenant le même débit global, DSpark a augmenté la vitesse de génération pour les utilisateurs de 60 % à 85 % (modèle Flash) et de 57 % à 78 % (modèle Pro).

Outre DSpark, DeepSpec a également été rendu open source. Il s'agit d'une base de code complète pour entraîner et évaluer les modèles de brouillon pour le décodage spéculatif. C'est « l'infrastructure open source » qui porte cette solution ainsi que d'autres implémentations d'algorithmes de pointe, comprenant des outils de préparation de données, des implémentations de modèles de brouillon, du code d'entraînement et des scripts d'évaluation.

DeepSpec divise le flux global en trois phases : préparation des données, entraînement et évaluation. Les trois phases doivent être exécutées dans l'ordre, les sorties d'une phase servant d'entrées à la suivante.

Lors de la phase de préparation des données, il faut télécharger les données de prompts, regénérer les réponses en utilisant un moteur d'inférence sur le modèle cible, et construire un cache cible (target cache). Il est à noter qu'avec la configuration par défaut de Qwen/Qwen3-4B, le volume du cache cible peut atteindre environ 38 To ; une évaluation adéquate des ressources de stockage est nécessaire avant utilisation.

La phase d'entraînement peut être lancée via `bash scripts/train/train.sh`. Ce script appellera `train.py` et lancera un worker pour chaque GPU visible. Les utilisateurs peuvent choisir différentes configurations d'algorithmes et de modèles cibles dans le répertoire `config/` en spécifiant `config_path`. Le projet permet également d'ajuster les paramètres d'entraînement en modifiant `config_path`, `target_cache_dir`, ainsi qu'en utilisant `--opts` pour modifier un champ de configuration individuel.

En termes de matériel, la configuration et les scripts par défaut de DeepSpec sont conçus pour un environnement à un seul nœud avec 8 GPU. Si le nombre de GPU est inférieur, l'utilisateur doit réduire en conséquence le nombre de GPU visibles dans `CUDA_VISIBLE_DEVICES`.

La phase d'évaluation est lancée via `bash scripts/eval/eval.sh`. Le script d'évaluation utilisera le checkpoint du modèle de brouillon entraîné pour mesurer les acceptations sur plusieurs tâches de référence de décodage spéculatif. Les ensembles de données d'évaluation actuellement listés dans le projet incluent GSM8K, MATH500, AIME25, HumanEval, MBPP, LiveCodeBench, MT-Bench, Alpaca et Arena-Hard-v2, couvrant différents types de tâches comme le raisonnement mathématique, la génération de code, les capacités de dialogue et les questions-réponses générales.

En termes d'algorithmes, DeepSpec inclut actuellement trois modèles de brouillon : DSpark, DFlash et Eagle3. En ce qui concerne les familles de modèles cibles, le projet prend actuellement en charge Qwen3 et Gemma.

La mise en open source de DeepSpec intègre la pratique technique du décodage spéculatif, auparavant dispersée au sein de différentes équipes de recherche, en un ensemble standardisé d'outils reproductible et extensible. Pour les chercheurs et ingénieurs souhaitant accélérer l'inférence de leurs propres grands modèles, cela signifie qu'ils peuvent directement entraîner des modèles de brouillon personnalisés sur un cadre mature, en sautant une grande partie du travail de construction d'infrastructure de base répétitif.

Liens de référence :

https://github.com/deepseek-ai/DeepSpec/blob/main/DSpark_paper.pdf

https://github.com/deepseek-ai/DeepSpec

Cet article est issu du compte WeChat public « Machine Heart » (ID:almosthuman2014), auteurs : Zenan, Yang Wen

Questions liées

QQuel est le nom du nouveau cadre de décodage spéculatif introduit par DeepSeek V4 ?

ALe nouveau cadre de décodage spéculatif s'appelle DSpark.

QQuels sont les deux principaux concepts innovants de DSpark pour améliorer la vitesse d'inférence ?

ADSpark introduit deux concepts innovants : la génération semi-autorégressive et la vérification par ordonnancement basée sur la confiance avec conscience matérielle.

QDans quelle mesure DSpark a-t-il amélioré la vitesse de génération pour les modèles Flash et Pro par rapport à la référence MTP-1 ?

APar rapport à la référence MTP-1, DSpark a augmenté la vitesse de génération de 60% à 85% pour le modèle Flash et de 57% à 78% pour le modèle Pro.

QQuel est le nom du projet open-source publié avec DSpark qui fournit une infrastructure complète pour l'entraînement et l'évaluation des modèles de brouillon ?

ALe projet open-source publié avec DSpark s'appelle DeepSpec.

QQuelles sont les trois phases principales du processus de DeepSpec pour travailler avec les modèles de décodage spéculatif ?

ALes trois phases principales de DeepSpec sont : la préparation des données, l'entraînement et l'évaluation.

Lectures associées

La récente flambée du Bitcoin : bulle ou bulle saine ?

Le récent rallye du Bitcoin, qui l'a fait passer d'environ 63 500 $ à plus de 80 000 $, serait principalement soutenu par une forte demande au comptant, selon l'analyse de QCP Capital. Environ 2,8 milliards de dollars de flux nets sont entrés dans les ETF spot sur Bitcoin lors de cette hausse. Parallèlement, le volume des positions ouvertes sur les contrats à terme sur le Bitcoin a diminué et les taux de financement sont restés relativement bas, ce qui indique que la hausse des prix n'est pas largement alimentée par un effet de levier spéculatif agressif. Ces facteurs suggèrent une structure de marché potentiellement plus saine et durable. Sur le plan macroéconomique, l'environnement reste incertain malgré l'inflation de base stable aux États-Unis. Les marchés évaluent toujours une possibilité de hausse des taux par la Fed. Cependant, l'annonce du Trésor américain d'augmenter le plafond de son programme de rachat d'obligations à long terme (de 2 à au moins 4 milliards de dollars) a soutenu les actifs risqués comme le Bitcoin en faisant baisser les rendements obligataires et en affaiblissant le dollar. La performance financière robuste de Nvidia a également contribué à l'appétit pour le risque. QCP souligne que ce programme de rachat n'est pas un assouplissement quantitatif (QE), car il vise à améliorer la liquidité du marché obligataire sans étendre les réserves de la banque centrale. La question clé à court terme pour le Bitcoin sera de savoir si la forte demande au comptant se maintient.

cryptonews.ruIl y a 3 h

La récente flambée du Bitcoin : bulle ou bulle saine ?

cryptonews.ruIl y a 3 h

Cadre de Strive : Repenser la roue de la hausse du prix du Bitcoin

Un cadre de Strive explique que l'adoption du Bitcoin pourrait suivre une trajectoire en trois phases, semblable à la propagation d'une fissure par fatigue dans un métal. Dans une première phase de découverte, les rendements et la volatilité sont extrêmement élevés. Actuellement, le Bitcoin entre dans une deuxième phase de maturation, où les rendements et la volatilité diminuent conjointement. Cette baisse de la volatilité améliore le rendement ajusté au risque, permet aux investisseurs d'allouer plus de capitaux et fait du Bitcoin un collatéral plus attrayant. Cette amélioration des caractéristiques de l'actif ouvre la voie à une troisième phase potentielle : la monétisation pilotée par le système financier. Une volatilité plus faible signifie que les prêteurs peuvent accorder plus de crédit contre la même quantité de Bitcoin en collatéral, en toute sécurité. Cette expansion du crédit libellé en dollars, combinée à une allocation accrue de capitaux existants, pourrait créer un cercle vertueux : davantage d'achats font monter le prix, ce qui augmente la valeur du collatéral et permet encore plus d'emprunts. Ainsi, la tendance actuelle à la diminution des rendements pourrait n'être qu'un prélude. Si ce cycle capital-crédit prend de l'ampleur, la concurrence pour un bitcoin dont l'offre est fixe pourrait faire repartir les rendements à la hausse, faisant éventuellement sortir le prix de sa trajectoire "powertrend" historique établie. La pression s'exerce sur le système de crédit en dollars, et la "rupture" serait le moment où le prix du Bitcoin en dollars s'emballerait à nouveau.

marsbitIl y a 7 h

Cadre de Strive : Repenser la roue de la hausse du prix du Bitcoin

marsbitIl y a 7 h

Trading

Spot
活动图片