Karpathy dit qu'il faut encore dix ans, mais cette voie est déjà bondée

marsbitPublié le 2026-08-10Dernière mise à jour le 2026-08-10

Résumé

L'apprentissage continu (Continual Learning) est devenu l'un des concepts les plus chauds en IA, visant à permettre aux modèles de langue (LLM) d'apprendre de nouvelles tâches et connaissances après leur déploiement, sans oublier ce qu'ils ont appris auparavant. Le principal défi est l'« oubli catastrophique », où la mise à jour des paramètres du modèle pour de nouvelles connaissances érode ses capacités antérieures. L'article présente plusieurs approches pour résoudre ce problème : 1. **Mémoire externe** : Stocker les nouvelles connaissances dans des bases de données externes (comme MemGPT, Letta) et les récupérer via des systèmes de mémoire d'agent ou des wikis structurés (comme le projet LLM Wiki de Karpathy). C'est sûr mais ne permet pas une véritable internalisation. 2. **Ingénierie du contexte** : Faire évoluer le contexte d'entrée lui-même, comme dans l'ACE (Agentic Context Engineering), qui utilise un « playbook » mis à jour de manière incrémentielle grâce à l'auto-réflexion sur les succès et les échecs. 3. **Post-formation continue** : Adapter les poids du modèle via un finetuning continu (par ex., LoRA) tout en luttant contre l'oubli. Des méthodes comme l'auto-distillation (SDFT) permettent au modèle d'apprendre de nouvelles compétences sans trop oublier les anciennes. 4. **Pré-formation continue** : Continuer l'entraînement préliminaire du modèle sur de nouveaux corpus, bien que cela soit coûteux et risque l'oubli. 5. **Nouvelles approches radicales** : Des i...

Ces derniers temps, nous avons relaté de nombreuses startups et recherches visant l'apprentissage continu, comme *Mind Lab publie en continu les dernières avancées de LoRA, un nouveau paradigme pour l'« apprentissage continu » des grands modèles émerge*, *Dire adieu aux chaînes du KV Cache, comprimer le long contexte dans les poids, l'apprentissage continu des grands modèles est-il prometteur ?*, *ICML 2026 | Repousser les limites ! L'Université de HK propose la première architecture d'apprentissage continu adaptée à 300+ tâches, résolvant le problème de l'oubli*, *Harness, qui permet à DeepSeek de s'auto-évoluer ! L'auteur de LlamaFactory open-source un nouvel outil : créer automatiquement des Agents pour 0.2 yuan*, *Quand « devenir plus grand » n'est plus la seule voie, un autre modèle national est open-sourcé*...

Oui, assez dense. « L'apprentissage continu » est également en train de devenir l'un des mots-clés que nous rencontrons le plus souvent. Et cela révèle aussi un jugement maintes fois répété.

En octobre 2025, Andrej Karpathy a déclaré dans le podcast de Dwarkesh Patel : Les grands modèles actuels « n'ont pas d'apprentissage continu. Vous ne pouvez pas lui dire quelque chose et espérer qu'il s'en souvienne. » Il estimait que combler ces déficits cognitifs prendrait encore environ dix ans. Deux mois plus tard, il a placé cette phrase dans un contexte plus large dans sa rétrospective annuelle : L'essor des capacités des modèles en 2025 provenait principalement de l'apprentissage par renforcement avec récompense vérifiable (RLVR), mais dans toute la stack technologique des LLM, la mémoire, la perception multimodale, l'apprentissage continu et la capacité à manipuler des ordinateurs restaient des points faibles évidents. « Nous avons des prototypes, mais pas encore d'agents intelligents utilisables comme collègues. »

L'apprentissage continu (Continual Learning, aussi appelé Apprentissage tout au long de la vie/Lifelong Learning) est ainsi devenu l'un des concepts les plus chauds de l'année écoulée.

Il désigne la capacité d'un modèle, après son déploiement, à absorber de manière continue de nouvelles tâches, de nouvelles connaissances et de nouvelles expériences, comme un humain, sans oublier ce qu'il a appris auparavant.

Cela semble aller de soi, mais c'est extrêmement difficile à réaliser, suffisamment difficile pour devenir l'os le plus dur sur la voie des « collègues IA ». Et la série de reportages ci-dessus montre que cette voie n'est plus une seule direction, mais plusieurs chemins divergents qui avancent simultanément.

Autour de la question de comment permettre aux modèles « d'apprendre en utilisant », les milieux académiques et industriels ont divergé au cours de l'année en plusieurs voies technologiques différentes. Certaines accrochent la mémoire à l'extérieur du modèle, d'autres réécrivent continuellement les poids, d'autres reprennent carrément le pré-entraînement, et de nouvelles approches encore tentent de redéfinir la notion même d'« apprentissage ». Cet article tente de déplier ces directions une par une, pour clarifier sur quoi chaque voie parie et où elle se bloque.

Commençons par clarifier : La difficulté n'est pas « d'apprendre », c'est « de ne pas oublier »

L'obstacle central de l'apprentissage continu a un nom spécifique : l'oubli catastrophique (catastrophic forgetting). Les connaissances des réseaux de neurones sont stockées dans des milliards de poids. Lorsque vous affinez (fine-tunez) un modèle avec de nouvelles données, mettant à jour ces poids, le modèle apprend la nouvelle tâche mais recouvre souvent la partie des paramètres qui porte ses anciennes compétences, entraînant une chute brutale des performances sur les tâches qu'il maîtrisait auparavant.

Schéma de l'oubli catastrophique. Lorsqu'un réseau de neurones profond artificiel est entraîné séquentiellement sur deux tâches, il oublie rapidement et complètement la première tâche pendant l'entraînement de la seconde.

Ce phénomène a été largement étudié à l'ère des petits modèles, mais avec les LLM, de nouveaux problèmes apparaissent. Le benchmark TRACE, spécialisé dans l'évaluation de l'apprentissage continu des LLM, a découvert que l'affinage continu d'un modèle déjà aligné (RLHF) ne lui fait pas seulement oublier les anciennes tâches, mais nuit également à ses capacités générales et à son suivi d'instructions. En d'autres termes, enseigner une nouvelle chose au modèle peut avoir pour prix qu'il devienne globalement plus stupide et moins obéissant.

Précisément parce que modifier directement les poids est si risqué, « l'apprentissage continu » s'est divisé en plusieurs écoles. Leur divergence fondamentale réside en fait dans les différents compromis faits sur les questions « modifier ou non les poids » et « où stocker les nouvelles connaissances ».

Accrocher la mémoire à l'extérieur du modèle

L'idée la plus directe et la plus rapidement déployable est : ne pas toucher du tout aux poids du modèle, stocker les nouvelles connaissances dans une base de données externe au modèle, et les récupérer dans le contexte lorsque nécessaire. Cette voie a évolué depuis le RAG (Retrieval-Augmented Generation) pour devenir aujourd'hui un domaine à part entière : la mémoire des agents (Agent Memory).

Le travail représentatif est MemGPT (dont l'entreprise derrière s'appelle désormais Letta). Il compare la gestion du contexte d'un LLM à la gestion de la mémoire d'un système d'exploitation, en distinguant le « contexte de travail » limité et le « stockage externe » plus vaste, permettant au modèle de décider lui-même quoi charger dans le contexte et quoi archiver, comme un OS planifie la mémoire.

Suivant cette idée, plusieurs systèmes se sont développés avec des accents différents : Mem0 se concentre sur l'accès à la mémoire à long terme de qualité production, scalable ; Zep ajoute au retrieval un graphe de connaissances temporel pour traiter le raisonnement temporel entre sessions ; A-MEM s'inspire de la méthode de prise de notes Zettelkasten, étiquetant chaque souvenir avec des tags structurés et les reliant automatiquement aux anciennes entrées pertinentes, rendant le retrieval plus adapté au contexte.

Karpathy lui-même mise sur cette direction. Il souligne à plusieurs reprises que l'avenir n'a pas besoin d'une mémoire de type « disque dur plus gros », mais d'un « noyau cognitif » (cognitive core, qu'il estime suffisant avec un ou deux milliards de paramètres) couplé à un ensemble de mémoires externes structurées qui croissent de manière exponentielle par elles-mêmes.

Sur la base de cette idée, il a publié sur GitHub un modèle appelé « LLM Wiki » : au lieu d'utiliser à chaque requête le RAG pour extraire des blocs de texte brut, l'agent compile activement les données en une base de connaissances continuellement mise à jour et interconnectée, qu'il interroge ensuite.

Le document LLM Wiki de Karpathy a déjà recueilli près de 45 000 étoiles et a été forké plus de 9 000 fois.

Letta elle-même a élevé ce concept à la proposition de « l'apprentissage continu dans l'espace des tokens ». Ils soulignent que la pratique actuelle par défaut est « d'abord ajouter, puis résumer », c'est-à-dire d'empiler les expériences brutes jusqu'à ce que le contexte déborde, puis de les compresser en résumé. Cela a deux défauts : l'ajout repousse tout le travail de représentation au moment de l'inférence, obligeant à retraiter les logs bruts à chaque propagation avant ; et le résumé est destructeur et abrupt, les détails importants disparaissent sans prévenir. Le pari de Letta est que les souvenirs appris dans l'espace des tokens auront à l'avenir plus de valeur que les poids du modèle lui-même.

Les points forts de cette direction sont la sécurité, le contrôle, l'interprétabilité ; les modifications erronées peuvent être supprimées à tout moment. Le point faible est qu'elle n'« internalise » pas réellement les connaissances dans le modèle, devant toujours passer par la porte étroite du retrieval et du contexte. Une fois la bibliothèque de souvenirs gonflée, la précision du retrieval et son coût deviennent des goulots d'étranglement.

Laisser le contexte évoluer lui-même en « manuel de stratégie »

Un pas en avant par rapport à la mémoire externe est une catégorie d'idées plus raffinées : ne pas modifier les poids, mais faire évoluer continuellement le contexte d'entrée du modèle lui-même. C'est ce qu'on appelle l'ingénierie de contexte (Context Engineering).

En octobre 2025, ACE (Agentic Context Engineering), proposé par Stanford, SambaNova et UC Berkeley, en est un représentant. Il traite le contexte comme un « manuel de stratégie » (playbook) en constante croissance, entretenu par trois rôles spécialisés : le Générateur (Generator) produit des traces de raisonnement, le Réflecteur (Reflector) extrait des leçons spécifiques des succès et échecs, et le Conservateur (Curator) organise ces leçons en mises à jour incrémentielles structurées, les fusionnant dans le manuel.

ACE cherche à résoudre deux travers courants des méthodes similaires. Le premier est la « préférence pour la brièveté » (brevity bias) : lorsque l'on demande à un LLM de réécrire continuellement le contexte, il tend à compresser et à perdre les détails du domaine. Le second est l'« effondrement du contexte » (context collapse) : la réécriture répétée fait progressivement perdre les détails.

ACE évite ces deux points en utilisant des modifications incrémentielles petites (delta updates) plutôt que de réécrire des sections entières. Selon les données de l'article, ACE améliore les performances des agents de 10,6 % par rapport à la base, le raisonnement financier de 8,6 %, tout en réduisant la latence d'adaptation d'environ 86,9 % ; sur le classement AppWorld, en utilisant un modèle open-source plus petit, DeepSeek-V3.1, avec ACE, le score moyen peut égaler celui de l'agent de production IBM CUGA basé sur GPT-4.1.

Il est à noter qu'ACE insiste sur sa capacité à fonctionner sans supervision annotée ; il s'appuie sur les signaux de rétroaction naturellement générés lors de l'exécution (par exemple, si le code fonctionne ou génère une erreur) pour guider la réflexion et l'organisation. Cela le relie au récit plus large des « agents apprenant de leur propre expérience ».

Post-entraînement continu : modifier les poids, mais intelligemment

La mémoire externe et l'ingénierie de contexte évitent les risques de modification des poids, mais évitent aussi l'internalisation réelle des connaissances. Un autre groupe de chercheurs pense qu'à long terme, certaines connaissances et compétences doivent finalement être gravées dans les paramètres pour être suffisantes. C'est le post-entraînement continu (Continual Post-training), divisé principalement en phases comme l'affinage continu par instructions, l'alignement continu des préférences, etc.

John Schulman de Thinking Machines a donné une vision hiérarchique : il compare l'apprentissage aux catégories psychologiques de l'apprentissage moteur, de la mémoire épisodique et de la mémoire procédurale, estimant que l'apprentissage en contexte continuera à gérer les tâches d'apprentissage à court terme, tandis que l'affinage paramétrique (y compris des méthodes comme LoRA) se superposera, particulièrement adapté aux tâches nécessitant une plus grande capacité et une véritable absorption des connaissances — lorsque la fenêtre temporelle est longue et que l'apprentissage en contexte devient insuffisant, l'affinage paramétrique l'emporte.

L'ennemi numéro un de cette voie reste l'oubli catastrophique, et une solution intéressante récente provient de Tinker de Thinking Machines.

Tinker est leur premier produit lancé en octobre 2025, une API d'affinage basée sur LoRA, qui abstrait la complexité de l'entraînement distribué, n'exposant que des primitives de bas niveau comme forward_backward, optim_step, permettant aux chercheurs de se concentrer sur les données et les algorithmes.

Sur l'apprentissage continu, ils promeuvent une recette appelée Self-Distillation Fine-Tuning (SDFT) : l'idée centrale est que l'affinage supervisé ordinaire est « hors stratégie » (off-policy), le modèle étant forcé d'imiter des tokens qu'il ne générerait pas lui-même, érodant ainsi ses anciennes capacités à chaque nouvelle compétence apprise ; SDFT laisse le modèle servir de son propre enseignant, apprenant de nouvelles compétences à partir de démonstrations sans oublier les anciennes. Une startup appelée Trajectory a déjà fait de Tinker l'infrastructure centrale de sa plateforme d'apprentissage continu.

Au passage, Tinker utilise LoRA plutôt que l'affinage complet, ce qui a aussi un avantage pragmatique : plusieurs tâches d'affinage peuvent partager le même pool de calcul, diluant les coûts. Cela explique aussi pourquoi « l'apprentissage continu en tant que service » devient une activité commerciale : transformer les mises à jour fréquentes du modèle en une API appelable à la demande est une tentative actuelle de l'industrie.

Re-pré-entraînement et pré-entraînement continu

Si le post-entraînement consiste à intervenir sur la « surface » du modèle, le pré-entraînement continu (Continual Pre-training, CPT) revient aux fondations, en continuant le pré-entraînement du modèle avec de nouveaux corpus, pour l'adapter à de nouveaux domaines, de nouvelles langues ou des distributions de connaissances qui dérivent avec le temps. Par rapport au ré-entraînement complet en mélangeant anciennes et nouvelles données, le CPT s'appuie sur un modèle existant, ce qui est beaucoup plus économique en termes de calcul.

Ses utilisations typiques sont au nombre de trois : la dérive des connaissances dans le temps, l'extension à d'autres langues, l'adaptation à d'autres domaines. Mais le coût est tout aussi clair : de multiples études empiriques montrent de manière répétée que le pré-entraînement continu est coûteux en calcul et enclenche facilement l'oubli catastrophique des connaissances déjà acquises. C'est pourquoi le milieu académique cherche constamment des méthodes de pré-entraînement continu « sans relecture, sans étiquetage des tâches », essayant d'atteindre l'absence d'oubli à l'échelle des LLM.

Pour la grande majorité des entreprises, le coût de re-pré-entraîner complètement un modèle de pointe est irréalistement élevé, c'est ce que sous-entend la phrase de Karpathy : « les grands modèles ne conviennent pas à un ré-entraînement fréquent ». Ainsi, le « re-pré-entraînement » au sens strict est davantage une option pour les laboratoires de pointe, tandis que le pré-entraînement continu est un compromis plus réalisable.

Approches plus récentes : apprendre au modèle à s'auto-modifier

Les quatre directions précédentes tournent plus ou moins dans le cadre binaire « externe vs modification des poids ». Mais une série de nouveaux travaux apparus cette dernière année tente de sortir de ce cadre, en redéfinissant l'apprentissage lui-même.

Une idée est de laisser le modèle générer lui-même ses données d'entraînement et décider comment se mettre à jour.

Le SEAL (Self-Adapting Language Models) du MIT en est typique. Étant donné une nouvelle entrée, le modèle génère un « auto-édit » (self-edit) ; il s'agit d'une instruction en langage naturel expliquant comment restructurer l'information, avec quels hyperparamètres mettre à jour les poids, voire quels outils appeler pour l'augmentation de données ; puis le modèle s'affine en conséquence, formant une mise à jour durable des poids. Et la question de « quel auto-édit est efficace » est entraînée par une boucle externe d'apprentissage par renforcement, le signal de récompense étant la performance du modèle mis à jour sur les tâches en aval.

La version NeurIPS 2025 a en outre démontré que cette capacité d'auto-adaptation augmente avec la taille du modèle et, avec l'aide de l'apprentissage par renforcement, atténue l'oubli. Ses auteurs envisagent un type de modèle capable de juger en cours de raisonnement « si je dois apprendre maintenant », en distillant une chaîne de pensée unique en une capacité permanente.

Une autre approche plus radicale vient de l'apprentissage imbriqué (Nested Learning) de Google, publié à NeurIPS 2025. Son cœur est de reconsidérer un modèle comme un ensemble de problèmes d'optimisation imbriqués, multi-niveaux, chacun avec son propre « flux de contexte » et sa propre fréquence de mise à jour — l'architecture et l'algorithme d'optimisation sont unifiés dans cette perspective en différents niveaux d'une même chose.

Comme preuve de concept, ils ont créé une architecture d'auto-modification appelée Hope, qui étend l'architecture de mémoire à long terme Titans sur deux points : des niveaux d'apprentissage imbriqués sans limite supérieure, et un « système de mémoire continue » (CMS). En simplifiant, il ne s'agit plus d'une simple dichotomie mémoire court terme/long terme, mais d'un spectre complet de modules mémoire mis à jour à différentes échelles de temps.

Dans les expériences, Hope surpasse les Transformers standards et les modèles récurrents modernes en modélisation du langage, raisonnement à long contexte et tâches d'apprentissage continu. Il est intéressant de noter que des travaux ultérieurs ont introduit une phase de « sommeil » dans ce type d'architecture — comme les humains consolident leurs souvenirs pendant le sommeil, en laissant le modèle allouer des ressources de calcul entre les sessions actives, pour distiller les abstractions utiles dans la mémoire paramétrique plus durable.

À un niveau plus abstrait, il y a le récit de l'« Ère de l'expérience » (Era of Experience) proposé par David Silver et Richard Sutton.

Leur jugement est que dans les domaines clés comme les mathématiques, le code et la science, les connaissances extractibles des données humaines approchent de leur limite ; pour avancer, il faut que l'IA apprenne de manière continue de l'expérience qu'elle génère en interagissant avec l'environnement, formant une boucle fermée d'auto-alimentation en données. Ils considèrent AlphaProof de DeepMind en 2024 (qui a remporté une médaille à l'OIM via « une interaction continue avec des systèmes de preuve formelle ») comme le début de cette ère. Ce récit lie l'apprentissage continu à l'apprentissage par renforcement et à l'exploration autonome des agents, et soulève également une question non résolue : qui conçoit ces fonctions de récompense qui transforment les signaux bruts en guides utiles ?

Il existe aussi une direction voisine souvent confondue avec l'apprentissage continu, mais avec un objectif différent : l'édition des connaissances (Knowledge Editing). Représentée par ROME, MEMIT, elle localise et modifie des couches MLP stockant des faits spécifiques, permettant des mises à jour précises de faits uniques ou par lots sans nécessiter de ré-entraînement complet. Mais son objectif diffère en fait de l'apprentissage continu — l'édition des connaissances vise à couvrir précisément un fait donné ; dans des scénarios d'édition continue et à vie, des modifications paramétriques répétées interfèrent entre elles, accumulant progressivement de la « toxicité » conduisant à l'effondrement du modèle, ce qui a aussi suscité une série de méthodes comme WISE, AlphaEdit pour gérer spécifiquement l'édition séquentielle.

Conclusion

En étalant ces différentes directions côte à côte, on constate qu'elles sont en fait alignées le long d'un axe « où existe la connaissance ».

À l'extrémité, il y a la mémoire externe et l'ingénierie de contexte, où la connaissance existe entièrement en dehors du modèle, dans l'espace des tokens, sécurisée et contrôlable mais non véritablement internalisée. Au milieu, le post-entraînement continu et le pré-entraînement continu, où la connaissance est gravée dans les poids, offrant un plafond de capacité plus élevé mais confrontés à l'oubli catastrophique. À l'intérieur, le plus avant-gardiste, il y a les nouvelles approches d'auto-modification et d'auto-évolution, qui tentent de faire de l'action même d'« apprendre » une partie des capacités du modèle.

Une observation pragmatique est que ces directions ne sont probablement pas exclusives, mais collaboreront de manière hiérarchique. La vision hiérarchique de Schulman, l'idée de « noyau cognitif + mémoire externe » de Karpathy, disent essentiellement la même chose : confier les connaissances à court terme et changeantes au contexte et à la mémoire externe, les capacités à long terme nécessitant une sédimentation à l'affinage paramétrique, chacun son rôle. Le fait qu'ACE puisse évoluer sans supervision grâce à la rétroaction d'exécution, que SEAL utilise l'apprentissage par renforcement pour optimiser l'auto-édition, suggèrent tous deux une tendance commune : l'apprentissage continu du futur sera probablement dirigé par le modèle lui-même sur « quoi apprendre et comment ».

Revenons alors au jugement de Karpathy « encore dix ans » : l'apprentissage continu est-il résolu ? La réponse est probablement — pas encore, mais ce n'est plus un terrain vierge. L'obstacle central de l'oubli catastrophique n'a toujours pas été complètement surmonté, des méthodes comme SDFT, l'apprentissage imbriqué ne font que « l'atténuer » plutôt que l'« éliminer ». Le pur meilleur management du contexte plus l'affinage peuvent-ils résoudre l'apprentissage continu, ou faut-il de nouvelles idées radicales ? Cette question plus fondamentale, Schulman lui-même admet qu'elle n'a pas encore de réponse définitive.

Ce qui est certain, c'est que pendant la période 2025-2026, l'apprentissage continu est passé d'une « capacité manquante » souvent répétée à un champ de bataille actif, ayant divergé en plusieurs voies et commençant à voir des startups lancer des produits. Quelle voie parviendra la première à transformer le « collègue IA » d'un prototype en réalité, cela mérite d'être suivi de près.

Liens de référence

https://www.lesswrong.com/posts/qBsj6HswdmP6ahaGB/andrej-karpathy-on-llm-cognitive-deficits

https://karpathy.bearblog.dev/year-in-review-2025/

https://www.letta.com/blog/continual-learning/

https://arxiv.org/abs/2510.04618

https://arxiv.org/abs/2402.01364

https://thinkingmachines.ai/tinker/

https://arxiv.org/pdf/2604.05096

https://arxiv.org/pdf/2606.03979

Cet article provient du compte WeChat public « Machine Heart » (ID : almosthuman2014), auteur : Machine Heart de l'apprentissage continu, éditeur : Panda

Questions liées

QQuel est le principal obstacle auquel fait face l'apprentissage continu dans les grands modèles de langage ?

ALe principal obstacle est l'oubli catastrophique (catastrophic forgetting). Il s'agit du phénomène où, lors du réglage fin d'un modèle sur de nouvelles données, la mise à jour des paramètres du réseau neuronal pour apprendre une nouvelle tâche a tendance à écraser les connaissances précédemment acquises, entraînant une baisse drastique des performances sur les anciennes tâches.

QQuelles sont les deux grandes approches principales pour éviter de modifier directement les poids du modèle en apprentissage continu ?

ALes deux approches principales sont : 1) La mémoire externe (Agent Memory) : stocker les nouvelles connaissances dans une base de données externe et les récupérer via une recherche (RAG) en contexte quand c'est nécessaire. 2) L'ingénierie du contexte (Context Engineering) : faire évoluer et structurer le contexte d'entrée du modèle lui-même, comme un "manuel" qui s'enrichit, sans toucher aux paramètres.

QQuelle est la proposition d'Andrej Karpathy concernant l'avenir de la mémoire dans les systèmes d'IA ?

AAndrej Karpathy imagine un futur où le système repose sur un "noyau cognitif" (cognitive core) léger (de l'ordre de 1-2 milliards de paramètres) couplé à une mémoire externe structurée capable de croître et de s'organiser de manière autonome. Il a illustré cette idée avec le projet "LLM Wiki", où l'agent compile activement les informations en une base de connaissances liées et mise à jour, plutôt que de rechercher passivement des blocs de texte.

QQuelle est la méthode de réglage fin proposée par Tinker (Thinking Machines) pour atténuer l'oubli catastrophique ?

ATinker promeut une méthode appelée Auto-Distillation Fine-Tuning (SDFT). Le principe clé est de faire en sorte que le modèle serve de professeur à lui-même. Au lieu de l'obliger à imiter des tokens qu'il ne produirait pas naturellement (comme dans un réglage fin supervisé classique), le SDFT lui permet d'apprendre de nouvelles compétences à partir de démonstrations tout en préservant ses anciennes connaissances via un processus d'autodistillation.

QQuelle est l'idée centrale derrière les approches comme SEAL (MIT) ou Nested Learning (Google) en matière d'apprentissage continu ?

ACes approches radicales cherchent à redéfinir l'acte d'apprentissage lui-même en donnant au modèle la capacité de se modifier et de s'organiser de manière autonome. SEAL permet au modèle de générer ses propres instructions de mise à jour ("self-edit") et d'optimiser ce processus via un apprentissage par renforcement. Nested Learning envisage le modèle comme un ensemble hiérarchique et emboîté de problèmes d'optimisation avec des flux de contexte et des fréquences de mise à jour différentes, unifiant ainsi architecture et algorithme d'apprentissage.

Lectures associées

Quand « Odysseus » rencontre l'algorithme

La sortie mondiale en juillet 2026 de *The Odyssey* de Christopher Nolan, un film au budget de 250 millions de dollars tourné en IMAX sur pellicule, contraste avec la production pour 50 000 dollars par le studio Fountain0 d'un long métrage de 135 minutes généré intégralement par IA, *Odysseus: The Fall*. Le film de Nolan, réalisé à travers six pays avec des effets pratiques monumentaux, a engrangé plus d'un milliard de dollars de recettes, dopant les actions IMAX. Il incarne un modèle économique fondé sur la rareté, l'expérience en salle et des droits de propriété intellectuelle solides. À l'inverse, le film IA, bien que techniquement réalisable, reste une démonstration au modèle commercial incertain, confronté à des limites techniques (incohérences visuelles, manque de stabilité) et à l'absence de rareté et de protection copyright forte. L'analyse souligne que l'IA ne remplacera pas la création cinématographique traditionnelle de haut de gamme, mais transformera les étapes intermédiaires de production (prévisualisation, effets). Son vrai risque est d'assécher le financement des films à budget moyen, terrain d'apprentissage des futurs réalisateurs. Paradoxalement, la prolifération de contenus IA pourrait renforcer la valeur perçue du "réel" et du "fait-main" propre au cinéma traditionnel. Le duel oppose une logique d'efficacité algorithmique, visant l'optimal, à une logique d'expérience unique et scénique, recherchant l'exceptionnel. Le marché récompense, pour l'instant, cette dernière.

marsbitIl y a 4 mins

Quand « Odysseus » rencontre l'algorithme

marsbitIl y a 4 mins

Au troisième trimestre, le marché des bureaux à Pékin verra une reprise parallèle de la demande d’acquisition pour investissement et pour usage propre

**Résumé du marché des bureaux à Pékin au troisième trimestre : reprise parallèle des besoins d'investissement et d'acquisition pour usage propre** Au troisième trimestre, le marché des bureaux à Pékin connaîtra une reprise des transactions d'investissement et d'acquisition pour usage propre, portée par la croissance des industries de pointe (IA, semi-conducteurs, énergies nouvelles). **Demande de location : Transformations structurelles** La demande locative se polarise. Les industries de pointe en expansion génèrent de nouvelles demandes, tandis que les secteurs traditionnels réduisent leurs surfaces pour optimiser les coûts. Les locataires privilégient les quartiers d'affaires offrant des écosystèmes industriels et des politiques de soutien. L'adoption de l'IA, en améliorant l'efficacité, pourrait aussi réduire les besoins en espace pour certaines entreprises. Les loyers resteront globalement sous pression, mais le déclin se resserrera dans les quartiers attractifs pour les industries high-tech. **Marché des grandes transactions : reprise de l'activité** Le marché des transactions importantes (142 milliards de yuans au T2) est stimulé par deux facteurs : les investisseurs ciblant des actifs à revenus stables dans des zones technologiques (ex. : acquisition de DH3 à Zhongguancun pour 6,1 milliards de yuans), et les entreprises de haute technologie acquérant des immeubles pour leur siège social. Le prix moyen de vente a augmenté de 24% au T2, reflétant cette dynamique. **Conseils stratégiques pour le T3 2026 :** * **Pour les locataires :** Privilégier les projets de qualité adaptés à l'image de l'entreprise (ex. : quartier de Guomao). Les grands locataires peuvent négocier des conditions avantageuses. * **Pour les propriétaires :** Se transformer en prestataires de services pour soutenir les locataires (réseautage, financement) et proposer des offres de renouvellement proactives. * **Pour les acquéreurs :** * **Investisseurs :** Cibler des immeubles avec un taux d'occupation stable (>90%) dans des quartiers technologiques comme Zhongguancun. * **Utilisateurs finals (industries de pointe) :** Rechercher des immeubles avec un bon potentiel de rénovation dans des zones à fort accompagnement industriel, possiblement à un prix avantageux. **Contexte du T2 2026 :** Le loyer moyen effectif a baissé à 197 yuans/m²/mois (-2,7%), avec un taux de vacance élevé à 16,3%. Les quartiers de Zhongguancun et Wangjing-Jiuxianqiao ont attiré de fortes demandes des industries de pointe.

marsbitIl y a 11 mins

Au troisième trimestre, le marché des bureaux à Pékin verra une reprise parallèle de la demande d’acquisition pour investissement et pour usage propre

marsbitIl y a 11 mins

Analyse de la note de Bank of America : L'indicateur Bull & Bear grimpe à 9.7, le filet de sécurité de liquidité et les élections de mi-mandat forment la contradiction centrale du marché

L'indicateur Bull & Bear de Bank of America est monté à 9.7, son plus haut depuis 2021, signalant un extrême d'optimisme et approchant un signal de vente. La semaine dernière, les flux ont été importants : 529 milliards de dollars vers le cash, 329 milliards vers les actions et 231 milliards vers les obligations. La banque identifie une contradiction centrale sur le marché : l'intention des autorités de soutenir les conditions financières (comme l'a montré une intervention concertée sur les devises) contraste avec les risques politiques et les signaux de surchauffe. Les flux sont divergents. Si les entrées dans les actions et les obligations restent fortes, les secteurs technologiques et semi-conducteurs ont enregistré leurs premières sorties hebdomadaires depuis six semaines. Face à cette situation, la stratégie recommandée par Bank of America est un "repli ou une rotation" estival : se retirer des actifs risqués ou se tourner vers des secteurs défensifs (consommation de base), des actifs de duration (REITs, petites capitalisations) et le dollar américain. Le rapport souligne que l'élection de mi-mandat aux États-Unis constitue la plus grande variable macroéconomique du second semestre, pouvant remodeler le récit de marché. Parallèlement, l'écart de crédit (credit spread) des hyperscalers de l'IA continue de s'élargir, nécessitant une vigilance. Bien que le filet de sécurité de la liquidité limite les baisses, l'indicateur Bull & Bear à 9.7 suggère que le potentiel de hausse est largement intégré dans les prix. Les prochaines données sur l'emploi seront cruciales pour anticiper la tonalité de la politique monétaire de la Fed.

marsbitIl y a 15 mins

Analyse de la note de Bank of America : L'indicateur Bull & Bear grimpe à 9.7, le filet de sécurité de liquidité et les élections de mi-mandat forment la contradiction centrale du marché

marsbitIl y a 15 mins

La première attaque quantique du monde de la crypto ressemblera à une brèche inexpliquée : fondateur de Quantus

Le premier signe de l'informatique quantique brisant la cryptographie moderne pourrait être une vague de piratages inexpliqués de portefeuilles crypto, et non un vol spectaculaire des bitcoins de Satoshi Nakamoto, explique Christopher Smith, fondateur de Quantus. Un ordinateur quantique suffisamment puissant pourrait dériver une clé privée d'une clé publique visible sur la blockchain, permettant de dérober des fonds sans compromettre les systèmes internes d'un portefeuille ou d'un exchange, ne laissant ainsi aucune trace forensique évidente. Si la crainte initiale se porte souvent sur les actifs dormants de Satoshi (évalués à 63 milliards de dollars), la première cible pourrait être des systèmes militaires ou des clés administratives critiques, comme celle permettant d'émettre l'USDT de Tether, dont le piratage pourrait déstabiliser le marché. D'autres experts estiment que des portefeuilles chauds d'exchanges, moins surveillés, seraient des cibles plus probables et discrètes. Les prévisions concernant la date de cet événement hypothétique ("Q-day") sont incertaines. Des avancées récentes en algorithmes quantiques, boostées par l'IA, ont réduit les ressources nécessaires pour casser la cryptographie à courbe elliptique. Certains, comme Smith, estiment qu'il y a 50% de chances que cela arrive d'ici 2028, tandis que d'autres penchent pour le début des années 2030. Face à cette menace, la migration des blockchains vers des signatures post-quantiques est déjà en cours et considérée comme urgente.

cointelegraphIl y a 15 mins

La première attaque quantique du monde de la crypto ressemblera à une brèche inexpliquée : fondateur de Quantus

cointelegraphIl y a 15 mins

Trading

Spot
活动图片