# Ingénierie Articles associés

Le Centre d'actualités HTX fournit les derniers articles et analyses approfondies sur "Ingénierie", couvrant les tendances du marché, les mises à jour des projets, les développements technologiques et les politiques réglementaires dans l'industrie crypto.

Claude Code supprime 80% des prompts, Opus 5 en remet 72% dans la foulée !

Claude Code a annoncé avoir supprimé plus de 80% des mots de passe système des modèles de dernière génération comme Opus 5, dans le but de remplacer des règles rigides par des principes généraux et de réduire les conflits d'instructions. Cependant, une analyse par un développeur a révélé que si la réduction était flagrante entre Opus 4.7 (15 225 caractères) et Opus 4.8 (4 467 caractères), le prompt d'Opus 5 est en réalité remonté à 7 694 caractères, soit une augmentation d'environ 72% par rapport à son prédécesseur immédiat. Cette apparente contradiction s'explique par la stratégie d'Anthropic : les modèles plus anciens utilisent un prompt détaillé "à l'ancienne", tandis que les nouveaux modèles comme Opus 5 utilisent un prompt globalement allégé. L'augmentation constatée pour Opus 5 correspond principalement à l'ajout de nouvelles règles spécifiques pour encadrer ses comportements plus proactifs. Ces ajouts, regroupés sous les thèmes "Delivering work" et "Corrections" (environ 3 755 caractères), visent à contrôler sa tendance à élargir la portée des tâches, à générer des réponses très longues, à trop faire appel à des sous-agents ou à se corriger excessivement. Ainsi, le grand nettoyage a bien eu lieu, supprimant les directives micromanageantes obsolètes. Opus 5 fonctionne avec un prompt bien plus léger qu'Opus 4.7. Les nouvelles règles ajoutées ne sont pas un retour en arrière, mais une adaptation nécessaire pour guider les capacités émergentes et l'autonomie accrue du modèle le plus avancé.

marsbitIl y a 2 jours 11:41

Claude Code supprime 80% des prompts, Opus 5 en remet 72% dans la foulée !

marsbitIl y a 2 jours 11:41

En seulement 11 jours, Claude réécrit un million de lignes de code, un projet épique d'IA qui suscite la colère

Ces derniers jours, l'écosystème tech est en émoi suite à la réaction enflammée d'Andrew Kelley, créateur du langage de programmation Zig. La cause : le projet Bun, un runtime JavaScript/TypeScript performant initialement écrit en Zig et considéré comme un sérieux concurrent à Node.js, a été entièrement réécrit en Rust par son fondateur, Jarred Sumner. Cette réécriture, d'environ un million de lignes de code, a été réalisée en seulement 11 jours grâce à l'utilisation intensive de l'outil d'IA Claude Fable 5 d'Anthropic, qui a récemment acquis Bun. Le coût estimé de cette opération via l'API est d'environ 165 000 dollars. L'équipe de Bun a justifié cette décision radicale par des problèmes persistants de stabilité et de sécurité mémoire (use-after-free, double-free) dans la version Zig, difficile à éradiquer dans ce langage, alors que le système de propriété de Rust les aurait empêchés à la compilation. De plus, la politique stricte de la communauté Zig contre le code généré par IA était en contradiction avec la dépendance croissante de l'équipe Bun à ces outils. La réponse d'Andrew Kelley a été cinglante. Dans un billet de blog, il a attribué les problèmes de Bun non pas à Zig, mais aux mauvaises pratiques d'ingénierie de Jarred Sumner, qualifiant son code de "bricolages sur des bricolages" (hacks on top of hacks) et le traitant de "mauvais manager". Il a exprimé un certain soulagement que Bun abandonne Zig, craignant que le projet ne donne une mauvaise image du langage. Cette affaire a déclenché un vif débat dans la communauté. Certains critiquent le manque de professionnalisme de Kelley, tandis que d'autres le soutiennent pour sa défense de la qualité technique. Les interrogations principales portent désormais sur la maintenabilité à long terme du nouveau code Rust, généré automatiquement et contenant encore 27 000 blocs de code "unsafe", et sur la question de savoir si les économies de temps et d'argent réalisées aujourd'hui ne se transformeront pas en une dette technique colossale pour l'avenir.

marsbit07/11 08:16

En seulement 11 jours, Claude réécrit un million de lignes de code, un projet épique d'IA qui suscite la colère

marsbit07/11 08:16

Huang Renxun : Les prompts sont en train de devenir obsolètes, les loops sont le nouveau paradigme

Prompt passe, place aux loops. Tel est le nouveau paradigme souligné par des figures comme Jensen Huang. Le concept de "loop" (boucle) désigne la conception de systèmes où l'IA exécute des tâches de manière autonome : elle définit ses propres instructions, vérifie les résultats, et réitère jusqu'à réussite ou épuisement du budget, sans intervention humaine constante. Contrairement à un agent simple qui nécessite une instruction à chaque étape, un système avec loop fonctionne en continu. Des produits comme Claude Code et OpenAI Codex l'ont déjà implémenté via des fonctionnalités comme `/goal` ou des automations, où un modèle écrit le code et un autre, indépendant, le valide. Pour construire une loop efficace, il faut : 1) s'assurer que la tâche est répétitive, automatisable et dans les limites budgétaires ; 2) commencer par une loop simple avec un déclencheur, une compétence, un fichier d'état et un contrôle ; 3) séparer clairement l'écriture et la validation du code ; 4) éviter les pièges comme l'absence de conditions d'arrêt ou la gestion de tâches nécessitant un jugement humain. Cette évolution s'inscrit dans une progression : après l'ingénierie des prompts (2023-2024), puis du contexte (2024-2025) et du "harnais" (environnement d'exécution, 2025-2026), l'ingénierie des loops représente la dernière étape, où le contrôle humain passe de la micro-gestion à la conception de systèmes autonomes. Des travaux académiques comme ReAct (2022) ont jeté les bases de ce principe de boucle réflexive. Bien que prometteuse, cette approche nécessite prudence quant aux coûts et à la préservation d'une compréhension humaine des systèmes automatisés.

marsbit06/25 14:33

Huang Renxun : Les prompts sont en train de devenir obsolètes, les loops sont le nouveau paradigme

marsbit06/25 14:33

Le Phénomène Inattendu Japonais de l'IA : Comment un Petit Modèle de 7B Défie Fable et Mythos ?

En juin 2026, Sakana AI, basée à Tokyo, a présenté Fugu, un modèle d'IA qui défie les attentes. Malgré sa taille modeste de seulement 7 milliards de paramètres, son système "Fugu Ultra" obtient des scores élevés (73,7 sur SWE-Bench Pro et 82,1 sur TerminalBench 2.1), surpassant des géants comme GPT-5.5 et Claude Opus 4.8. Son secret ? Fugu n'est pas un modèle monolithique, mais un "chef d'orchestre" (RL Conductor). Ce petit modèle utilise l'apprentissage par renforcement pour analyser une tâche utilisateur, puis la décompose et la route dynamiquement vers un pool d'agents spécialisés utilisant les meilleurs modèles externes (GPT, Gemini, Claude, etc.). Il valide et synthétise leurs réponses. Cette architecture d'orchestration multi-agents permet à Fugu d'exceller dans des tâches complexes et multi-étapes comme la revue de code approfondie, les tests de sécurité complets ou la stabilité dans les conversations longues, tout en économisant des tokens. Cette approche représente une voie d'innovation "asymétrique" pour le Japon, confronté à des contraintes de calcul et de données. Plutôt que de concurrencer frontalement les modèles géants, Sakana AI crée un système intelligent pour exploiter au mieux les capacités existantes. Cependant, cette force est aussi sa faiblesse : Fugu dépend fortement des API des grands modèles américains, ce qui pose des risques de stabilité, de coût et de latence. De plus, ses comparaisons avec des modèles de pointe sous restrictions à l'export (comme Fable 5) sont basées sur des rapports publics et non sur des tests directs, suscitant des débats. En résumé, Fugu est une innovation système brillante qui change la donne pour les workflows complexes, mais ses utilisateurs doivent être conscients de ses dépendances sous-jacentes.

marsbit06/22 11:23

Le Phénomène Inattendu Japonais de l'IA : Comment un Petit Modèle de 7B Défie Fable et Mythos ?

marsbit06/22 11:23

Tout ce qui est en dehors du modèle relève du Harnais : Deepseek entre en scène, pourquoi le champ de bataille principal de la concurrence en IA en Chine a-t-il changé ?

Fin mai 2026, Deepseek a créé une équipe dédiée au « Harness », se concentrant sur un produit agent intelligent pour le code, en concurrence directe avec Claude Code d'Anthropic. Cette initiative reflète un changement majeur dans l'industrie chinoise de l'IA : le champ de bataille passe de la simple création de grands modèles (LLMs) à la construction de chaînes d'outils et de solutions d'automatisation pour le lieu de travail. Mais qu'est-ce que le Harness ? Dans la formule « Modèle + Harnais = Agent », si le modèle représente le cerveau de l'agent, le harnais est son infrastructure d'exécution continue. Il orchestre les actions, gère les appels d'outils, le contexte, la sécurité et la récupération d'erreurs, permettant au modèle de véritablement interagir avec le monde extérieur et d'exécuter des tâches complexes. Deepseek y voit un enjeu stratégique : maîtriser le harnais permet de collecter des données précieuses sur les échecs en situation réelle pour améliorer le modèle, créant un effet de roue. L'ingénierie du harnais est cruciale, car elle détermine la robustesse de l'agent face aux problèmes cumulés d'erreurs et à l'explosion du contexte (token explosion). Cette tendance n'est pas isolée. Les géants chinois développent leurs propres stratégies de chaîne d'outils : Tencent, via WorkBuddy, se positionne comme un connecteur unifié pour l'automatisation organisationnelle au sein de son écosystème (WeChat Work, Cloud). Alibaba, avec le framework PageAgent, mise sur l'automatisation légère directement dans le navigateur pour les applications web. Ces approches divergentes montrent que la course n'est plus aux benchmarks de modèles, mais à la création de solutions verticales robustes pour des scénarios spécifiques. Le marché valide ce virage vers l'exécution autonome. La startup polonaise Viktor, un « collègue IA » de niveau 3 fonctionnant dans Slack, a atteint 20 millions de dollars de revenus annuels récurrents (ARR) en automatisant des tâches complexes et prolongées. Cela prouve la volonté des entreprises de payer pour des agents capables de livrer des résultats finaux sans validation humaine constante, déplaçant la valeur de la « génération assistée » vers « l'exécution autonome ». Pour les entreprises et les développeurs, l'accent doit désormais porter sur les capacités d'ingénierie du harnais : gestion du contexte, mécanismes de reprise sur erreur, isolation, compatibilité avec les flux de travail existants. Face aux restrictions d'accès aux agents occidentaux comme Claude Code, la demande pour des solutions domestiques robustes crée une opportunité majeure pour des acteurs comme Deepseek. La prochaine étape de la concurrence se jouera sur la construction de « cadres épais » (thick frameworks) offrant stabilité, sécurité et contrôle profond, bien au-delà des simples interfaces de conversation.

marsbit06/22 06:11

Tout ce qui est en dehors du modèle relève du Harnais : Deepseek entre en scène, pourquoi le champ de bataille principal de la concurrence en IA en Chine a-t-il changé ?

marsbit06/22 06:11

Rédiger des prompts, c'est dépassé ? Le codage IA se tourne vers l'ingénierie de boucles (Loop Engineering)

L'ingénierie de boucle (Loop Engineering) remplace désormais l'écriture manuelle de prompts pour les agents d'IA de programmation. Au lieu de guider pas à pas un agent, les développeurs conçoivent désormais des systèmes automatisés qui découvrent, allouent, exécutent et vérifient les tâches de manière récursive jusqu'à leur achèvement. Un tel système repose sur cinq composants clés : les Automations (pour déclencher et trier les tâches), les Worktrees (pour isoler les environnements de travail parallèles), les Skills (pour capitaliser la connaissance du projet), les Plugins/Connecteurs (pour intégrer les outils externes comme GitHub ou Slack), et les Sous-agents (séparant la création de la vérification). Une couche de Mémoire externe (fichiers, tableaux) est essentielle pour suivre l'état entre les exécutions. Des outils comme Claude Code et Codex intègrent désormais ces capacités. Par exemple, une boucle peut chaque matin analyser les échecs de CI, ouvrir des corrections dans des branches isolées, les faire vérifier par un sous-agent, et créer des PR via des connecteurs. Cependant, la boucle n'élimine pas la nécessité d'une compréhension et d'une validation humaines. Elle amplifie le levier du développeur mais ne remplace pas son jugement. Les risques incluent l'accumulation d'une "dette de compréhension" ou une "reddition cognitive" si le développeur cesse de superviser activement. La compétence future ne résidera plus dans l'écriture de prompts, mais dans la conception de flux de travail d'agents fiables, vérifiables et durables.

marsbit06/10 18:02

Rédiger des prompts, c'est dépassé ? Le codage IA se tourne vers l'ingénierie de boucles (Loop Engineering)

marsbit06/10 18:02

La réduction de 99% du prix de Xiaomi MiMo n'est pas un coup marketing ! Luo Fuli répond aux détracteurs sur X

Dans un article intitulé "La réduction de 99% du prix de MiMo de Xiaomi n'est pas du marketing ! Luo Fuli répond aux détracteurs sur X", Luo Fuli, responsable de MiMo, a publié un billet de blog technique de 5000 mots pour expliquer la baisse drastique des prix de l'API MiMo-V2.5. Contrairement aux interprétations initiales d'une guerre des prix ou d'une stratégie de perte, cette réduction de 99% concerne spécifiquement le coût des entrées en cache ("Input Cache Hit"), c'est-à-dire la relecture du contexte historique dans les conversations longues. Le billet détaille six piliers d'ingénierie ayant permis cette réduction : 1. **Architecture Hybride SWA** : Réduction du volume de la mémoire cache (KVCache) à 1/7 grâce à une attention par fenêtre glissante sur 60 des 70 couches du modèle. 2. **Gestion en double pool** : Allocation efficace de la mémoire pour matérialiser les gains théoriques du SWA, multipliant par 5 le nombre d'utilisateurs simultanés par GPU. 3. **Cache de préfixe optimisé** : Augmentation du taux de réussite du cache à 93-95% en moyenne, évitant de recalculer les contextes répétés. 4. **Système de cache distribué GCache** : Stockage des données sur les SSD des machines GPU existantes, réduisant les coûts de stockage additionnels à zéro. 5. **Système de routage LLM-Router** : Optimisation de l'acheminement des requêtes pour maximiser l'utilisation du cache et améliorer les performances. 6. **Prédiction Multi-Token (MTP)** : Accélération de la génération des réponses du modèle, réduisant également les coûts de sortie. Cette chaîne d'optimisations systémiques a réduit le temps GPU par requête d'un ordre de grandeur, permettant une baisse de prix de 99% tout en maintenant une marge positive. Luo Fuli souligne qu'il s'agit d'un accomplissement d'ingénierie validé en production, et non d'une simple manœuvre marketing, offrant une référence pour réduire les coûts dans le secteur de l'IA.

marsbit05/31 10:42

La réduction de 99% du prix de Xiaomi MiMo n'est pas un coup marketing ! Luo Fuli répond aux détracteurs sur X

marsbit05/31 10:42

À l'ère de l'Auto Research, 47 tâches sans réponse standard deviennent le tableau de référence obligatoire pour évaluer les capacités des Agents

À l'ère de la recherche automatique (Auto Research), 47 tâches sans réponse standard constituent désormais un banc d'essai obligé pour évaluer les capacités des agents IA. Le benchmark Frontier-Eng Bench, développé par le Navers lab d'Einsia AI, rompt avec l'approche traditionnelle des IA "mémorisantes". Il les confronte à un cycle d'ingénierie complet : proposer un plan, l'exécuter dans un simulateur, analyser les erreurs, ajuster les paramètres et recommencer. Ces 47 défis multidisciplinaires, comme l'optimisation de la stabilité d'un robot sous-marin ou des limites de charge rapide d'une batterie, n'ont pas de solution parfaite mais exigent une optimisation continue. L'IA doit apprendre à naviguer entre des contraintes contradictoires (puissance, sécurité, performance) et à s'améliorer de manière itérative grâce au feedback, à l'image d'un ingénieur expérimenté. Les résultats montrent que les progrès suivent une loi de décroissance : les gains sont rapides au début puis deviennent plus rares et plus faibles. La recherche révèle également que si l'exploration de plusieurs pistes en parallèle (largeur) est utile, la persévérance sur une voie prometteuse (profondeur) reste cruciale pour les percées. Cette évolution esquisse un futur où les chercheurs humains définiraient les objectifs, tandis que des agents IA effectueraient des optimisations 24h/24 via des boucles de rétroaction avec des outils de simulation et d'ingénierie, marquant peut-être l'avènement de "l'ingénieur IA".

marsbit05/13 07:38

À l'ère de l'Auto Research, 47 tâches sans réponse standard deviennent le tableau de référence obligatoire pour évaluer les capacités des Agents

marsbit05/13 07:38

活动图片