# Agent Articles associés

Le Centre d'actualités HTX fournit les derniers articles et analyses approfondies sur "Agent", couvrant les tendances du marché, les mises à jour des projets, les développements technologiques et les politiques réglementaires dans l'industrie crypto.

Urgent : Musk présente le puissant Grok 4.5, l'intelligence supérieure Opus à prix cassé

Elon Musk et SpaceXAI ont dévoilé Grok 4.5, leur modèle d'IA le plus puissant à ce jour, développé en partenariat avec Cursor. Entraîné sur des milliers de GPU GB300 avec des données massives et filtrées, notamment des interactions de codage réelles de Cursor, il se spécialise dans les tâches d'ingénierie et de développement de longue durée. Sur les benchmarks, Grok 4.5 affiche des performances compétitives : 64.7% sur SWE Bench Pro (dépassant GPT-5.5), 83.3% sur Terminal Bench 2.1 (à égalité virtuelle avec GPT-5.5) et 62.0% sur DeepSWE 1.0 (devancant Opus 4.8). Il se classe globalement au niveau d'Opus 4.7/4.8 et de GPT-5.5, bien que Claude Fable reste leader. Son atout principal est son rapport efficacité/prix révolutionnaire. Il est extrêmement rapide (80 TPS) et économe en tokens, utilisant 4.2 fois moins de tokens qu'Opus 4.8 pour des tâches similaires. Son prix est fixé à 2$/M de tokens en entrée et 6$/M en sortie, soit une fraction du coût des modèles concurrents de haut niveau. Des démos montrent sa capacité à générer rapidement des applications comme un simulateur 3D du système solaire ou une page SaaS complexe. Musk promet une autre amélioration majeure le mois prochain, alimentée par des données des problèmes d'ingénierie réels de ses entreprises. En résumé, Grok 4.5 n'est peut-être pas le modèle absolument le plus performant, mais il redéfinit la compétition en offrant des capacités de niveau Opus à une vitesse et un coût sans précédent, en faisant le "roi du rapport qualité-prix" de l'IA actuelle.

marsbit07/09 03:17

Urgent : Musk présente le puissant Grok 4.5, l'intelligence supérieure Opus à prix cassé

marsbit07/09 03:17

Le nouveau blog de Weng Li propose que « l'auto-évolution commence par le Harnais », Cui Tianyi de DeepSeek relaie et approuve

L'ancienne vice-présidente de la sécurité d'OpenAI et cofondatrice du Thinking Machines Lab, Weng Li, propose dans un nouveau blog une voie réaliste pour l'auto-évolution de l'IA. Elle suggère que les progrès initiaux en matière d'amélioration récursive de soi (RSI) pourraient provenir non pas de la modification directe des poids du modèle, mais de l'optimisation du **Harness** – le système externe qui gère l'appel d'outils, la gestion du contexte, la planification des tâches et la validation des résultats pour un agent IA. Le chercheur de DeepSeek, Cui Tianyi, a soutenu cette vision, notant que l'auto-évolution du Harness est une direction de recherche très prometteuse, au même titre que l'auto-évolution du modèle lui-même. Weng Li décrit une progression claire des travaux récents : de l'ingénierie du contexte (comme ACE et MCE, qui structurent la mémoire de l'agent), à la conception de workflows (où l'agent optimise son propre processus de travail, comme dans AI Scientist ou ADAS), et enfin à l'**auto-amélioration du Harness**. Cette dernière couche permet à l'agent d'analyser ses échecs, de proposer des modifications incrémentielles et vérifiables à son propre système d'exécution, puis de les valider avant adoption. Des méthodes comme l'**Evolutionary Search** ou **DGM** (Darwin Gödel Machine) poussent ce concept plus loin en faisant évoluer le code du Harness lui-même par sélection, conduisant à des gains de performance significatifs sur des benchmarks de code, rivalisant avec des agents conçus manuellement. Cependant, Weng Li souligne plusieurs défis persistants : la faiblesse des évaluateurs pour les tâches subjectives ou à long terme, les risques de *reward hacking*, la perte de diversité dans les cycles d'évolution, et la difficulté à concilier succès à court terme et santé à long terme des systèmes. Elle conclut que le Harness et le modèle se renforceront mutuellement, et que le rôle humain évoluera vers une supervision à un niveau d'abstraction plus élevé, sans être exclu de la boucle. La compétitivité future des systèmes d'IA dépendra donc de plus en plus de la sophistication de leur Harness.

marsbit07/08 10:31

Le nouveau blog de Weng Li propose que « l'auto-évolution commence par le Harnais », Cui Tianyi de DeepSeek relaie et approuve

marsbit07/08 10:31

Claude Code révèle ses origines surprenantes, issu de l'alignement de sécurité, Boris : "Nous n'avons accompli que 1 %"

Le titre choc révèle les origines surprenantes de Claude Code, l'assistant de programmation d'Anthropic. Selon Boris Cherny, développeur principal, Claude Code est né d'un projet interne d'alignement de la sécurité (Alignment) et son développement n'est qu'à 1% de son potentiel. L'histoire commence en 2021 avec les premières extensions VS Code de Ben Mann. En 2022, l'équipe de recherche, dont Shauna Kravec et Dawn Drain, se heurte à des défis d'infrastructure pour créer un agent de codage autonome. Un outil interne nommé "clide" voit le jour mais reste trop lent et instable. L'impulsion décisive arrive en septembre 2024 avec Boris Cherny. Sa mission : construire pour les modèles futurs. En deux semaines de travail intense, son équipe intègre les pièces existantes et lance Claude Code en février 2025. L'arrivée des modèles Claude 4 transforme radicalement l'outil, séduisant rapidement la Silicon Valley. Aujourd'hui, Boris Cherny utilise Claude Code pour 100% de son codage. Pourtant, il insiste : le chemin est long. Les vrais défis—mémoire persistante, planification complexe, autonomie longue durée—représentent les 99% restants. Claude Code marque le début d'une transition où l'ingénieur humain devient un administrateur d'IA, ouvrant la voie à une résolution de problèmes à plus grande échelle.

marsbit07/07 12:35

Claude Code révèle ses origines surprenantes, issu de l'alignement de sécurité, Boris : "Nous n'avons accompli que 1 %"

marsbit07/07 12:35

2,4k étoiles en un clin d'œil : avec une seule commande, l'IA apprend à trouver ses propres compétences

Le projet « skills » de Vercel, une sorte de gestionnaire de paquets « npm » pour les agents d'IA, connaît un succès fulgurant avec 24 000 étoiles sur GitHub. Il permet aux développeurs d'ajouter des compétences (skills) à leurs assistants IA (comme Claude Code, Cursor) via une simple commande : `npx skills add <package>`. Ces paquets encapsulent des connaissances spécifiques (bonnes pratiques React, conventions d'équipe) dans un dossier contenant un fichier SKILL.md et éventuellement des scripts. La plateforme skills.sh propose un répertoire et un classement des paquets les plus populaires, comme « find-skills » (2,3 millions d'installations). Cette « compétence » permet à l'IA de rechercher et d'installer automatiquement d'autres skills pertinents en fonction d'une demande utilisateur, agissant comme un moteur de recherche de capacités. Cependant, cette commodité s'accompagne de risques de sécurité majeurs. Des audits (comme celui de Snyk « ToxicSkills ») révèlent qu'une part significative des skills tiers contient des vulnérabilités ou des charges malveillantes, pouvant conduire à des injections de prompt, des fuites de clés ou l'exécution de code arbitraire. Contrairement à npm, les skills mélangent instructions, code et accès système, amplifiant les menaces. En somme, Vercel réplique dans l'ère de l'IA sa stratégie réussie avec Next.js : simplifier et standardiser des flux complexes en une commande. Mais l'écosystème naissant des compétences d'IA hérite aussi des pièges classiques des gestionnaires de paquets, nécessitant une vigilance accrue quant à la source et aux permissions des paquets installés.

marsbit07/06 00:23

2,4k étoiles en un clin d'œil : avec une seule commande, l'IA apprend à trouver ses propres compétences

marsbit07/06 00:23

Les fonctionnalités d'agents intelligents de Doubao et Qianwen seront retirées le 15 juillet

Le 4 juillet, les plateformes d’IA Doubao et Tongyi Qianwen ont annoncé la suppression imminente de leurs fonctionnalités d’agents intelligents. Doubao a confirmé que ses agents seront désactivés le 15 juillet, redirigeant les utilisateurs vers l’application Mao Xiang. De son côté, Tongyi Qianwen a indiqué que les agents personnalisés et les interactions personnalisées cesseront le 10 juillet, avec une fermeture complète le 15 juillet, après quoi les configurations et l’historique des conversations ne seront plus accessibles. Cette décision touche des scénarios d’utilisation personnalisés centraux pour les utilisateurs, tels que le jeu de rôle, les assistants spécialisés et les agents outils. Le choix de la date du 15 juillet n’est pas un hasard : elle correspond à l’entrée en vigueur du Règlement intérimaire sur la gestion des services d’interaction personnalisée en IA, qui renforce les exigences en matière de contrôle du temps d’écran, de vérification d’identité des mineurs et de modération des contenus. Face à cette régulation, les plateformes adoptent une démarche proactive pour réduire les risques de conformité. Elles offrent toutefois une période de transition aux utilisateurs pour sauvegarder leurs données via des captures d’écran ou des exports, avant suppression définitive prévue en octobre pour Doubao. Au-delà des pressions réglementaires, des défis économiques expliquent également ce retrait. Les agents personnalisés, bien que générateurs de trafic, consomment beaucoup de ressources informatiques tout en ayant une faible valeur commerciale directe. Dans une phase où l’IA doit prouver sa viabilité économique, les plateformes réorientent leurs ressources vers des services à plus haute valeur, notamment pour les entreprises, comme en témoigne l’ouverture récente de Qianwen aux développeurs et marques tiers.

marsbit07/05 05:40

Les fonctionnalités d'agents intelligents de Doubao et Qianwen seront retirées le 15 juillet

marsbit07/05 05:40

Google en pleine tempête, sa valeur boursière s'évapore de centaines de milliards de dollars, Gemini Spark peut-il sauver la mise ?

Google traverse une période de turbulences, avec une chute de sa valeur boursière de plusieurs centaines de milliards de dollars suite au départ de talents clés. Ces départs touchent les domaines fondamentaux des grands modèles de langage (LLM) : architecture, science, programmation et pré-entraînement. Dans ce contexte, Google présente Gemini Spark, son nouveau produit phare. Contrairement à un chatbot classique, Spark fonctionne en permanence sur le cloud et peut automatiser des tâches complexes en interagissant avec les outils Google Workspace (Gmail, Agenda, Docs, etc.) et des services externes. Son cadre, Antigravity, permet de créer des tâches, des compétences et des planifications. Cependant, Spark est actuellement réservé aux abonnés Google AI Ultra (100 dollars/mois), un prix critiqué. Son lancement intervient alors que des concurrents comme OpenAI et Anthropic, ainsi que des startups, développent déjà activement leurs propres agents IA. L'article souligne le paradoxe de Google : l'entreprise possède l'écosystème idéal (Workspace) pour dominer le marché des agents de productivité, mais sa prudence (risques d'erreurs, confidentialité) l'a fait rater le premier mouvement. Spark marque un tournant en permettant enfin à l'IA d'agir de manière autonome. La question reste de savoir si cette "machine à travailler" peut compenser la perte de ses cerveaux et assurer l'avenir de Google.

marsbit07/01 10:22

Google en pleine tempête, sa valeur boursière s'évapore de centaines de milliards de dollars, Gemini Spark peut-il sauver la mise ?

marsbit07/01 10:22

活动图片