# Post-entraînement Articles associés

Le Centre d'actualités HTX fournit les derniers articles et analyses approfondies sur "Post-entraînement", couvrant les tendances du marché, les mises à jour des projets, les développements technologiques et les politiques réglementaires dans l'industrie crypto.

Wang Yunhe livre son premier modèle après avoir créé son entreprise

Après avoir quitté Huawei et fondé son entreprise, Wang Yunhe présente son premier modèle d'IA, NeoHorse, par sa société Primelaw. Spécifiquement conçu pour les agents IA, NeoHorse (versions 4B et 9B) vise à optimiser l'appel d'outils, la lecture de retours d'environnement, la correction d'erreurs et l'exécution de tâches. Le modèle est entraîné à partir de données uniques générées par le système de routage "Harness" de l'entreprise, qui orchestre l'exécution de tâches par plusieurs modèles. Ces données capturent les succès, les échecs et les ajustements en cours de route, offrant un matériel d'apprentissage riche sur l'efficacité des agents. Primelaw ne vise pas à concurrencer les grands modèles de fond, mais à affiner les capacités des agents pour des tâches spécifiques et à optimiser les coûts de calcul via un routage intelligent. La société articule sa stratégie autour d'une boucle vertueuse : son produit OpenSquilla (harness open-source), son API TokenRhythm (agrégation de modèles), ses services aux entreprises et désormais NeoHorse. L'idée est que les données d'exécution des agents alimentent l'entraînement de nouveaux modèles, qui à leur tour améliorent les performances du système, une approche qualifiée d'**amélioration récursive de soi (RSI)** à un stade précoce. Ce cycle pourrait constituer un avantage distinctif face à la concurrence croissante des fournisseurs de modèles qui développent leurs propres infrastructures d'agents. Le succès dépendra de la capacité de Primelaw à générer des données de haute qualité, à maintenir les gains de performance du modèle sur plusieurs itérations et à convertir son écosystème open-source en revenus durables.

marsbit09/08 09:32

Wang Yunhe livre son premier modèle après avoir créé son entreprise

marsbit09/08 09:32

DeepSeek V4 version officielle est arrivée, les nouvelles capacités émergent, le combat pour le roi du rapport qualité-prix est lancé

DeepSeek a annoncé le lancement en version bêta publique de l'API DeepSeek-V4-Flash. Malgré une architecture nettement plus légère (284 milliards de paramètres totaux, 13 milliards activés contre 1600/49 pour la version Pro), cette nouvelle version démontre des performances en matière d'Agent (exécution autonome de tâches) qui rivalisent avec celles de la V4-Pro en version préliminaire d'il y a trois mois, selon des tests de référence. L'amélioration clé proviendrait principalement d'un "post-entraînement" avancé et d'optimisations au niveau du cadre d'exécution (Harness), suggérant que la qualité de l'entraînement et les méthodes l'emportent parfois sur la simple augmentation de la taille du modèle. Cette mise à jour stratégique positionne DeepSeek sur le marché en pleine croissance des Agents IA, en proposant une solution à haut rapport performances/coût. Le modèle prend également en charge le format d'API Responses d'OpenAI et est adapté pour des tâches de génération de code, marquant une volonté d'interopérabilité et de concurrence directe sur des terrains établis. Cette annonce intervient peu après un premier tour de table record de plus de 500 milliards de yuans pour DeepSeek, soulignant les attentes fortes quant à sa trajectoire technique et commerciale dans la course à l'IA, où la capacité Agent devient un critère déterminant.

marsbit07/31 08:05

DeepSeek V4 version officielle est arrivée, les nouvelles capacités émergent, le combat pour le roi du rapport qualité-prix est lancé

marsbit07/31 08:05

L'ingénieur en post-entraînement d'OpenAI, Weng Jiayi, propose une nouvelle hypothèse paradigmatique pour l'IA agentique

L’ingénieur post-entraînement d’OpenAI, Weng Jiayi, explore une nouvelle approche pour l’IA agentique appelée « Heuristic Learning » (HL). Contrairement aux méthodes d’apprentissage par renforcement profond qui améliorent les modèles via l’ajustement des paramètres du réseau neuronal, le HL utilise un agent de codage (comme Codex) pour écrire, exécuter, déboguer et modifier itérativement des stratégies sous forme de code logiciel explicite (règles, contrôleurs, etc.). Dans des expériences sur Atari Breakout, l’agent a développé une stratégie purement Python atteignant le score théorique maximal de 864 points. Testé sur 57 jeux Atari, le HL a montré une efficacité d’échantillonnage initiale élevée, rivalisant avec des algorithmes comme le PPO dans certains jeux, mais révélant des limites dans des tâches complexes nécessitant une planification à long terme (ex: Montezuma’s Revenge). Les avantages potentiels du HL incluent une meilleure interprétabilité, une auditabilité pour les systèmes critiques (robotique, autonome), et une intégration aux flux d’ingénierie logicielle existants pour l’apprentissage continu. Weng Jiayi envisage une synergie future où les réseaux neuronaux gèrent la perception et l’estimation d’état, le HL gère les règles, la sécurité et la mémoire, et un agent LLM supervise les retours et les améliorations. Cette approche suggère qu’avec des agents de codage suffisamment puissants, l’expérience pourrait être encapsulée dans du code maintenable plutôt que dans des poids de modèles opaques.

marsbit05/11 00:26

L'ingénieur en post-entraînement d'OpenAI, Weng Jiayi, propose une nouvelle hypothèse paradigmatique pour l'IA agentique

marsbit05/11 00:26

活动图片