# Données d'entraînement Articles associés

Le Centre d'actualités HTX fournit les derniers articles et analyses approfondies sur "Données d'entraînement", couvrant les tendances du marché, les mises à jour des projets, les développements technologiques et les politiques réglementaires dans l'industrie crypto.

Nouvel entretien avec Fei-Fei Li : les humains non plus n'apprennent pas uniquement à partir de données réelles

Dans une récente interview, Fei-Fei Li, fondatrice de World Labs, discute de l'acquisition de SceniX et de la vision de l'entreprise pour l'intelligence spatiale. World Labs vise à faire de l'intelligence spatiale - la capacité de l'IA à comprendre, raisonner et interagir dans des espaces physiques ou virtuels - la nouvelle frontière de l'IA. Les robots sont considérés comme la première pierre de touche pour concrétiser cette vision. Le défi central identifié est le manque crucial de données d'entraînement et d'évaluation pour les robots. Pour libérer la loi de l'échelle (scaling law), World Labs et SceniX misent sur une approche "real-to-sim-to-real". Cette méthode consiste à créer des jumeaux numériques d'environnements physiques, alignés et réalistes, pour générer des données synthétiques à grande échelle. La plateforme de simulation offre un contrôle total, une sécurité et une efficacité impossibles dans le monde réel, permettant l'entraînement et l'évaluation accélérés des systèmes robotiques. L'acquisition de SceniX, une startup spécialisée dans la simulation pour robots fondée par l'ancien post-doctorant de Li, Yunzhu Li, comble les compétences de World Labs. Ensemble, ils développent une infrastructure logicielle neutre, compatible avec divers modèles d'IA et morphologies robotiques (bras manipulateurs, robots mobiles...). Cette infrastructure durable est conçue pour former des robots robustes, d'abord pour des environnements semi-structurés (entrepôts, restaurants) avant de viser à long terme les environnements non structurés (foyers). Les intervenants soulignent que la simulation est essentielle pour le raisonnement contrefactuel et l'exploration d'états impossibles à tester en réel. Ils adoptent une approche pragmatique, combinant modèles physiques et apprentissage, et visent des clients concrets dans des secteurs verticaux comme preuve de concept. L'objectif à deux ans est de démontrer que leur plateforme répond efficacement aux besoins d'automatisation de premiers clients industriels.

marsbitIl y a 1 h

Nouvel entretien avec Fei-Fei Li : les humains non plus n'apprennent pas uniquement à partir de données réelles

marsbitIl y a 1 h

The DATA Foundation se lance pour s'attaquer au goulot d'étranglement des données d'entraînement de l'IA, un marché de plusieurs milliards de dollars

**La Fondation DATA est lancée pour résoudre le goulet d'étranglement multi-milliardaire des données d'entraînement de l'IA** Palo Alto, États-Unis – Story se rebaptise La Fondation DATA et lance le Réseau DATA, avec une intégration phare de Kled AI, enregistrant 1,5 milliard de données contribuées par les utilisateurs. La Fondation présente également Trace, la première couche d'audit publique à grande échelle pour le consentement, les licences et la provenance des données. La transition vers DATA répond à un défi critique : les données d'entraînement pour l'IA représentent la catégorie de propriété intellectuelle la plus précieuse et la moins résolue. Les laboratoires d'IA de pointe sont confrontés à un goulet d'étranglement de plusieurs milliards de dollars, l'Internet étant épuisé pour le scraping. Les données restantes sont soit coûteuses, soit juridiquement non documentées. Le Réseau DATA fournit l'infrastructure essentielle pour une IA de confiance. Son intégration avec Kled, la plus grande place de marché de données humaines sur adhésion, apporte transparence et auditabilité. Parallèlement, Trace, la plateforme d'audit publique, génère des reçus immuables pour chaque contribution, permettant aux laboratoires de vérifier la légitimité des jeux de données en quelques secondes et d'assurer une compensation en amont pour les contributeurs. Le projet Poseidon, incubé par Story et soutenu par a16z, nettoie et prépare les données brutes pour les modèles d'IA. Son application contributrice Numo, désormais entièrement sur DATA, intègre des milliers de contributeurs dans l'économie de l'IA via des paiements en temps réel. Le jeton $IP migre vers $DATA au ratio de un pour un. La Fondation DATA vise à créer un réseau de bout en bout qui prouve l'origine des données du monde réel, les licencie et rémunère ceux qui les créent.

TheNewsCrypto06/25 22:00

The DATA Foundation se lance pour s'attaquer au goulot d'étranglement des données d'entraînement de l'IA, un marché de plusieurs milliards de dollars

TheNewsCrypto06/25 22:00

Pourquoi la théorie de l'« eau et électricité » de Sam Altman a déclenché une controverse sur les droits d'auteur

Sam Altman, PDG d'OpenAI, a comparé l'intelligence artificielle future à une "utilité publique", comme l'eau ou l'électricité, que les gens achèteraient à la consommation (par token). Bien que ce récit vise à attirer des investissements en infrastructures, il a déclenché une controverse sur les droits d'auteur. Les critiques soulignent une différence fondamentale : les services publics traditionnels créent de nouvelles infrastructures, tandis que l'entraînement des modèles d'IA repose massivement sur des données (textes, œuvres d'art, code) collectées sur internet, souvent sans autorisation ni compensation pour leurs créateurs. Ce modèle de "matière première gratuite, produit vendu" est contesté. De plus, la tarification par token s'éloigne des principes d'un service public universel. Contrairement à un prix régulé et uniforme pour l'électricité, la tarification des tokens est variable, discriminante et définie unilatéralement par les fournisseurs, visant à maximiser les revenus. Juridiquement, le "fair use" protège encore souvent les entreprises d'IA. Cependant, leurs propres achats de données sous licence (comme les accords d'OpenAI avec Reddit) sapent l'argument d'un usage totalement libre et gratuit. En conclusion, si l'IA devient une infrastructure, elle n'est pas encore une "utilité publique". Trois failles persistent : la question non résolue de la propriété des données d'entraînement, un modèle de tarification éloigné du service universel, et l'absence de cadre de gouvernance publique. Une véritable infrastructure nécessiterait des mécanismes équitables de répartition des bénéfices pour les créateurs.

marsbit05/27 10:07

Pourquoi la théorie de l'« eau et électricité » de Sam Altman a déclenché une controverse sur les droits d'auteur

marsbit05/27 10:07

Dans le domaine de la génération de vidéos par IA, « Bien en avance » devient réalité

L'intelligence artificielle chinoise en génération vidéo est désormais considérée comme « bien en avance » sur ses concurrents américains, selon un article largement relayé. Des modèles comme Seedance 2.0 de ByteDance, Kling 3.0 de Kuaishou et HappyHorse d'Alibaba dominent les classements d'évaluation internationaux, devançant des outils comme Sora d'OpenAI ou Veo 3 de Google. Cette avance s'explique par plusieurs atouts structurels. Premièrement, les entreprises chinoises disposent d'un réservoir de données vidéo de très haute qualité, issues de leurs propres plateformes (TikTok/Douyin, Kuaishou). Ces données, enrichies par les comportements naturels des utilisateurs (partages, achats, taux de visionnage), sont un avantage compétitif majeur et difficile à reproduire. Deuxièmement, la technologie a trouvé des débouchés commerciaux clairs et rentables en Chine : création de vidéos pour le e-commerce, publicités, et surtout, production de mini-séries générant du revenu via des placements de produits. Ce cycle vertueux « produit-données-ventes » est absent du marché américain. Cependant, des défis persistent. L'écart en matière de puissance de calcul (hardware) entre les États-Unis et la Chine se creuse, et les modèles de langage généraux américains (comme GPT-5.5) conservent une avance de près d'un an. De plus, les entreprises chinoises font face à des pressions sur les droits d'auteur, des coûts de calcul élevés qui remettent en cause la viabilité économique de l'accès libre, et doivent gérer une forte demande. En conclusion, si la Chine a pris une réelle avance dans ce domaine spécifique, elle doit continuer à innover pour transformer cet avantage technique en succès commercial durable.

marsbit05/21 04:41

Dans le domaine de la génération de vidéos par IA, « Bien en avance » devient réalité

marsbit05/21 04:41

活动图片