GitHub annonce qu'à partir du 24 avril, il utilisera par défaut les données des utilisateurs de Copilot pour entraîner ses modèles d'IA

marsbitPublié le 2026-03-26Dernière mise à jour le 2026-03-26

Résumé

GitHub a annoncé qu'à partir du 24 avril 2026, il mettra à jour sa politique de collecte de données pour utiliser les interactions des utilisateurs de Copilot (Free, Pro et Pro+) afin d’entraîner ses modèles d’IA. Les données collectées incluront les entrées-sorties des modèles, extraits de code, informations contextuelles, structure des dépôts et historiques de discussion. Mario Rodriguez, directeur des produits, a justifié cette décision par l’amélioration de la précision et de la sécurité des suggestions de code. Le mécanisme est activé par défaut : les utilisateurs concernés doivent désactiver manuellement l’option dans les paramètres de confidentialité pour éviter que leurs données ne soient utilisées. Cette approche a suscité des débats concernant la définition des dépôts privés et les droits sur les données. Les utilisateurs professionnels (Business, Enterprise) et éducatifs sont exemptés de cette mesure en raison de contraintes contractuelles. GitHub souligne que cette pratique est courante dans le secteur, suivant l’exemple de sociétés comme Anthropic, JetBrains et Microsoft. Cette évolution reflète une tendance plus large : face à la raréfaction des données publiques de qualité, les acteurs de l’IA se tournent vers les données d’interaction pour améliorer les performances des modèles. Elle marque également le virage de GitHub d’une plateforme de托管 open source vers un écosystème fermé d’entraînement de l’IA, tout en soulevant des questions cruciales sur la conform...

GitHub a récemment annoncé qu'à partir du 24 avril 2026, il mettrait à jour sa politique de gestion des dépôts de code, prévoyant d'utiliser les données d'interaction des utilisateurs pour entraîner ses modèles d'IA. Cette collecte de données couvre les utilisateurs de Copilot Free, Pro et Pro+, incluant spécifiquement les entrées et sorties des modèles, les extraits de code, les informations contextuelles, la structure des dépôts et les historiques de conversations.

Mario Rodriguez, directeur des produits de GitHub, a déclaré que l'introduction des données d'interaction vise à améliorer la précision et la sécurité des suggestions de code du modèle, affirmant que les tests préalables sur les données internes de Microsoft ont déjà significativement augmenté le taux d'acceptation des suggestions. Il est à noter que cette politique adopte un mécanisme « d'adhésion par défaut », les utilisateurs concernés devant désactiver manuellement l'option correspondante dans les paramètres de confidentialité pour se retirer, ce qui a suscité des discussions approfondies dans la communauté des développeurs sur la définition des dépôts privés et la propriété des données.

Actuellement, les utilisateurs de Copilot Business, Enterprise soumis à des clauses contractuelles, ainsi que les utilisateurs de la version éducation, ne sont pas concernés par ce changement. GitHub a souligné dans ses explications que cette mesure est conforme aux pratiques courantes de l'industrie, suivies par des grands noms comme Anthropic, JetBrains et Microsoft. Cependant, l'inclusion de code provenant de dépôts privés dans les ensembles d'entraînement remet en question la notion traditionnelle de « privé », même si GitHub affirme que son objectif est d'optimiser les flux de travail de développement.

D'un point de vue sectoriel, alors que les données de code public de haute qualité s'épuisent, les principaux fournisseurs d'IA se tournent de plus en plus vers l'exploitation de « données profondes » comme les données d'interaction privées pour rechercher des gains de performance des modèles. Ce changement de politique marque non seulement une nouvelle étape dans l'évolution de GitHub, passant d'une plateforme d'hébergement open source à un écosystème fermé d'entraînement d'IA, mais annonce aussi une nouvelle phase dans le domaine des outils d'IA pour développeurs, où la conformité des données et l'avancée des modèles sont en constante négociation.

Questions liées

QQuand GitHub commencera-t-il à utiliser par défaut les données des utilisateurs de Copilot pour former ses modèles d'IA ?

AGitHub commencera à utiliser par défaut les données des utilisateurs de Copilot pour former ses modèles d'IA à partir du 24 avril 2026.

QQuels types de données utilisateur seront collectés par GitHub pour l'entraînement de l'IA ?

ALes données collectées incluent les entrées et sorties des modèles, des extraits de code, des informations contextuelles, la structure des dépôts et les historiques de conversations.

QComment les utilisateurs peuvent-ils se désinscrire de cette collecte de données ?

ALes utilisateurs doivent se rendre manuellement dans leurs paramètres de confidentialité et désactiver l'option correspondante pour se retirer, car la politique utilise un mécanisme d'« inclusion par défaut ».

QQuels utilisateurs de Copilot sont temporairement exemptés de ce changement de politique ?

ALes utilisateurs de Copilot Business, Enterprise et les utilisateurs de la version éducationnelle sont temporairement exemptés en raison de contraintes contractuelles.

QQuelle est la raison principale avancée par GitHub pour justifier cette utilisation des données ?

AGitHub affirme que cela vise à améliorer la précision et la sécurité des suggestions de code du modèle, des tests internes chez Microsoft ayant déjà montré une augmentation significative du taux d'acceptation des suggestions.

Lectures associées

Interview avec un cadre de Robinhood : Les mèmes + les actions tokenisées sont une stratégie d'acquisition de clientèle en «haltère», toutes les lignes de produits génèrent des revenus à neuf chiffres

**Résumé :** L'interview de Johann Kerbrat, responsable des activités crypto et internationales de Robinhood, dévoile la stratégie de la plateforme trois semaines après le lancement de sa blockchain, "Robinhood Chain". Cette dernière, basée sur la technologie Arbitrum, enregistre déjà plus de 1,05 milliard de transactions et un volume hebdomadaire de 30 milliards de dollars sur ses DEX. La stratégie, qualifiée de "haltère", combine deux axes : les tokens memes (pour attirer la communauté DeFi et les market makers) et les actifs tokenisés du monde réel (RWA), comme les actions américaines, accessibles dans plus de 120 pays. L'objectif principal est d'amener les 27 millions de comptes financés de Robinhood sur la blockchain en simplifiant radicalement l'expérience utilisateur de la DeFi, par exemple en offrant des rendements via l'application principale sans que l'utilisateur n'ait à gérer un portefeuille privé. Kerbrat souligne une volonté de "fusion" entre la finance centralisée (CeFi) et décentralisée (DeFi). Il minimise la concurrence avec d'autres blockchains comme Base, estimant que l'enjeu est d'"agrandir le gâteau" en démocratisant l'accès aux actifs numériques plutôt que de se disputer des parts de marché. L'accent est mis sur le développement de produits financiers robustes (prêts, trading spot, contrats perpétuels) et sur l'expansion future vers d'autres classes d'actifs tokenisés (actions internationales, marchés privés). La priorité actuelle est l'adoption et l'expérience utilisateur, pas l'optimisation des revenus de la blockchain elle-même.

marsbitIl y a 30 mins

Interview avec un cadre de Robinhood : Les mèmes + les actions tokenisées sont une stratégie d'acquisition de clientèle en «haltère», toutes les lignes de produits génèrent des revenus à neuf chiffres

marsbitIl y a 30 mins

Rapport T3 de Fidelity : BTC, ETH et SOL continuent de former un fond. Jusqu'où ira ce marché baissier crypto ?

Rapport Q3 de Fidelity : BTC, ETH et SOL continuent de chercher un plancher. Jusqu'où ira ce marché baissier ? Le rapport signaux de Fidelity pour le Q3 2026 indique que le marché crypto est en phase de consolidation. Le NUPL pondéré (Net Unrealized Profit/Loss) est tombé à -0.01, signalant que le marché dans son ensemble est légèrement en perte latente. Seul le Bitcoin (BTC) reste en profit, compensant partiellement les pertes d'Ethereum (ETH) et de Solana (SOL). La dominance du BTC a atteint 68%, reflétant une aversion au risque et une concentration des capitaux sur l'actif le plus liquide. Les performances sur un an sont négatives : BTC -45%, ETH -37%, SOL -53%. Plusieurs indicateurs approchent des zones de capitulation historiques. Les flux nets des ETF spot sont largement sortants, avec un record de sorties en juin. Pour le Bitcoin, le NUPL à 0.09 et le "Yardstick" (ratio capitalisation/hashrate) proche de ses plus bas historiques sont considérés comme des signaux positifs à long terme, suggérant une sous-évaluation relative. Cependant, l'impulsion des prix (signal dynamique) reste négative. Ethereum affiche un NUPL profondément négatif à -0.43 (signal positif pour les rendements futurs historiques), mais son activité réseau et ses frais sont en baisse. Les transferts de stablecoins sur ETH dépassent la moyenne historique, montrant une utilité réelle. Solana présente le NUPL le plus faible à -0.72. Malgré la baisse des prix, ses indicateurs d'utilisation fondamentaux restent résilients, avec une activité sur chaîne stable et des transferts de stablecoins en croissance. En se basant sur les cycles de fond de 2018 et 2022 (~300 jours), la correction actuelle de 203 jours pourrait être aux deux tiers de son parcours. Octobre 2026 est un horizon temporel à surveiller, mais ne constitue pas une prédiction de point bas. Le rapport conclut que le marché est dans une phase de recherche de plancher, avec une préférence marquée pour le Bitcoin, et que des conditions de valorisation attractives pourraient émerger pour les investisseurs à long terme.

marsbitIl y a 37 mins

Rapport T3 de Fidelity : BTC, ETH et SOL continuent de former un fond. Jusqu'où ira ce marché baissier crypto ?

marsbitIl y a 37 mins

Trading

Spot
活动图片