GitHub thông báo từ ngày 24/4 sẽ sử dụng dữ liệu người dùng Copilot làm mặc định để huấn luyện mô hình AI

marsbitXuất bản vào 2026-03-26Cập nhật gần nhất vào 2026-03-26

Tóm tắt

GitHub vừa thông báo sẽ cập nhật chính sách từ ngày 24/4/2026, sử dụng dữ liệu tương tác người dùng để huấn luyện mô hình AI. Dữ liệu thu thập bao gồm đầu vào/đầu ra mô hình, đoạn mã, thông tin ngữ cảnh, cấu trúc kho lưu trữ và lịch sử trò chuyện từ người dùng Copilot Free, Pro và Pro+. Chính sách mặc định áp dụng cơ chế "opt-out", yêu cầu người dùng chủ động tắt tùy chọn trong cài đặt riêng tư nếu muốn không tham gia. GitHub khẳng định việc này nhằm nâng cao độ chính xác và bảo mật của gợi ý mã, đồng thời tuân thủ thông lệ ngành từ các công ty như Microsoft hay Anthropic. Tuy nhiên, người dùng doanh nghiệp, giáo dục và tổ chức theo hợp đồng không bị ảnh hưởng. Động thái này đặt ra tranh luận về quyền sở hữu dữ liệu và định nghĩa lại khái niệm "riêng tư" trong kho mã, đánh dấu xu hướng chuyển đổi từ nền tảng mã nguồn mở sang hệ sinh thái AI khép kín của GitHub.

GitHub gần đây đã thông báo sẽ cập nhật chính sách kho lưu trữ mã từ ngày 24/4/2026, với kế hoạch sử dụng dữ liệu tương tác người dùng để huấn luyện mô hình AI của họ. Phạm vi thu thập dữ liệu này bao gồm người dùng Copilot Free, Pro và Pro+, cụ thể bao gồm đầu vào/đầu ra mô hình, đoạn mã, thông tin ngữ cảnh, cấu trúc kho lưu trữ và lịch sử tương tác trò chuyện.

Giám đốc sản phẩm GitHub Mario Rodriguez cho biết, việc đưa vào dữ liệu tương tác nhằm nâng cao độ chính xác và tính bảo mật của các đề xuất mã từ mô hình, đồng thời khẳng định rằng việc thử nghiệm trước với dữ liệu nội bộ Microsoft đã cải thiện đáng kể tỷ lệ chấp nhận đề xuất. Đáng chú ý, chính sách này áp dụng cơ chế "tham gia mặc định", người dùng bị ảnh hưởng phải thủ công vào cài đặt quyền riêng tư để tắt tùy chọn liên quan nếu muốn thoát, điều này đã khơi lên cuộc thảo luận sâu rộng trong cộng đồng nhà phát triển về định nghĩa kho lưu trữ riêng tư và quyền sở hữu dữ liệu.

Hiện tại, người dùng Copilot Business, Enterprise bị ràng buộc bởi điều khoản hợp đồng và người dùng phiên bản giáo dục tạm thời không bị ảnh hưởng bởi thay đổi này. GitHub trong phần giải thích nhấn mạnh, hành động này phù hợp với thông lệ ngành phổ biến của các đại gia như Anthropic, JetBrains và Microsoft. Tuy nhiên, việc đưa mã từ kho lưu trữ riêng tư vào tập huấn luyện trên thực tế đã thách thức ranh giới khái niệm "riêng tư" truyền thống, ngay cả khi GitHub tuyên bố mục đích của họ là tối ưu hóa quy trình làm việc phát triển.

Xét từ góc độ ngành, khi dữ liệu mã nguồn công cộng chất lượng cao dần cạn kiệt, các hãng AI hàng đầu đang tăng tốc chuyển hướng sang khai thác các "dữ liệu sâu" như dữ liệu tương tác riêng tư để tìm kiếm lợi thế về hiệu suất mô hình. Sự thay đổi chính sách này không chỉ đánh dấu bước nghiêng xa hơn nữa của GitHub từ nền tảng lưu trữ mã nguồn mở sang hệ sinh thái huấn luyện AI khép kín, mà còn báo trước lĩnh vực công cụ dành cho nhà phát triển AI đang bước vào một giai đoạn mới của cuộc đấu giữa sự tuân thủ dữ liệu và sự tiến hóa của mô hình.

Câu hỏi Liên quan

QGitHub thông báo sẽ sử dụng dữ liệu người dùng Copilot để huấn luyện AI từ thời điểm nào?

AGitHub sẽ bắt đầu sử dụng dữ liệu người dùng Copilot để huấn luyện mô hình AI từ ngày 24 tháng 4 năm 2026.

QNhững loại dữ liệu nào của người dùng sẽ được GitHub thu thập để huấn luyện AI?

ADữ liệu thu thập bao gồm đầu vào/đầu ra mô hình, đoạn mã, thông tin ngữ cảnh, cấu trúc kho lưu trữ và lịch sử tương tác trò chuyện.

QNgười dùng có thể từ chối không cho GitHub sử dụng dữ liệu của mình không?

ACó, người dùng có thể từ chối bằng cách thủ công vào cài đặt quyền riêng tư và tắt tùy chọn liên quan, vì chính sách này mặc định là 'tự động tham gia'.

QNhóm người dùng Copilot nào không bị ảnh hưởng bởi thay đổi chính sách này?

ANgười dùng Copilot Business, Enterprise và phiên bản giáo dục hiện không bị ảnh hưởng bởi thay đổi này do các điều khoản hợp đồng.

QLý do GitHub đưa ra để biện minh cho việc thu thập dữ liệu người dùng là gì?

AGitHub tuyên bố việc thu thập dữ liệu tương tác nhằm mục đích cải thiện độ chính xác và tính bảo mật của các đề xuất mã từ mô hình AI, đồng thời phù hợp với thông lệ ngành của các công ty lớn.

Nội dung Liên quan

Chuyện gì xảy ra khi hai thợ đào tìm thấy khối trong cùng một giây? Cuộc đua "khối mồ côi" diễn ra như thế nào

Khai thác Bitcoin là một cuộc đua không có trọng tài theo dõi vạch đích theo thời gian thực. Một khối mới phải được lan truyền vật lý qua mạng toàn cầu trước khi tất cả các nút đồng ý về đỉnh chuỗi hiện tại. Nếu hai thợ đào tìm thấy các khối hợp lệ gần như cùng lúc, hai phiên bản cạnh tranh của chuỗi khối sẽ tồn tại trong thời gian ngắn. Cả hai đều hợp lệ theo quy tắc giao thức; sự khác biệt chỉ là thời gian và nút nào biết về khối nào trước. Bitcoin giải quyết tình huống này không phải bằng bỏ phiếu hay dựa trên ai tìm thấy trước, mà bằng nguyên tắc chuỗi nào tích lũy nhiều bằng chứng công việc (proof-of-work) hơn sẽ được tất cả các nút chấp nhận. Khối bị thua cuộc trở thành "khối mồ côi" (orphan block), bị loại khỏi chuỗi được công nhận. Phần thưởng và phí giao dịch của nó bị mất, nhưng các giao dịch bên trong thường được trả lại để đưa vào một khối trong tương lai. Thông thường, cuộc đua được giải quyết ngay sau một khối tiếp theo. Tuy nhiên, sự kiện hiếm hoi vào ngày 24 tháng 3 năm 2026 đã chứng kiến một cuộc phân tách hai khối giữa AntPool/ViaBTC và Foundry USA, khi Foundry cuối cùng tạo ra một chuỗi dài hơn và giành chiến thắng. Sự kiện này nhấn mạnh xu hướng tập trung sức mạnh băm, nơi các nhóm khai thác lớn có nguồn lực tốt hơn có lợi thế trong việc kết thúc các cuộc đua như vậy so với các thợ đào nhỏ. Mặc dù các cuộc đua cho một khối là tương đối phổ biến (khoảng 9,2% khoảng cách giữa các khối trong một mẫu phân tích là dưới 60 giây), nhưng chúng thường được giải quyết nhanh chóng và âm thầm. Các mạng chuyển tiếp độ trễ thấp như FIBRE đã giảm đáng kể độ trễ lan truyền, khiến các cuộc phân tách kéo dài hai khối trở nên cực kỳ hiếm. Sự nhàm chán của quy trình bình thường này thực ra lại chính là điểm then chốt cho tính ổn định của mạng lưới.

cryptonews.ru13 phút trước

Chuyện gì xảy ra khi hai thợ đào tìm thấy khối trong cùng một giây? Cuộc đua "khối mồ côi" diễn ra như thế nào

cryptonews.ru13 phút trước

AmericanFortress đề xuất sơ đồ bảo vệ ví tiền mã hóa trước các mối đe dọa lượng tử

Công ty AmericanFortress đã công bố bản thảo ZKPoSP, một sơ đồ mật mã bảo vệ ví xác định phân cấp (HD wallets) trước các cuộc tấn công lượng tử tiềm năng mà không cần thay đổi địa chỉ. Theo các tác giả, ZKPoSP cho phép giữ nguyên định dạng địa chỉ hiện có nhưng thay chữ ký cổ điển bằng bằng chứng không tiết lộ thông tin (NIZK). Họ cũng mô tả sơ đồ QBIP32 để tạo scalar ký, bằng chứng bền vững lượng tử riêng biệt và chain code trong một lần gọi hàm, áp dụng được cho các đường cong elliptic như secp256k1 và Ed25519. Bảo mật hậu lượng tử của sơ đồ được mô tả là giả định, dựa trên độ bền của hàm băm và chứng minh NIZK. Để hoạt động, các nút mạng phải hỗ trợ xác minh các bằng chứng này thay cho chữ ký tiêu chuẩn, điều mà Bitcoin, Ethereum hay Solana hiện chưa làm. AmericanFortress đã triển khai trên Rust với RISC Zero, thời gian tạo chứng minh khoảng 12-13 giây và xác minh khoảng 9-10 ms. Bối cảnh này diễn ra khi nhiều báo cáo và sáng kiến nhấn mạnh mối đe dọa lượng tử. Một báo cáo của Galaxy chỉ ra khoảng 7 triệu BTC (tương đương ~470 tỷ USD) có thể dễ bị tổn thương. Các liên minh như Bitcoin Security Consortium với sự tham gia của BlackRock, Coinbase, Fidelity và các công ty khác đã cam kết đầu tư 15 triệu USD để nghiên cứu bảo mật Bitcoin, bao gồm mật mã hậu lượng tử. Các nền tảng như Stellar, Algorand và Ethereum Foundation cũng đang nghiên cứu các giải pháp tương tự.

cryptonews.ru24 phút trước

AmericanFortress đề xuất sơ đồ bảo vệ ví tiền mã hóa trước các mối đe dọa lượng tử

cryptonews.ru24 phút trước

Những người dùng AI để 'nộp bài nhanh chóng' đang hủy hoại môi trường làm việc

"Những người sử dụng AI để 'nhanh chóng hoàn thành công việc' đang hủy hoại môi trường làm việc. Khi AI ngày càng phổ biến, một vấn đề mới nổi lên: mọi người có thể nhanh chóng tạo ra các báo cáo, kế hoạch hoặc bản trình bày trông có vẻ chuyên nghiệp nhưng thực chất trống rỗng, thiếu dữ liệu kiểm chứng, phân tích chuyên sâu và giá trị thực tế. Hiện tượng này được gọi là 'Workslop' - rác thải AI trong công sở. Nó không chỉ có chất lượng thấp mà còn chuyển chi phí công việc sang người khác: người tạo ra tiết kiệm vài giờ, trong khi người nhận phải mất hàng giờ để kiểm tra, sửa chữa và hiểu ý định thực sự. Các ví dụ trong bài viết minh họa rõ vấn đề: một kế hoạch dài nhưng đầy lỗi thực tế trở thành nhiệm vụ mới cho cả nhóm; báo cáo tuần tự động khiến sếp mất cả buổi để xác minh; phản hồi hiệu suất được AI 'làm đẹp' trở nên mơ hồ và vô dụng; cả nhóm sản xuất hàng đống tài liệu bằng AI nhưng không ai có thể chịu trách nhiệm cho các kết luận trong đó khi khách hàng chất vấn. Bài viết chỉ ra rằng AI thực chất đang khuếch đại thói quen làm việc của một người. Người làm việc nghiêm túc coi AI là trợ lý để xử lý thông tin, so sánh ý tưởng và kiểm tra biểu đạt, trong khi vẫn tự mình xác minh sự thật và đưa ra phán đoán. Ngược lại, người có thói quen đối phó sẽ ủy thác trách nhiệm cho AI và giao nộp kết quả thô đầu tiên. Tiêu chí đánh giá công việc không nên là tốc độ hoàn thành hay độ 'chuyên nghiệp' về hình thức, mà cần xem xét ba câu hỏi: Nó có cung cấp thông tin thực tế mới không? Nó có đưa ra những phán đoán rõ ràng không? Có ai sẵn sàng chịu trách nhiệm về kết quả này không? AI có thể hỗ trợ nhiều nhiệm vụ, nhưng nó không thể thay chúng ta hiểu bối cảnh thực tế, đưa ra phán đoán hay chịu trách nhiệm cho quyết định cuối cùng."

marsbit38 phút trước

Những người dùng AI để 'nộp bài nhanh chóng' đang hủy hoại môi trường làm việc

marsbit38 phút trước

Giao dịch

Giao ngay
活动图片