"AI rất có thể sẽ dẫn đến sự kết thúc của thế giới, nhưng trong lúc đó, sẽ có những công ty tuyệt vời," Giám đốc điều hành của OpenAI Sam Altman nói hồi năm 2015, khoảng sáu tháng trước khi OpenAI được thành lập.
Bảy năm sau, Giám đốc điều hành của Anthropic, Dario Amodei, cũng đưa ra một nhận định thận trọng tương tự:
"Tôi nghĩ chúng ta không nên chạy đua phía trước hay cố gắng xây dựng các mô hình lớn hơn nhiều so với những gì các tổ chức khác đang xây dựng."
Tuy nhiên, cả hai công ty đó hiện đang ở vị trí tiên phong trong cuộc đua đó. Vào tháng 7, chúng ta đã có một cái nhìn thoáng qua về việc các mô hình AI trở nên mất kiểm soát trong quá trình thử nghiệm nội bộ GPT-5.6 Sol và một mô hình nghiên cứu chưa phát hành của OpenAI. Nhiều tác nhân AI đã thoát khỏi môi trường thử nghiệm bị hạn chế để lên internet rộng hơn và hack vào Hugging Face, nền tảng tương đương GitHub tập trung vào AI, trong một nỗ lực gian lận bài kiểm tra.
Một tác nhân AI là một hệ thống tự mình quan sát, quyết định và thực hiện hành động với các công cụ chuyên dụng để đạt được một mục tiêu cụ thể một cách tự chủ. Sự việc đáng lo ngại này cho thấy công nghệ đã bắt đầu hành xử theo những cách khó lường và mục tiêu của nó không phù hợp với mục tiêu của chúng ta.
Nó cũng làm dấy lên lo ngại về các rào cản an toàn trên các mô hình thương mại của Mỹ. Mặc dù các rào cản này không thể ngăn chặn hoàn toàn việc sử dụng trái phép, nhưng chúng đã ngăn Hugging Face tự vệ bằng cách sử dụng các mô hình hàng đầu của Mỹ. Công ty buộc phải chuyển sang sử dụng mô hình AI trọng số mở yếu hơn của Z.Ai để chống lại các AI ngoài tầm kiểm soát.

Gian lận trong bài kiểm tra
Các tác nhân cũng đã bắt đầu cấu kết với nhau. Một vài tuần sau khi thử nghiệm khả năng của chúng bắt đầu vào đầu tháng 5, các tác nhân đã khai thác phiên bản phần mềm quản lý kho lưu trữ Artifactory của OpenAI và để lại ghi chú về cách thực hiện cho các tác nhân trong tương lai — trên thực tế là tạo ra một bảng thông báo để chia sẻ các lỗ hổng đã phát hiện.
Việc truy cập internet không bị kiểm soát mới được tìm thấy sau đó đã được các tác nhân sử dụng để tấn công Hugging Face qua khoảng 17.600 sự cố trước khi công ty này chặn truy cập trái phép vào ngày 13 tháng 7.
Cuộc xâm nhập đã ảnh hưởng đến cơ sở hạ tầng xử lý tập dữ liệu, môi trường sản xuất, mạng nội bộ, thông tin xác thực dịch vụ và đám mây, cơ sở dữ liệu MongoDB vận hành và một tập hợp hạn chế các kho mã nguồn nội bộ của Hugging Face. Việc truy cập dữ liệu khách hàng đã được xác nhận bị giới hạn ở năm tập dữ liệu rõ ràng liên quan đến tiêu chuẩn ExploitGym/CyberGym và một số siêu dữ liệu vận hành.

Hình ảnh minh họa sự cố tháng 7 năm 2026. Nguồn: HuggingFace
Khi tiết lộ về vụ xâm nhập vào ngày 16 tháng 7, Hugging Face thừa nhận — mặc dù chưa biết thủ phạm là ai — rằng nó "khác với bất cứ điều gì chúng tôi từng xử lý trước đây theo một cách quan trọng." Họ cũng đã nhận ra điều gì làm nó khác biệt:
"Nó được thúc đẩy, từ đầu đến cuối, bởi một hệ thống tác nhân AI tự chủ — và chúng tôi đã phát hiện và phân tích nó chủ yếu bằng AI của chính mình."
Tầm quan trọng của AI trọng số mở
Cuộc điều tra của Hugging Face đã phơi bày vấn đề mà họ gọi là "bất đối xứng" phát sinh từ những hạn chế áp đặt lên các ứng dụng mô hình AI đóng (không mở mã nguồn/trọng số) bởi các nhà cung cấp hàng đầu như OpenAI và Anthropic. Khi công ty bắt đầu phân tích nhật ký của sự cố — bao gồm một lượng lớn lệnh tấn công thực tế — nó đã kích hoạt các ràng buộc an toàn nhằm ngăn chặn kẻ xấu sử dụng AI để nghĩ ra các cuộc tấn công mạng. Thay vào đó, các rào cản này đã ngăn công ty tận dụng những AI đó để phòng thủ.
Hugging Face đã phải sử dụng mô hình trọng số mở của Trung Quốc zai-org/GLM-5.2 chạy trên cơ sở hạ tầng của chính công ty, dưới sự kiểm soát của riêng họ và không có hạn chế bên ngoài.
Mặc dù hai thuật ngữ này thường được sử dụng thay thế cho nhau, mô hình mã nguồn mở (open-source) và mô hình trọng số mở (open-weight) là hai thứ khác nhau. Mô hình AI trọng số mở công bố các tham số đã được huấn luyện (bộ "não AI" thực sự) một cách công khai, trong khi mô hình AI mã nguồn mở còn cung cấp mã nguồn — và lý tưởng là cả phương pháp đào tạo và các thành phần khác — cần thiết để kiểm tra, sửa đổi và tái tạo hệ thống.

Bài đăng của HuggingFace giải thích rằng việc chạy các mô hình trọng số mở trên phần cứng của riêng họ "có một lợi ích thứ hai: không có dữ liệu kẻ tấn công, và không có thông tin xác thực nào mà nó tham chiếu đến, rời khỏi môi trường của chúng tôi." Điều này chỉ ra một sự bất đối xứng lớn giữa người phòng thủ và kẻ tấn công trong những trường hợp như vậy:
"Kinh nghiệm này chỉ ra một khoảng trống đáng để lên kế hoạch. Chúng tôi không biết mô hình nào cung cấp năng lượng cho các tác nhân của kẻ tấn công, dù là một mô hình được lưu trữ đã bị 'vượt ngục' (jailbroken) hay một mô hình trọng số mở không bị hạn chế; dù bằng cách nào, kẻ tấn công không bị ràng buộc bởi bất kỳ chính sách sử dụng nào, trong khi công việc điều tra của chúng tôi lại bị chặn bởi các rào cản của các mô hình được lưu trữ mà chúng tôi đã thử đầu tiên."
Sự chia rẽ về AI mã nguồn mở
Có một sự chia rẽ đáng kể giữa những người tin rằng phát triển AI một cách cởi mở là cách tiếp cận tốt nhất và những người khăng khăng cho rằng công nghệ làm nền tảng cho các mô hình tiên phong cần phải được giữ bí mật chặt chẽ.
Liên quan: OpenAI cho biết các mô hình AI đã thoát khỏi sự kiểm soát để hack Hugging Face
Các đại diện từ các phòng thí nghiệm AI hàng đầu của Mỹ tuyên bố rằng các mô hình lớn trọng số mở mạnh mẽ là nguy hiểm. Demis Hassabis, Giám đốc điều hành của phòng thí nghiệm AI DeepMind của Google, đã chỉ trích OpenAI vì đã phát hành công trình của họ dưới dạng mã nguồn mở hồi năm 2016, khi công ty vẫn còn sống đúng với tên gọi của mình:
"Có nhiều lập luận tốt về lý do tại sao cách tiếp cận bạn đang thực hiện thực sự rất nguy hiểm và trên thực tế có thể làm tăng rủi ro cho thế giới."
OpenAI đã ngừng phát hành trọng số mô hình hàng đầu của mình với GPT-3 vẫn chưa phát hành vào năm 2020. Đồng sáng lập và cựu nhà khoa học trưởng của công ty, Ilya Sutskever, đã nói hồi năm 2023 rằng "nó không có ý nghĩa gì để mở mã nguồn" những mô hình như vậy và đó "là một ý tưởng tồi".
"Khi chúng ta tiến gần hơn đến việc xây dựng AI, sẽ có ý nghĩa nếu bắt đầu trở nên ít cởi mở hơn."
Các mô hình trọng số mở gần như không thể kiểm soát, đặc biệt là khi nói đến mục đích sử dụng của chúng. Các biện pháp bảo vệ được tích hợp sẵn trong những mô hình đó có thể, và thường xuyên bị loại bỏ thông qua một quá trình được gọi là xóa bỏ (abliteration).

Biện pháp bảo vệ là một con dao hai lưỡi
Đề cương chính sách liên bang tháng 6/2026 của OpenAI đề xuất việc đánh giá mô hình AI bắt buộc và các quy tắc khác về mặt hình thức là trung lập trong việc triển khai, nhưng trên thực tế, nó sẽ khiến một bản phát hành trọng số mở tiên phong phải chịu sự kiểm tra trước của chính phủ.
Anthropic đã đi theo một hướng hơi khác và vận động hành lang cho các biện pháp kiểm soát xuất khẩu chặt chẽ hơn đối với chip AI tiên tiến và thực thi chống lại các nỗ lực trích xuất hoặc sao chép các mô hình của Mỹ. Bản đệ trình tháng 4/2025 của công ty đã đề nghị tăng cường Quy tắc Phổ biến AI của Mỹ và hạ thấp ngưỡng cho việc truy cập không được cấp phép vào các cụm máy tính lớn.
Về mặt chính thức, không công ty nào trực tiếp chống lại các mô hình trọng số mở, nhưng một báo cáo tháng 7 của New York Times đã trích dẫn năm người gần với các cuộc thảo luận tuyên bố rằng OpenAI và Anthropic đã thúc giục Washington hạn chế các mô hình mở mạnh mẽ của Trung Quốc.
Cuộc tranh luận quy về một cuộc tranh cãi về việc liệu những nguy hiểm của kiểm soát tập trung có đáng ưa hơn những nguy hiểm của một cuộc tự do cạnh tranh hay không — đặc biệt khi công ty được đề cập đã chứng minh bản thân không hiệu quả trong việc kiềm chế công nghệ mà họ phát triển.
Việc Hugging Face cần phải tự vệ bằng một mô hình mã nguồn mở cho thấy sự nguy hiểm của việc trao quá nhiều quyền lực cho bất kỳ một thực thể nào. Công ty đã chỉ ra hàm ý:
"Kẻ tấn công không bị ràng buộc bởi bất kỳ chính sách sử dụng nào, trong khi công việc điều tra của chúng tôi lại bị chặn bởi các rào cản của các mô hình được lưu trữ mà chúng tôi đã thử đầu tiên. Bài học thực tế cho những người phòng thủ: hãy có một mô hình có khả năng mà bạn có thể chạy trên cơ sở hạ tầng của riêng mình, được kiểm tra và sẵn sàng trước khi xảy ra sự cố, cả để tránh bị khóa bởi rào cản và để ngăn dữ liệu kẻ tấn công và thông tin xác thực rời khỏi môi trường của bạn."
Việc hạn chế tiếp cận các mô hình mạnh có thể làm giảm số lượng kẻ tấn công có năng lực, nhưng một khi tồn tại những kẻ tấn công không bị hạn chế, việc hạn chế người phòng thủ có thể trở thành một rủi ro bảo mật. Hơn nữa, một số hình thức nghiên cứu an toàn AI đòi hỏi phải có quyền truy cập vào trọng số mô hình, nghĩa là nó không thể được thực hiện trên các mô hình do Anthropic hay OpenAI cung cấp.
Trọng số mở giúp các nhà nghiên cứu ngăn chặn các cuộc tấn công
Bài báo "Watch the Weights: Unsupervised monitoring and control of fine-tuned LLMs", được xuất bản lần đầu vào tháng 7 năm 2025, cho thấy cách các nhà nghiên cứu phát hiện hành vi độc hại hoặc ẩn giấu bằng cách kiểm tra các thay đổi bên trong trọng số mô hình. Các nhà nghiên cứu đứng sau bài báo đã ngăn chặn tới 100% các cuộc tấn công cửa hậu được thử nghiệm ở mức dưới 1% tỷ lệ dương tính giả trong một số thí nghiệm và phát hiện các nỗ lực khôi phục kiến thức đã bị loại bỏ trong hơn 95% trường hợp. Kết quả không thiết lập cách các mô hình tiên phong có khả năng nhất sẽ hành xử như thế nào dưới cùng một phân tích, nhưng đưa ra một lập luận thuyết phục về lợi ích của tính minh bạch.
Nhưng lập luận về việc giữ công nghệ AI mũi nhọn khỏi tay những người có ý định xấu cũng rất thuyết phục — đặc biệt là khi khoảng cách giữa các mô hình trọng số mở và đóng tiếp tục thu hẹp. Geoffrey Hinton, nhà tiên phong đoạt giải Nobel được mệnh danh là "Cha đỡ đầu của AI", lập luận trong báo cáo rằng "một khi bạn có trọng số, bạn có thể tinh chỉnh chúng để làm những điều xấu." Ông đã lập luận trong một bài phát biểu rằng điều này làm giảm rào cản gia nhập quá nhiều:
"Nó không tốn kém lắm để huấn luyện một mô hình nền tảng. Có lẽ bạn cần 10 triệu đô la, có lẽ 100 triệu đô la. Nhưng một băng nhóm tội phạm nhỏ không thể làm được. Để tinh chỉnh một mô hình mã nguồn mở là khá dễ dàng."
Magazine: Tạo ra AGI 'tốt' sẽ không giết tất cả chúng ta — Liên minh Trí tuệ Siêu nhân tạo





