Cơ Chế Bảo Mật Claude Lại Thất Bại Thảm Hại, AI Tức Giận Xóa Toàn Bộ Thư Mục Chính 700GB Của Nhà Phát Triển

marsbitXuất bản vào 2026-08-31Cập nhật gần nhất vào 2026-08-31

Tóm tắt

Claude vừa gây ra một sự cố nghiêm trọng khi tự động xóa toàn bộ thư mục chính 700GB của một nhà phát triển. Nguyên nhân bắt nguồn từ việc nhà phát triển Guillemot yêu cầu AI (Claude Fable 5) viết một script để dọn dẹp file tạm trong /tmp một cách an toàn. Do nhiệm vụ liên quan đến thao tác xóa file, cơ chế an toàn của Anthropic đã tự động kích hoạt, hạ cấp mô hình từ Fable 5 xuống phiên bản thận trọng hơn là Opus 4.8 để tiến hành "đánh giá đối kháng" (adversarial review). Trong bước kiểm tra, Opus 4.8 đã xác định chính xác rằng thư mục chính của người dùng là "mục tiêu nguy hiểm, không được xóa". Tuy nhiên, trong bước dọn dẹp file tạm sau khi kiểm tra, mô hình đã tái sử dụng một biến số chứa đường dẫn đến thư mục chính và thực thi lệnh xóa trên chính biến đó. Kết quả là 700GB dữ liệu, tương đương một tuần làm việc, đã bị xóa sạch, trong khi thư mục /tmp mục tiêu ban đầu thì vẫn nguyên vẹn. Sự cố này làm nổi bật một nghịch lý trong cơ chế an toàn của AI: hệ thống hạ cấp nhiệm vụ "quá nguy hiểm" xuống cho một mô hình yếu hơn và thận trọng hơn xử lý, nhưng chính mô hình yếu hơn này lại dễ mắc lỗi logic (như quản lý biến số) trong các tình huống phức tạp, dẫn đến hậu quả tai hại. Cơ chế hạ cấp tự động hiện nay bị cộng đồng phàn nàn là quá nhạy cảm, làm giảm năng lực xử lý và một khi kích hoạt thì sẽ áp dụng cho cả phiên làm việc.

Ôi hô, Claude lại một lần nữa gặp sự cố nghiêm trọng!

Lần này Claude đã xóa toàn bộ thư mục dự án chính của nhà phát triển, xóa sạch 700GB dữ liệu. Lại là lệnh "rm -rf".

Tóm lại, nhà phát triển yêu cầu AI viết một tập lệnh nhằm đảm bảo các tệp sẽ không bị xóa nhầm. AI cảm thấy việc này hơi nguy hiểm, nên đã kích hoạt kiểm tra an toàn. Kết quả của việc kiểm tra là: nó đã xóa toàn bộ thư mục chính.

Guillemot là một người dùng nặng của các AI Agent. Trong quá trình phát triển hàng ngày, anh thường xuyên gọi các AI hỗ trợ lập trình khác nhau để hỗ trợ công việc. Nhưng có một vấn đề nhỏ luôn làm phiền anh: những Agent này sau khi sử dụng không bao giờ tự dọn dẹp, để lại một lượng lớn tệp rác trong thư mục /tmp.

Vì vậy, anh đã đưa ra một quyết định có vẻ rất hợp lý: yêu cầu Claude Fable 5 viết một tập lệnh tạo các thư mục hộp cát độc lập trong /tmp cho mỗi Agent, và tự động dọn dẹp sau khi hoàn thành nhiệm vụ. Điểm khó khăn chính là không được xóa các tệp đang được các tiến trình khác sử dụng.

Fable nhanh chóng đưa ra giải pháp, tích hợp logic phát hiện các Agent đang chạy và xóa trễ. Guillemot nhìn qua, cảm thấy mã nguồn quá phức tạp, nên yêu cầu đơn giản hóa.

Đến bước này, mọi thứ vẫn còn bình thường.

Bước ngoặt xảy ra ở giai đoạn kiểm tra an toàn.

Vì tập lệnh liên quan đến thao tác xóa cứng, Fable đã tự khởi động một lần "kiểm tra đối kháng" (adversarial review), tức là khởi động một phiên bản mô hình mới để kiểm tra xem mã nguồn mình viết có an toàn hay không. Điều này đã kích hoạt cơ chế bảo mật của Anthropic.

Anthropic đã tích hợp sẵn một bộ cơ chế giảm cấp an toàn trong Claude Code: khi hệ thống phán đoán nhiệm vụ hiện tại liên quan đến các thao tác nhạy cảm (như an ninh mạng, công nghệ sinh học, hoặc trong trường hợp này là xóa tệp), nó sẽ tự động giảm cấp mô hình từ phiên bản cao cấp xuống phiên bản thận trọng hơn. Cơ chế này vốn có ý định giảm khả năng mô hình "quá tích cực" trong các tình huống rủi ro cao.

Trong trường hợp này, hệ thống an toàn đầu tiên đã giảm cấp mô hình từ Fable 5 xuống Opus 5, sau đó tiếp tục giảm xuống Opus 4.8.

Opus 4.8 bắt đầu thực hiện kiểm tra an toàn. Logic kiểm tra như sau: so sánh đường dẫn mục tiêu của tập lệnh xóa với /tmp và thư mục chủ của người dùng, xác nhận tập lệnh sẽ không vô tình xóa nhầm các thư mục quan trọng này.

Bản thân bài kiểm tra đã vượt qua. Cả /tmp và thư mục chủ đều được xác định chính xác là "mục tiêu nguy hiểm, không được xóa".

Nhưng sau khi kiểm tra mã nguồn, còn có một bước dọn dẹp: xóa các tệp tạm thời được tạo ra trong quá trình kiểm tra. Thảm họa xảy ra ngay tại đây. Opus 4.8 trong bước dọn dẹp đã tái sử dụng cùng một tên biến từ giai đoạn kiểm tra. Biến này trong giai đoạn kiểm tra được gán giá trị là đường dẫn đến thư mục chủ của người dùng, và bước dọn dẹp đã trực tiếp thực hiện thao tác xóa trên biến này.

Có nghĩa là, mô hình vừa xác nhận "không được xóa thư mục chủ", ngay giây sau đã xóa thư mục chủ.

Sau khi phát hiện bất thường, nhà phát triển lập tức chấm dứt tiến trình, nhưng đã quá muộn. 700GB dữ liệu đã bị xóa sạch, thành quả làm việc cả tuần đã tan thành mây khói.

Còn thư mục /tmp vốn định dọn dẹp, thì vẫn bình an vô sự.

Cơ chế giảm cấp an toàn của mô hình từ lâu đã gây ra rất nhiều khiếu nại trong cộng đồng.

Các vấn đề cốt lõi mà nhà phát triển phản ánh bao gồm: giảm cấp quá nhạy cảm, ngay cả các nhiệm vụ mã hóa bình thường cũng bị kích hoạt nhầm; sau khi giảm cấp, khả năng của mô hình giảm đáng kể, nhưng độ phức tạp của nhiệm vụ không thay đổi; việc giảm cấp có tính "dính", một khi kích hoạt sẽ kéo dài suốt phiên làm việc, ngay cả khi các thao tác sau đó hoàn toàn vô hại.

Thậm chí có nhà phát triển đã viết riêng một tập lệnh hook, khi phát hiện mô hình bị giảm cấp sẽ tự động tạm dừng phiên làm việc, ngăn mô hình có khả năng thấp tiếp tục thực hiện các thao tác rủi ro cao.

Cơ chế bảo mật phán đoán nhiệm vụ "quá nguy hiểm", cần giao cho mô hình yếu hơn để xử lý. Nhưng chính mô hình yếu hơn lại càng dễ mắc sai lầm, đặc biệt là trong các tình huống cần xử lý chính xác phạm vi biến, đường dẫn tệp và các chi tiết tương tự.

"Sai lầm là chuyện thường tình của con người, nhưng để hỏng việc hoàn toàn, vẫn cần nhờ đến máy tính."

Bài viết này đến từ tài khoản WeChat công cộng "Machine Heart" (ID: almosthuman2014), tác giả: Lãnh Miêu

Câu hỏi Liên quan

QVụ việc gì đã xảy ra với nhà phát triển Guillemot khi sử dụng Claude Fable 5?

AClaude Fable 5 đã vô tình xóa toàn bộ thư mục chính (700GB) của nhà phát triển Guillemot trong khi cố gắng viết một script để dọn dẹp các file tạm trong /tmp một cách an toàn.

QCơ chế bảo mật nào của Anthropic đã góp phần gây ra sự cố này?

AĐó là cơ chế 'hạ cấp bảo mật' (safety downgrade mechanism). Khi hệ thống phát hiện tác vụ liên quan đến thao tác nhạy cảm (như xóa file), nó tự động chuyển mô hình từ phiên bản mạnh (Fable 5) xuống phiên bản bảo thủ hơn (Opus 5, rồi Opus 4.8) để giảm rủi ro, nhưng phiên bản yếu hơn lại mắc lỗi.

QLỗi cụ thể nào trong mã code do Opus 4.8 tạo ra đã dẫn đến việc xóa thư mục chính?

AOpus 4.8 đã tái sử dụng cùng một tên biến trong bước dọn dẹp thử nghiệm. Biến này trước đó được gán bằng đường dẫn đến thư mục chính của người dùng. Do đó, lệnh xóa trong bước dọn dẹp đã nhầm lẫn xóa thư mục chính thay vì chỉ xóa file tạm thử nghiệm.

QCộng đồng nhà phát triển đã phản ứng thế nào về cơ chế hạ cấp bảo mật này?

ACộng đồng phàn nàn nhiều về cơ chế này: nó quá nhạy cảm và dễ bị kích hoạt nhầm với các tác vụ bình thường; khả năng của mô hình bị hạ cấp giảm đáng kể nhưng độ phức tạp công việc không đổi; và việc hạ cấp có 'tính dính' - một khi kích hoạt sẽ áp dụng cho cả phiên làm việc.

QBài học chính nào có thể rút ra từ sự cố này về việc sử dụng AI để thực thi các tác vụ hệ thống?

ABài học chính là cần cực kỳ thận trọng khi cho AI thực thi các lệnh hệ thống trực tiếp, đặc biệt là các lệnh có khả năng phá hủy cao như `rm -rf`. Các cơ chế an toàn tự động, nếu không được thiết kế cẩn thận, đôi khi có thể phản tác dụng và gây ra sự cố nghiêm trọng hơn. Luôn cần có sự giám sát của con người và các biện pháp sao lưu trước khi chạy script quan trọng.

Nội dung Liên quan

Cuộc Đại Tái Tổ Các Thành Phố Ngoại Thương! Thâm Quyến Vượt Thượng Hải, Tô Châu Vượt Bắc Kinh

Thành phố ngoại thương xáo trộn lớn: Thâm Quyến vượt Thượng Hải, Tô Châu vượt Bắc Kinh. Năm 2026, thứ hạng các thành phố dẫn đầu về ngoại thương lại thay đổi. 7 tháng đầu năm, tổng kim ngạch xuất nhập khẩu cả nước tăng mạnh, đặc biệt là sự trỗi dậy mạnh mẽ của nhập khẩu. Trọng điểm: Thâm Quyến mở rộng khoảng cách với Thượng Hải, vững vàng ngôi đầu về ngoại thương. Một tín hiệu quan trọng là lần đầu tiên giá trị nhập khẩu của Thâm Quyến vượt Thượng Hải. Tô Châu vượt Bắc Kinh, vươn lên thành thành phố ngoại thương lớn thứ ba. Vô Tích tiến vào top 10, trong khi Thanh Đảo rời khỏi nhóm này. Tây An là "ngựa ô" lớn nhất với mức tăng trưởng ngoại thương 100,4% trong 7 tháng. Nhập khẩu trở thành động lực tăng trưởng chính, tăng 22%, phản ánh nhu cầu thị trường nội địa phục hồi và phục vụ chuỗi sản xuất tái xuất khẩu. Sự thay đổi lớn nhất là các thành phố sản xuất, đặc biệt là những nơi có ngành công nghiệp chip và phần cứng AI, đang bứt phá mạnh mẽ. Tây An (tăng 100,4%) dựa vào sản xuất chip bộ nhớ, Tô Châu dựa vào phần cứng AI và điện tử, Hợp Phì có nền tảng chip, và Thâm Quyến là trung tâm sản xuất điện tử. Ngược lại, 19 trong số 30 thành phố dẫn đầu có tốc độ tăng trưởng thấp hơn mức trung bình toàn quốc (17,3%).

marsbit10 phút trước

Cuộc Đại Tái Tổ Các Thành Phố Ngoại Thương! Thâm Quyến Vượt Thượng Hải, Tô Châu Vượt Bắc Kinh

marsbit10 phút trước

Marvell: Không sánh bằng Nvidia, không đáp ứng kỳ vọng, định giá cao trước tiên 'ép bong bóng'?

Marvell (MRVL) công bố kết quả tài chính quý 2/2027 (đến tháng 7/2026) cùng dự báo doanh thu hai năm tài khóa 2027 và 2028 lần lượt là 12 tỷ USD và 18 tỷ USD, tăng 45% và 50% so với trước đó. Tuy nhiên, dự báo này chỉ tốt hơn một chút so với kỳ vọng của thị trường và bị coi là "kém xa" so với định hướng tăng trưởng mạnh mẽ của Nvidia. Nguyên nhân chính khiến cổ phiếu Marvell giảm mạnh sau giờ giao dịch bao gồm: 1. Công ty không điều chỉnh tăng dự báo cho mảng ASIC tùy chỉnh (Custom ASIC), dù mới ký thỏa thuận hợp tác với Google. Điều này khiến thị trường nghi ngờ về tính hiệu quả của thỏa thuận và khả năng giành được đơn hàng chip TPU từ Google. 2. Tốc độ tăng trưởng dự kiến cho mảng kinh doanh trung tâm dữ liệu (Data Center) năm tài khóa 2028 là trên 60%, thấp hơn mức 70%+ mà Nvidia đưa ra, cho thấy sự bùng nổ chưa đủ mạnh trong lĩnh vực kết nối. Mặc dù Marvell có lợi thế trong mạng lưới kết nối AI và tiềm năng tăng trưởng từ ASIC, nhưng việc đưa ra dự báo thận trọng, cùng với vị thế yếu hơn trong đàm phán với các đại gia công nghệ (thể hiện qua việc "tặng" quyền mua cổ phiếu cho Google và Amazon), đang khiến thị trường tái đánh giá mức định giá cao của công ty. Triển vọng dài hạn vẫn được hỗ trợ bởi tốc độ tăng trưởng cao và cơ hội trong ASIC, nhưng áp lực điều chỉnh trong ngắn hạn là có thể xảy ra.

marsbit49 phút trước

Marvell: Không sánh bằng Nvidia, không đáp ứng kỳ vọng, định giá cao trước tiên 'ép bong bóng'?

marsbit49 phút trước

Xu hướng thị trường Mỹ (31/8): Diều hâu Wash đè bẹp cổ phiếu chip, Mỹ-Iran đụng độ cuối tuần đẩy giá dầu tăng

Thị trường chứng khoán Mỹ đóng cửa giảm vào cuối tuần trước, với áp lực từ tuyên bố diều hâu của Chủ tịch Fed Walsh tại Jackson Hole. Walsh cảnh báo có thể tăng lãi suất nếu lạm phát không giảm nhanh, đẩy xác suất tăng lãi suất vào tháng 9 lên gần 60%. Lợi tức trái phiếu kho bạc ngắn hạn tăng mạnh, đè nặng lên các tài sản nhạy cảm với lãi suất. Xung đột địa chính trị leo thang khi Mỹ và Iran tấn công lẫn nhau vào cuối tuần, khiến giá dầu thô tăng hơn 2% trong phiên Á sáng thứ Hai. Trong khi đó, cựu Tổng thống Trump thông báo đạt thỏa thuận "lớn nhất lịch sử" với Venezuela để tăng sản lượng dầu, tạo ra lực kéo ngược chiều cho giá dầu. Cổ phiếu chip bị bán mạnh, với Chỉ số Bán dẫn Philadelphia giảm 3.47%. NVIDIA giảm 4.57%, thu hẹp một nửa mức tăng sau báo cáo thu nhập. Vốn đầu tư có dấu hiệu chuyển dịch từ phần cứng sang cổ phiếu phần mềm. Tuần này, thị trường tập trung theo dõi: 1) Định giá lại lộ trình lãi suất sau phát biểu của Walsh; 2) Diễn biến xung đột Mỹ-Iran và tác động đến giá dầu; 3) Áp lực bán với cổ phiếu chip có hạ nhiệt hay không. Sự kết hợp giữa kỳ vọng tăng lãi suất và căng thẳng địa chính trị có thể tiếp tục gây áp lực lên cổ phiếu công nghệ định giá cao.

marsbit1 giờ trước

Xu hướng thị trường Mỹ (31/8): Diều hâu Wash đè bẹp cổ phiếu chip, Mỹ-Iran đụng độ cuối tuần đẩy giá dầu tăng

marsbit1 giờ trước

OpenAI Mua Hàng Chục Ngàn Chiếc Mac Để Huấn Luyện Reinforcement Learning! Công Việc Của Nvidia Bị Apple Cướp Mất

OpenAI đã mua hàng chục nghìn máy Mac mini và Mac Studio để huấn luyện AI học tăng cường, cụ thể cho các tác nhân sử dụng máy tính. Anthropic cũng thuê Mac mini qua AWS cho mục đích tương tự. Nguyên nhân Mac được ưa chuộng là nhờ kiến trúc bộ nhớ thống nhất của chip Apple M, cho phép CPU và GPU truy cập chung một vùng nhớ, hiệu quả hơn so với GPU của NVIDIA có bộ nhớ tách biệt. Mac mini và Mac Studio cũng có hệ thống tản nhiệt chuyên dụng, phù hợp cho các tác vụ huấn luyện kéo dài. Sự bùng nổ nhu cầu này giúp doanh thu Mac của Apple tăng gần 29% trong quý gần nhất. Apple cũng tổ chức sự kiện doanh nghiệp hiếm hoi để quảng bá khả năng xử lý AI cục bộ của Mac, với trọng tâm là Mac mini. Họ còn thúc đẩy dự án phần mềm EXO Labs để kết nối nhiều Mac thành cụm chạy mô hình AI quy mô lớn. Tuy nhiên, nhu cầu cao dẫn đến tình trạng thiếu hụt linh kiện và sản phẩm. NVIDIA đã chú ý và ra mắt DGX Spark để cạnh tranh trực tiếp. Bên trong, Apple đang xây dựng máy chủ dùng chip M cho dịch vụ điện toán đám mây riêng, nhưng chưa bán ra bên ngoài. Công ty dường như chưa sẵn sàng hoàn toàn cho cơn sốt AI doanh nghiệp, dù các đối tác như Mount Thor đang nắm bắt cơ hội này.

marsbit1 giờ trước

OpenAI Mua Hàng Chục Ngàn Chiếc Mac Để Huấn Luyện Reinforcement Learning! Công Việc Của Nvidia Bị Apple Cướp Mất

marsbit1 giờ trước

ChatGPT mô hình mới Bel được tiết lộ đã hoàn thành tiền huấn luyện, thông số lên tới 10 nghìn tỷ

Cộng đồng công nghệ đang xôn xao với tin đồn về mô hình AI khổng lồ mới của OpenAI, mang tên "Bel". Theo các nguồn tin rò rỉ, Bel đã hoàn thành giai đoạn tiền huấn luyện với quy mô chưa từng có: 10 nghìn tỷ tham số, vượt xa mốc 1 nghìn tỷ của GPT-4. Mô hình này được định vị là kiến trúc cơ bản cho thời kỳ "hậu GPT-6", nhắm thẳng đến ngưỡng cửa AGI (Trí tuệ nhân tạo phổ quát). Bel được mô tả có khả năng lý luận phức tạp, xử lý tác vụ đại lý dài hạn và điều phối hàng trăm tác nhân con một cách tự chủ. Thậm chí, nó có thể tự cải tiến thông qua cơ chế học tập hai tốc độ: hấp thụ kinh nghiệm nhanh và củng cố kiến thức vào trọng số chậm. Một số nhà phân tích coi Bel là "sát thủ" nhắm vào Claude Fable của Anthropic. Tin đồn này xuất hiện trong bối cảnh OpenAI sắp công bố mô hình Astra, đồng thời tự tin về lợi thế sức mạnh tính toán áp đảo so với đối thủ. Một giám đốc OpenAI còn tiết lộ tầm nhìn tương lai nơi AI cá nhân (Personal AGI) có thể thấu hiểu và hỗ trợ người dùng một cách chủ động, xóa nhòa mọi giao diện phức tạp. Dù mức độ xác thực chưa được kiểm chứng, những thông tin này báo hiệu một cuộc chạy đua AI mới với những bước nhảy vọt về quy mô và khả năng, hứa hẹn biến đổi mạnh mẽ trong năm 2026.

marsbit2 giờ trước

ChatGPT mô hình mới Bel được tiết lộ đã hoàn thành tiền huấn luyện, thông số lên tới 10 nghìn tỷ

marsbit2 giờ trước

Giao dịch

Giao ngay
活动图片