Thách thức bắt đầu vào ngày 1 tháng 8, khi Belcher trực tiếp trả lời tuyên bố của Anthropic, mô tả ba sự cố được phát hiện trong quá trình kiểm tra an ninh mạng. Anthropic giải thích rằng một số mô hình Claude đã vô tình tiếp xúc với Internet công cộng sau khi các môi trường thử nghiệm được kết nối nhầm với mạng thay vì được cách ly.
Thay vì xem những kết quả này là bằng chứng cho thấy AI thoát khỏi tầm kiểm soát, Belcher tập trung vào chính cấu hình thử nghiệm. Những sự cố như vậy thường chỉ ra lỗi trong thiết lập, hơn là những đột phá kỹ thuật khó tin, đặc biệt khi các hệ thống thử nghiệm được kết nối với cơ sở hạ tầng thực tế. Để làm cho thách thức này có thể đo lường được, anh ta đã bổ sung chính xác 100 $BTC vào một địa chỉ Bitcoin và đề nghị Claude di chuyển những đồng tiền này.

Ví đã nhận được số tiền vào ngày 31 tháng 7, và tính đến ngày 2 tháng 8, hồ sơ trên blockchain vẫn cho thấy toàn bộ số dư không bị động chạm.
Anthropic mô tả chi tiết ba sự cố an ninh thực tế
Báo cáo của Anthropic mô tả ba sự cố riêng biệt liên quan đến đánh giá an ninh mạng, được phát hiện sau khi phân tích hơn 141.000 lần chạy thử nghiệm. Công ty cho biết, trong sáu phiên đánh giá với ba mô hình, đã có sự tương tác ngoài ý muốn với các tổ chức thực tế do hiểu lầm khiến các môi trường thử nghiệm vẫn được kết nối với Internet.
Trong số các mô hình tham gia có Claude Opus 4.7, Claude Mythos 5 và một mô hình nghiên cứu nội bộ khác chưa được phát hành công khai. Mỗi mô hình được giao các bài tập dạng “capture the flag” (bắt cờ) được thiết kế để tìm thông tin ẩn bên trong các hệ thống máy tính hư cấu. Mặc dù Anthropic đã chỉ dẫn rằng các mô hình hoạt động trong mô phỏng cách ly không có quyền truy cập Internet, nhưng trên thực tế, các môi trường này đã trực tuyến do lỗi cấu hình liên quan đến đối tác thử nghiệm bên thứ ba - công ty Irregular.
Claude hack các hệ thống thực, nghĩ rằng đang được đào tạo
Anthropic mô tả trường hợp nghiêm trọng nhất liên quan đến mô hình Claude Opus 4.7. Không thể hoàn thành nhiệm vụ hư cấu, mô hình này đã phát hiện một trang web thực sự có cùng tên với công ty được mô phỏng. Sau đó, nó đã lợi dụng mật khẩu yếu và các dịch vụ không được bảo vệ, khôi phục thông tin đăng nhập của cơ sở hạ tầng và truy cập vào cơ sở dữ liệu làm việc chứa vài trăm bản ghi.
Công ty cho biết mô hình đã tiếp tục hành động sau khi nhận ra rằng môi trường có thể là thực, vì nó đi đến kết luận rằng các hệ thống thực có lẽ vẫn là một phần của đánh giá. Bất cứ ai từng gặp phải kiểm tra thâm nhập đều biết rằng sự nhầm lẫn như vậy trở nên khả thi hơn nhiều khi ranh giới thử nghiệm không rõ ràng, và đó là lý do tại sao các môi trường được cách ly đúng cách có tầm quan trọng ngang bằng với phần mềm được đánh giá. Anthropic nhấn mạnh rằng AI đã cố gắng hoàn thành nhiệm vụ được giao, chứ không cố tình vượt ra ngoài môi trường cách ly hoặc theo đuổi mục tiêu riêng của mình.
Khái niệm lưu trữ của Bitgo nâng cao mức độ thách thức
Thách thức mà Belcher đặt ra vượt xa câu hỏi liệu AI có thể lợi dụng mật khẩu yếu hay máy chủ được cấu hình kém hay không. Bitcoin được lưu trữ trên nền tảng lưu trữ thể chế Bitgo, sử dụng công nghệ đa chữ ký hoặc tính toán đa bên, phân phối quyền ký giữa nhiều khóa độc lập thay vì dựa vào một điểm thất bại duy nhất.

Các hệ thống được xây dựng theo cách này được thiết kế sao cho không có lỗ hổng đơn lẻ nào đủ để di chuyển tiền. Kẻ tấn công sẽ phải vượt qua hệ thống quản lý khóa, chính sách phê duyệt, phần cứng bảo mật và cơ chế kiểm soát hoạt động theo đúng trình tự, khiến vấn đề này khác biệt cơ bản so với việc khai thác một môi trường thử nghiệm được cấu hình sai. Theo báo cáo ban đầu, để hack một hệ thống như vậy sẽ cần một cuộc tấn công đồng thời vào nhiều cấp độ độc lập.
Blockchain sẽ đưa ra câu trả lời cuối cùng
Không giống như nhiều tuyên bố trong lĩnh vực an ninh mạng bị che khuất sau các cuộc điều tra bí mật, thí nghiệm này hoàn toàn công khai. Bất kỳ ai cũng có thể theo dõi ví trên blockchain Bitcoin và ngay lập tức thấy liệu các đồng tiền có được di chuyển hay không.
Thách thức này cũng là sự tiếp nối của những chỉ trích rộng hơn từ Belcher đối với các câu chuyện giật gân về an ninh AI. Đầu năm 2026, ông đã thách thức các cách giải thích rộng rãi rằng mô hình của Anthropic đã tự hack các hệ thống bí mật của Cơ quan An ninh Quốc gia, khẳng định rằng những báo cáo này đã trình bày sai một cuộc tập trận nội bộ được cho phép, chứ không phải một vụ hack bên ngoài thực tế. Thách thức mới nhất của ông tuân theo cùng một khuôn mẫu, thay thế các cuộc tranh luận giả định bằng một bài kiểm tra minh bạch và có thể đo lường được.
Cuộc tranh luận giờ đây vượt ra ngoài trí tuệ nhân tạo
Tập này nhấn mạnh khoảng cách ngày càng lớn giữa các cuộc trình diễn được thực hiện trong môi trường nghiên cứu có kiểm soát và các cuộc tấn công vào các hệ thống sản xuất được thiết kế để chống lại những kẻ tấn công tinh vi.
Đối với ngành công nghiệp tiền điện tử, thách thức này cũng phục vụ như một minh chứng công khai về kiến trúc lưu trữ thể chế. Một vụ trộm thành công ngay lập tức sẽ đặt ra câu hỏi về cả khả năng của AI và việc lưu trữ Bitcoin siêu bảo mật. Nếu ví vẫn không bị động chạm, những người ủng hộ có thể sẽ lập luận rằng điều này nhấn mạnh sự khác biệt giữa việc khai thác các môi trường thử nghiệm được cấu hình sai và việc hack các hệ thống lưu trữ cấp doanh nghiệp.
Thách thức của người đứng đầu Bitgo diễn ra trong bối cảnh tiếp tục tiết lộ chi tiết về cuộc tấn công gần đây vào Coldcard, tổng thiệt hại tính đến 20:00 ET Chủ nhật đã đạt 1.431,97 $BTC. Vụ việc Coldcard cũng làm dấy lên suy đoán về việc liệu vi phạm cuối cùng có phải do lỗi của con người, sai sót vận hành hay nguyên nhân hoàn toàn khác, bao gồm cả việc AI có đóng vai trò nào đó trong việc phát hiện lỗ hổng phần mềm hay không.
Sự chú ý giờ đây chuyển sang Anthropic và chiếc ví
Tính đến ngày 2 tháng 8, Anthropic vẫn chưa phản hồi công khai về thách thức cụ thể của Belcher, và 100 $BTC vẫn nằm trên địa chỉ đã công bố mà không có bất kỳ giao dịch gửi đi nào. Do đó, blockchain đóng vai trò như một bảng điểm khách quan, trong khi ngành công nghệ rộng lớn hơn tranh luận về những gì các sự cố này thực sự chứng minh.
Các diễn biến tiếp theo có thể sẽ liên quan đến phân tích kỹ thuật bổ sung về các môi trường thử nghiệm của Anthropic, phản hồi có thể có của công ty đối với thách thức hoặc sự di chuyển của chính Bitcoin. Trong lúc đó, vụ cá cược của Belcher đã biến một cuộc thảo luận phức tạp về an ninh AI thành một câu hỏi đơn giản với câu trả lời có thể kiểm chứng công khai: Liệu AI hiện đại có thể vượt qua các hệ thống lưu trữ tiền điện tử thể chế hay không?
end-content






