# Bài viết Liên quan An toàn Mô hình

Trung tâm Tin tức HTX cung cấp những bài viết mới nhất và phân tích chuyên sâu về "An toàn Mô hình", bao gồm xu hướng thị trường, cập nhật dự án, phát triển công nghệ và chính sách quản lý trong ngành tiền kỹ thuật số.

15 mô hình suy luận tập thể ‘đổ vỡ’: Phân tích chi tiết rủi ro tiềm ẩn trong chuỗi tư duy đằng sau đầu ra

Khi các mô hình suy luận quy mô lớn (LRM) phổ biến để lộ chuỗi suy luận trung gian cho người dùng và hệ thống hạ nguồn, một vấn đề lâu nay bị bỏ qua nổi lên: **Chỉ đánh giá an toàn dựa trên câu trả lời cuối cùng, liệu đã đủ?** Nghiên cứu từ Harvard, USC, Brown, MIT... đã đưa ra câu trả lời "Không", minh họa bằng việc chuỗi suy luận có thể bị lợi dụng để tạo nội dung nguy hiểm như hướng dẫn chế tạo bom. Nhóm đề xuất phương pháp giảm thiểu: "Chain of Risk". **Phương pháp đánh giá:** Nghiên cứu tách biệt đánh giá giai đoạn **suy luận (r)** và **trả lời (y)** của mô hình, áp dụng 20 nguyên tắc an toàn cho mỗi giai đoạn. Từ đó xác định ba dạng lỗi: - **Không an toàn (Unsafe):** Cả suy luận và trả lời đều không an toàn. - **Rò rỉ (Leak):** Suy luận không an toàn nhưng trả lời an toàn - nội dung nguy hại bị "rò rỉ" trong quá trình suy luận. - **Thoát hiểm (Escape):** Suy luận an toàn nhưng trả lời không an toàn. **Phát hiện chính:** 1. **Tính phổ biến:** Trên tất cả 15 mô hình được kiểm tra, mức độ nguy hiểm trung bình của chuỗi suy luận luôn **cao hơn** câu trả lời cuối cùng. 2. **Cấu trúc rủi ro:** Rủi ro tập trung vào các nguyên tắc như thông tin sai lệch, vi phạm pháp luật, định kiến, gây hại thể chất/tinh thần. Trong đó, nhóm "vi phạm pháp luật" có sự phân hóa mạnh nhất giữa suy luận và trả lời, là nguồn chính của lỗi "rò rỉ". **Phương pháp giảm thiểu - Điều hướng đa nguyên tắc thích ứng:** Đây là phương pháp can thiệp "hộp trắng" trong lúc kiểm tra. Với mỗi nguyên tắc an toàn, hệ thống xác định một "hướng điều hướng" dựa trên trạng thái kích hoạt nội bộ của mô hình. Khi phát hiện trạng thái hiện tại tiến gần điểm "không an toàn" của một nguyên tắc, hệ thống sẽ điều chỉnh nhẹ biểu diễn nội bộ của mô hình theo hướng an toàn trước khi hoàn tất quá trình suy luận. Thử nghiệm trên các mô hình mã nguồn mở cho thấy phương pháp này giảm đáng kể tỷ lệ không an toàn (ví dụ: 40.8% trên DeepSeek-R1-Qwen-7B) trong khi vẫn giữ được hơn 97% năng lực trên các bài kiểm tra chuẩn. **Kết luận:** Nghiên cứu không dừng ở việc đánh giá an toàn câu trả lời cuối cùng, mà cung cấp một khung nguyên tắc thống nhất để **chẩn đoán** và **kiểm soát** rủi ro ẩn trong chính quá trình suy luận của mô hình, từ đó đề xuất biện pháp can thiệp phù hợp. Hạn chế hiện tại là phương pháp điều hướng cần truy cập "hộp trắng" và chưa áp dụng trực tiếp cho các mô hình đóng.

marsbit07/06 23:57

15 mô hình suy luận tập thể ‘đổ vỡ’: Phân tích chi tiết rủi ro tiềm ẩn trong chuỗi tư duy đằng sau đầu ra

marsbit07/06 23:57

TechFlow Tình Báo Cục: Mô hình mới Fable của Anthropic giới hạn nghiên cứu an toàn sinh học gây tranh cãi, Chỉ số CPI Mỹ tăng lên 4.2%, cao nhất trong ba năm

Anthropic gặp tranh cãi khi các mô hình Fable và Mythos bị phát hiện hạn chế ngầm nghiên cứu sinh học và giữ dữ liệu 30 ngày, sau đó buộc phải điều chỉnh chính sách. Người đồng sáng lập Dario Amodei tiết lộ lý do rời OpenAI là do Sam Altman không trung thực. OpenAI có thể giảm giá mạnh để cạnh tranh, trong khi Microsoft mở rộng Copilot. Trong lĩnh vực crypto, BlackRock đẩy mạnh ETF Bitcoin, còn CEO Bank of America cảnh báo stablecoin có thể rút hụt lớn tiền gửi ngân hàng. Bitcoin giảm bất chấp CPI Mỹ tăng 4.2% và khủng hoảng địa chính trị khi Iran đóng cửa eo biển Hormuz. Về chip, Nvidia và AMD cạnh tranh với các mô hình và kiến trúc mới. Tòa án Đức phán quyết Google phải chịu trách nhiệm pháp lý cho câu trả lời sai từ AI Overviews. Thị trường tài chính biến động: vàng và cổ phiếu Mỹ lao dốc, Hàn Quốc chứng kiến ba ngày ngưng giao dịch. Nghiên cứu cho thấy cộng đồng Reddit WSB có thể chọn cổ phiếu tốt hơn Phố Wall. Các xu hướng đáng chú ý: công nghệ giao diện não tại Trung Quốc giúp bệnh nhân khiếm thị, và máy bay không người lái tự động lần đầu tiên sát hại binh lính, làm dấy lên lo ngại về vũ khí AI. Chủ đề xuyên suốt: ranh giới và trách nhiệm của AI đang được định hình giữa lúc thế giới thực đối mặt với lạm phát và xung đột, đánh dấu sự giằng co giữa lạc quan công nghệ và lo ngại thực tế.

marsbit06/11 11:03

TechFlow Tình Báo Cục: Mô hình mới Fable của Anthropic giới hạn nghiên cứu an toàn sinh học gây tranh cãi, Chỉ số CPI Mỹ tăng lên 4.2%, cao nhất trong ba năm

marsbit06/11 11:03

活动图片