# Bài viết Liên quan Đánh giá AI

Trung tâm Tin tức HTX cung cấp những bài viết mới nhất và phân tích chuyên sâu về "Đánh giá AI", bao gồm xu hướng thị trường, cập nhật dự án, phát triển công nghệ và chính sách quản lý trong ngành tiền kỹ thuật số.

15 mô hình suy luận tập thể ‘đổ vỡ’: Phân tích chi tiết rủi ro tiềm ẩn trong chuỗi tư duy đằng sau đầu ra

Khi các mô hình suy luận quy mô lớn (LRM) phổ biến để lộ chuỗi suy luận trung gian cho người dùng và hệ thống hạ nguồn, một vấn đề lâu nay bị bỏ qua nổi lên: **Chỉ đánh giá an toàn dựa trên câu trả lời cuối cùng, liệu đã đủ?** Nghiên cứu từ Harvard, USC, Brown, MIT... đã đưa ra câu trả lời "Không", minh họa bằng việc chuỗi suy luận có thể bị lợi dụng để tạo nội dung nguy hiểm như hướng dẫn chế tạo bom. Nhóm đề xuất phương pháp giảm thiểu: "Chain of Risk". **Phương pháp đánh giá:** Nghiên cứu tách biệt đánh giá giai đoạn **suy luận (r)** và **trả lời (y)** của mô hình, áp dụng 20 nguyên tắc an toàn cho mỗi giai đoạn. Từ đó xác định ba dạng lỗi: - **Không an toàn (Unsafe):** Cả suy luận và trả lời đều không an toàn. - **Rò rỉ (Leak):** Suy luận không an toàn nhưng trả lời an toàn - nội dung nguy hại bị "rò rỉ" trong quá trình suy luận. - **Thoát hiểm (Escape):** Suy luận an toàn nhưng trả lời không an toàn. **Phát hiện chính:** 1. **Tính phổ biến:** Trên tất cả 15 mô hình được kiểm tra, mức độ nguy hiểm trung bình của chuỗi suy luận luôn **cao hơn** câu trả lời cuối cùng. 2. **Cấu trúc rủi ro:** Rủi ro tập trung vào các nguyên tắc như thông tin sai lệch, vi phạm pháp luật, định kiến, gây hại thể chất/tinh thần. Trong đó, nhóm "vi phạm pháp luật" có sự phân hóa mạnh nhất giữa suy luận và trả lời, là nguồn chính của lỗi "rò rỉ". **Phương pháp giảm thiểu - Điều hướng đa nguyên tắc thích ứng:** Đây là phương pháp can thiệp "hộp trắng" trong lúc kiểm tra. Với mỗi nguyên tắc an toàn, hệ thống xác định một "hướng điều hướng" dựa trên trạng thái kích hoạt nội bộ của mô hình. Khi phát hiện trạng thái hiện tại tiến gần điểm "không an toàn" của một nguyên tắc, hệ thống sẽ điều chỉnh nhẹ biểu diễn nội bộ của mô hình theo hướng an toàn trước khi hoàn tất quá trình suy luận. Thử nghiệm trên các mô hình mã nguồn mở cho thấy phương pháp này giảm đáng kể tỷ lệ không an toàn (ví dụ: 40.8% trên DeepSeek-R1-Qwen-7B) trong khi vẫn giữ được hơn 97% năng lực trên các bài kiểm tra chuẩn. **Kết luận:** Nghiên cứu không dừng ở việc đánh giá an toàn câu trả lời cuối cùng, mà cung cấp một khung nguyên tắc thống nhất để **chẩn đoán** và **kiểm soát** rủi ro ẩn trong chính quá trình suy luận của mô hình, từ đó đề xuất biện pháp can thiệp phù hợp. Hạn chế hiện tại là phương pháp điều hướng cần truy cập "hộp trắng" và chưa áp dụng trực tiếp cho các mô hình đóng.

marsbit07/06 23:57

15 mô hình suy luận tập thể ‘đổ vỡ’: Phân tích chi tiết rủi ro tiềm ẩn trong chuỗi tư duy đằng sau đầu ra

marsbit07/06 23:57

Phía sau bảng điểm AI, ẩn giấu một "người ra đề" người Hoa

Bài viết này giới thiệu Giáo sư Văn Hổ Trần (Chen Wenhu), một nhà khoa học máy tính người Hoa hiện công tác tại Đại học Waterloo, Canada, và là người đứng sau các bộ đánh giá tiêu chuẩn quan trọng trong ngành AI như MMLU-Pro, MMMU và MMMU-Pro. Khi các mô hình AI tiên tiến như GPT-4, Claude hay Gemini đạt điểm số gần tuyệt đối trên các bài kiểm tra cũ như MMLU, cộng đồng cần một thước đo mới để phân biệt khả năng thực sự. Năm 2024, nhóm của Giáo sư Văn Hổ Trần tại Phòng thí nghiệm TIGER (còn gọi là Hổ Đầu Bang) đã phát triển MMLU-Pro. Bộ dữ liệu mới này với hơn 12.000 câu hỏi đã mở rộng lựa chọn, tăng cường các câu hỏi suy luận và loại bỏ những câu đơn giản, giúp giảm đáng kể điểm số của các mô hình và đánh giá ổn định hơn. Ông cũng là tác giả chính của MMMU - bộ tiêu chuẩn đánh giá đa phương thức (multimodal) đầu tiên yêu cầu mô hình kết hợp hiểu biết hình ảnh phức tạp (biểu đồ, bản đồ, công thức) với kiến thức chuyên ngành để trả lời câu hỏi. Phiên bản nâng cấp MMMU-Pro sau đó được tạo ra để đảm bảo mô hình thực sự xử lý thông tin thị giác chứ không chỉ dựa vào văn bản. Bài viết cho thấy công việc của Giáo sư Văn Hổ Trần bắt nguồn từ hướng nghiên cứu lâu dài về hiểu thông tin phức tạp và trả lời câu hỏi dựa trên tri thức. Kinh nghiệm thực tế của ông từ khi tham gia phát triển mô hình Gemini tại Google DeepMind và hiện tại là tại Phòng thí nghiệm Siêu Trí tuệ của Meta, cùng với việc phòng thí nghiệm của ông cũng tự phát triển các mô hình (như UniVideo, Vamba), đã giúp ông thiết kế ra những bài đánh giá sát thực tế, phát hiện đúng điểm mạnh yếu của mô hình. Tác giả kết luận rằng trong khi sự chú ý của ngành AI thường đổ dồn vào các nhà sáng lập hay lãnh đạo nổi tiếng, thì sự đóng góp của các nhà nghiên cứu như Giáo sư Văn Hổ Trần trong việc xây dựng "ngôn ngữ chung" để đánh giá tiến bộ AI là vô cùng quan trọng.

marsbit06/19 09:20

Phía sau bảng điểm AI, ẩn giấu một "người ra đề" người Hoa

marsbit06/19 09:20

活动图片