# Bài viết Liên quan SOTA

Trung tâm Tin tức HTX cung cấp những bài viết mới nhất và phân tích chuyên sâu về "SOTA", bao gồm xu hướng thị trường, cập nhật dự án, phát triển công nghệ và chính sách quản lý trong ngành tiền kỹ thuật số.

Mô Hình Lớn Không Còn “Nói Suông” Khi Chấm Điểm Ảnh, Sử Dụng “Bằng Chứng Hình Ảnh” Như Biểu Đồ Cấu Trúc, Phổ Tần Để Chấm Điểm

Các mô hình đa phương thức lớn (MLLM) thường gặp khó khăn khi đánh giá chính xác chất lượng hình ảnh, do phụ thuộc vào đặc trưng thị giác thiên về ngữ nghĩa và kém nhạy với các suy giảm cấp thấp như nhiễu, mờ hay nén. Để giải quyết vấn đề này, nhóm nghiên cứu từ Đại học Công nghệ Tây Bắc và Đại học Khoa học và Công nghệ Hồng Kông đã đề xuất **IQA-T1**, một framework mới giúp MLLM đánh giá chất lượng hình ảnh dựa trên bằng chứng thị giác có cấu trúc. Thay vì chỉ dựa vào "cảm giác", IQA-T1 được trang bị một **bộ công cụ phân tích** chuyên dụng, có thể tự động gọi để tạo ra các **bằng chứng hình ảnh** như bản đồ nhiễu dư, phổ Fourier, hoặc bản đồ nhất quán định hướng gradient. Những bằng chứng này làm lộ rõ các khiếm khuyết, trở thành cơ sở minh bạch cho quá trình suy luận từng bước của mô hình. Phương pháp được huấn luyện qua hai giai đoạn: **Vi chỉnh có giám sát (SFT)** để học cách sử dụng công cụ và liên kết bằng chứng với đánh giá, sau đó là **Học tăng cường (RL)** với hàm thưởng tối ưu hóa chiến lược gọi công cụ, khuyến khích sử dụng ít nhưng đúng công cụ. Nhóm cũng xây dựng bộ dữ liệu **Q-Tool** chứa 11k chuỗi suy luận đa phương thức kết hợp bằng chứng hình ảnh và phân tích văn bản. Kết quả thử nghiệm trên 7 bộ dữ liệu chuẩn cho thấy IQA-T1 đạt hiệu suất tổng hợp tốt nhất (SOTA) với PLCC/SRCC trung bình lần lượt là 0.795/0.784, vượt trội cả trên dữ liệu méo mó tổng hợp và suy giảm thuật toán. Quan trọng hơn, phương pháp này cung cấp quá trình đánh giá **có thể giải thích và truy nguyên được**, mở ra hướng tiếp cận mới cho việc xây dựng các hệ thống đa phương thức đáng tin cậy.

marsbit07/20 07:49

Mô Hình Lớn Không Còn “Nói Suông” Khi Chấm Điểm Ảnh, Sử Dụng “Bằng Chứng Hình Ảnh” Như Biểu Đồ Cấu Trúc, Phổ Tần Để Chấm Điểm

marsbit07/20 07:49

Đột phá mới trong Trí tuệ thể hiện: AutoNomy mở nguồn toàn bộ mô hình nền tảng robot đa năng ABot-M0

Lĩnh vực trí tuệ thể hiện (Embodied AI) đạt bước tiến đột phá: AutoNomy (Gaode) chính thức mở nguồn toàn bộ mô hình nền tảng robot đa năng ABot-M0 - mô hình kiến trúc thống nhất đầu tiên trên toàn cầu dành cho thao tác của robot. ABot-M0 hướng tới mục tiêu "một bộ não đa năng phù hợp với nhiều loại robot", phá vỡ rào cản giữa các phần cứng khác nhau, thúc đẩy ứng dụng trí tuệ thể hiện từ phòng thí nghiệm vào công nghiệp và gia đình. Về hiệu suất: ABot-M0 đạt tỷ lệ hoàn thành nhiệm vụ 80.5% trên benchmark Libero-Plus, vượt trội hơn 30% so với phương án tiêu chuẩn trước đó là Pi0, đồng thời thiết lập kỷ lục mới (SOTA) trên cả Libero và RoboCasa. AutoNomy mở nguồn toàn diện 3 khía cạnh: 1. **Dữ liệu:** Bộ dữ liệu UniACT với hơn 6 triệu đường dẫn thao tác thực tế. 2. **Thuật toán:** Công bố kiến trúc mô hình, framework huấn luyện, bao gồm thuật toán học đa tạp hành động (AML) sáng tạo và kiến trúc cảm nhận hai luồng. 3. **Mô hình:** Cung cấp mô hình đã tiền huấn luyện end-to-end và bộ công cụ đầy đủ, cho phép sử dụng ngay lập tức. Việc mở nguồn ABot-M0 nhằm giải quyết các vấn đề "ốc đảo dữ liệu" và "triển khai khó khăn", giảm đáng kể ngưỡng ứng dụng cho robot hợp tác công nghiệp và robot dịch vụ gia đình, xây dựng cầu nối giữa nghiên cứu học thuật và ứng dụng công nghiệp.

marsbit04/01 08:20

Đột phá mới trong Trí tuệ thể hiện: AutoNomy mở nguồn toàn bộ mô hình nền tảng robot đa năng ABot-M0

marsbit04/01 08:20

活动图片