# Bài viết Liên quan Điểm chuẩn AI

Trung tâm Tin tức HTX cung cấp những bài viết mới nhất và phân tích chuyên sâu về "Điểm chuẩn AI", bao gồm xu hướng thị trường, cập nhật dự án, phát triển công nghệ và chính sách quản lý trong ngành tiền kỹ thuật số.

Claude Science hoàn thành công việc 2 năm chỉ trong vài tuần: Tăng tốc nghiên cứu khoa học 10 lần đã thực sự đến?

Công việc từng mất hai năm giờ chỉ hoàn thành trong vài tuần. Nhà khoa học thần kinh Jérôme Lecoq tại Allen Institute và nhóm của ông đã sử dụng Claude Science - ứng dụng mới từ Anthropic, để rút ngắn đáng kể thời gian viết một bài tổng quan dài từ gần 2 năm xuống còn vài tuần. Claude Science được định vị là bàn làm việc AI dành cho nhà khoa học, tích hợp toàn bộ quy trình nghiên cứu - phân tích tài liệu, tính toán nhiều bước, tinh chỉnh biểu đồ, soạn thảo báo cáo - vào một môi trường thực thi duy nhất. Nó có thể chạy trên macOS, Linux hoặc kết nối với máy từ xa, đồng thời tự động hóa việc lập kế hoạch và gửi các tác vụ tính toán lớn lên cụm máy chủ. Một điểm đột phá là khả năng tái hiện (reproducibility). Mỗi biểu đồ được tạo ra đều đi kèm mã nguồn chính xác, môi trường chạy và lịch sử hội thoại đầy đủ. Người dùng có thể yêu cầu sửa biểu đồ bằng ngôn ngữ tự nhiên. Hệ thống sử dụng nhiều tác nhân AI (multi-agent). Một tác nhân điều phối phân công công việc, trong khi một tác nhân đánh giá chuyên biệt (reviewer agent) kiểm tra chéo độ chính xác của trích dẫn và tính toán, tạo thành cơ chế "đánh giá ngang hàng nội bộ" của AI. Con người vẫn giữ vai trò then chốt trong vòng lặp (human-in-the-loop), phê duyệt các quyết định quan trọng. Hiện tại, Claude Science tập trung đầu tiên vào lĩnh vực khoa học sự sống, với hỗ trợ tích hợp sẵn cho genomics, tế bào đơn, proteomics và hơn 60 cơ sở dữ liệu khoa học. Các trường hợp thử nghiệm cho thấy hiệu quả tăng tốc gấp 10 lần trong một số tác vụ cụ thể như viết tổng quan hay phân tích bộ gen. Trong khi Google và OpenAI tập trung phát triển các mô hình chuyên sâu (như AlphaFold, GPT-Rosalind), Anthropic tiếp cận bằng cách tối ưu hóa toàn bộ quy trình làm việc, nhằm đưa AI trở thành một phần thiết thực trong hoạt động hàng ngày của phòng thí nghiệm.

marsbit07/01 09:52

Claude Science hoàn thành công việc 2 năm chỉ trong vài tuần: Tăng tốc nghiên cứu khoa học 10 lần đã thực sự đến?

marsbit07/01 09:52

"Kỳ thi cuối cùng của tác nhân thông minh", Fable 5 bất ngờ thua GPT 5.5

Kết quả bất ngờ từ bài kiểm tra "Agents' Last Exam" (ALE) - một tiêu chuẩn đo lường mới khắt khe dành cho AI Agent do UC Berkeley công bố. Trong bài kiểm tra yêu cầu thực hiện các công việc thực tế như tạo mô hình 3D trong Siemens NX, dựng cảnh game trong Unreal Engine hay tổng hợp hiệu ứng trong Adobe After Effects, GPT 5.5 của OpenAI đã vượt qua Claude Fable 5 vốn được đánh giá cao trước đó. Trên bảng xếp hạng chính, GPT 5.5 chiếm hai vị trí dẫn đầu với tỷ lệ hoàn thành nhiệm vụ lần lượt là 24.0% và 23.0%, trong khi Claude Fable 5 xếp thứ ba với 22.0%. Đáng chú ý, tỷ lệ hoàn thành tổng thể rất thấp, ngay cả mô hình mạnh nhất cũng chỉ đạt dưới 25%, và ở cấp độ khó nhất ("Last-Exam"), hầu hết các mô hình, bao gồm cả GPT 5.5 và Fable 5, đều đạt 0 điểm. ALE khác biệt với các bài kiểm tra truyền thống bằng cách tập trung vào khả năng "thực hiện công việc" thay vì kiến thức thuần túy. Nó bao gồm hơn 1500 nhiệm vụ từ 55 lĩnh vực ngành nghề thực tế, được xây dựng với sự tham gia của hơn 300 chuyên gia. Hệ thống chấm điểm tự động và có cơ chế luân chuyển câu hỏi để tránh gian lận. Bài kiểm tra cũng cho thấy sự chênh lệch lớn về chi phí và hiệu quả. Claude Fable 5 tiêu tốn gấp 4 lần chi phí so với GPT 5.5 Codex nhưng cho kết quả thấp hơn. Một số phân tích chỉ ra rằng không có mô hình nào là "vô địch toàn diện", và kết quả có thể bị ảnh hưởng bởi cơ chế "giảm cấp độ" (down-tuned) của Fable 5 đối với các tác vụ nhạy cảm. ALE được kỳ vọng sẽ trở thành thước đo quan trọng và thách thức mới cho sự phát triển của AI Agent trong tương lai.

marsbit06/12 05:04

"Kỳ thi cuối cùng của tác nhân thông minh", Fable 5 bất ngờ thua GPT 5.5

marsbit06/12 05:04

活动图片