# Bài viết Liên quan Hiệu quả Chi phí

Trung tâm Tin tức HTX cung cấp những bài viết mới nhất và phân tích chuyên sâu về "Hiệu quả Chi phí", bao gồm xu hướng thị trường, cập nhật dự án, phát triển công nghệ và chính sách quản lý trong ngành tiền kỹ thuật số.

"Kỳ thi cuối cùng của tác nhân thông minh", Fable 5 bất ngờ thua GPT 5.5

Kết quả bất ngờ từ bài kiểm tra "Agents' Last Exam" (ALE) - một tiêu chuẩn đo lường mới khắt khe dành cho AI Agent do UC Berkeley công bố. Trong bài kiểm tra yêu cầu thực hiện các công việc thực tế như tạo mô hình 3D trong Siemens NX, dựng cảnh game trong Unreal Engine hay tổng hợp hiệu ứng trong Adobe After Effects, GPT 5.5 của OpenAI đã vượt qua Claude Fable 5 vốn được đánh giá cao trước đó. Trên bảng xếp hạng chính, GPT 5.5 chiếm hai vị trí dẫn đầu với tỷ lệ hoàn thành nhiệm vụ lần lượt là 24.0% và 23.0%, trong khi Claude Fable 5 xếp thứ ba với 22.0%. Đáng chú ý, tỷ lệ hoàn thành tổng thể rất thấp, ngay cả mô hình mạnh nhất cũng chỉ đạt dưới 25%, và ở cấp độ khó nhất ("Last-Exam"), hầu hết các mô hình, bao gồm cả GPT 5.5 và Fable 5, đều đạt 0 điểm. ALE khác biệt với các bài kiểm tra truyền thống bằng cách tập trung vào khả năng "thực hiện công việc" thay vì kiến thức thuần túy. Nó bao gồm hơn 1500 nhiệm vụ từ 55 lĩnh vực ngành nghề thực tế, được xây dựng với sự tham gia của hơn 300 chuyên gia. Hệ thống chấm điểm tự động và có cơ chế luân chuyển câu hỏi để tránh gian lận. Bài kiểm tra cũng cho thấy sự chênh lệch lớn về chi phí và hiệu quả. Claude Fable 5 tiêu tốn gấp 4 lần chi phí so với GPT 5.5 Codex nhưng cho kết quả thấp hơn. Một số phân tích chỉ ra rằng không có mô hình nào là "vô địch toàn diện", và kết quả có thể bị ảnh hưởng bởi cơ chế "giảm cấp độ" (down-tuned) của Fable 5 đối với các tác vụ nhạy cảm. ALE được kỳ vọng sẽ trở thành thước đo quan trọng và thách thức mới cho sự phát triển của AI Agent trong tương lai.

marsbit06/12 05:04

"Kỳ thi cuối cùng của tác nhân thông minh", Fable 5 bất ngờ thua GPT 5.5

marsbit06/12 05:04

OpenClaw và Hermes, rốt cuộc cái nào phù hợp hơn với bạn?

Nếu năm 2025 là cuộc đua về "năng lực mô hình lớn", thì đầu 2026, trọng tâm chuyển sang một cuộc chiến cụ thể hơn: AI agent cá nhân thực sự ứng dụng thế nào. Hai dự án nổi bật là OpenClaw và Hermes Agent, đại diện cho hai triết lý khác nhau. OpenClaw, với 346,000 sao trên GitHub, nhấn mạnh quyền kiểm soát và khả năng tùy chỉnh. Nó có hệ sinh thái kỹ năng phong phú (44,000+ kỹ năng), linh hoạt lựa chọn mô hình (Claude, GPT-5.5, Kimi...), tích hợp đa nền tảng (Telegram, Discord, iMessage...), và hỗ trợ kiến trúc đa agent. Tuy nhiên, nó phức tạp để cấu hình và chi phí token cao hơn. Hermes Agent, từ Nous Research, tập trung vào tự động hóa và hiệu quả chi phí. Nó tự động học hỏi từ các tác vụ, cải thiện theo thời gian, có sẵn 40+ công cụ, chi phí token thấp hơn ~90%, và dễ dàng sử dụng ngay. Nhược điểm là tích hợp nền tảng còn hạn chế và tính năng đa agent vẫn đang phát triển. Lựa chọn phụ thuộc vào nhu cầu: OpenClaw cho người dùng kỹ thuật muốn toàn quyền kiểm soát, Hermes cho người dùng phổ thông ưu tiên sự đơn giản và chi phí thấp. Giống như so sánh Ferrari và Honda, mỗi loại phục vụ một đối tượng khác nhau.

marsbit04/26 06:44

OpenClaw và Hermes, rốt cuộc cái nào phù hợp hơn với bạn?

marsbit04/26 06:44

活动图片