# Bài viết Liên quan Hiệu suất năng lượng

Trung tâm Tin tức HTX cung cấp những bài viết mới nhất và phân tích chuyên sâu về "Hiệu suất năng lượng", bao gồm xu hướng thị trường, cập nhật dự án, phát triển công nghệ và chính sách quản lý trong ngành tiền kỹ thuật số.

Từ TPU đến Agent Tự Tiến Hóa: Jeff Dean Nhìn Nhận Bước Tiếp Theo của AI Như Thế Nào?

Trong buổi phỏng vấn tại YC Startup School 2026, Jeff Dean chia sẻ tầm nhìn về tương lai của AI. Ông nhấn mạnh rằng cuộc cạnh tranh AI không còn là ai có mô hình lớn hơn, mà là ai có thể tổ chức trí thông minh hiệu quả hơn. Điểm then chốt là sự chuyển dịch từ việc huấn luyện các mô hình đơn thuần sang xây dựng các hệ thống "Agent" có khả năng làm việc lâu dài, tự động thử nghiệm, xác minh và tích lũy kinh nghiệm. Các Agent này cần được trang bị công cụ, bộ nhớ, môi trường thực thi và cơ chế phản hồi rõ ràng. Jeff Dean cho rằng cơ hội cho các startup nằm ở những lĩnh vực chuyên biệt nơi các mô hình phổ thông hiện có tỷ lệ thành công rất thấp (gần 0-1%), nhờ vào dữ liệu độc quyền, công cụ đánh giá chuyên môn hoặc mô hình chuyên sâu. Ông cũng dự đoán phần cứng chuyên dụng cho suy luận (inference) với độ trễ thấp và tiêu thụ năng lượng thấp sẽ là chìa khóa. Khi chi phí tạo mã trở nên rẻ hơn, giá trị thực sự sẽ nằm ở khả năng xác định vấn đề đáng giải quyết, thiết kế thông số kỹ thuật rõ ràng và có "khiếu" thẩm định. Tương lai của AI là xây dựng các hệ thống có thể tự động hóa phương pháp khoa học, chạy các vòng lặp thử nghiệm với tốc độ cao để khám phá và cải tiến không ngừng.

marsbit15 giờ trước

Từ TPU đến Agent Tự Tiến Hóa: Jeff Dean Nhìn Nhận Bước Tiếp Theo của AI Như Thế Nào?

marsbit15 giờ trước

1 Megawatt nuôi sống 60.000 tác nhân thông minh, NVIDIA GB300 áp đảo thế hệ trước gấp 20 lần

Cùng một megawatt điện, hệ thống GB300 NVL72 mới nhất của Nvidia có thể xử lý đồng thời 61.400 tác nhân AI (agent), trong khi thế hệ trước H200 chỉ xử lý được khoảng 2.600. Khoảng cách hiệu suất lên tới 20 lần. Sự khác biệt này được đo bằng thước đo mới: AA-AgentPerf, tiêu chuẩn đo lường đầu tiên được thiết kế riêng cho tác nhân AI. Thay vì đo tokens mỗi giây, nó đo "số lượng tác nhân đồng thời trên mỗi megawatt", phản ánh khả năng hệ thống "nuôi" bao nhiêu agent làm việc thực tế cùng lúc với một mức điện năng cố định. Lý do là các bài kiểm tra cũ, tập trung vào các yêu cầu đơn lẻ có độ dài cố định, không thể đo lường chính xác khối lượng công việc phức tạp của agent. Một agent hoạt động giống như một cuộc chạy tiếp sức, chia nhỏ mục tiêu thành hàng chục hoặc hàng trăm bước, với các lần gọi mô hình lớn, gọi công cụ và ngữ cảnh ngày càng mở rộng được xâu chuỗi với nhau. AA-AgentPerf sử dụng các bản ghi agent lập trình thực tế, với các phiên dài tới 200 lượt và ngữ cảnh lên đến hơn 100.000 token. Nó đặt ra các mục tiêu cấp độ dịch vụ (SLO) về tốc độ phản hồi, sau đó đo xem hệ thống có thể duy trì bao nhiêu agent đồng thời trong khi vẫn đáp ứng SLO. Nó cũng cho phép tất cả các tối ưu hóa thực tế được sử dụng trong sản xuất. Kết quả cho thấy, đối với một mô hình MoE tiên tiến, GB300 NVL72 đạt 61.400 agent/MW (57,5 agent/GPU), trong khi H200 đạt khoảng 2.600 agent/MW (1,4 agent/GPU). Sự nhảy vọt này không chỉ đến từ sức mạnh chip đơn lẻ mà còn là chiến thắng ở cấp độ hệ thống. GB300 NVL72 kết nối 72 GPU thành một khối thống nhất qua NVLink, cho phép phân phối mô hình hiệu quả và chia sẻ dữ liệu nhanh chóng. Cần lưu ý rằng con số 61.400 là từ mô phỏng trong điều kiện kiểm tra chuẩn, sử dụng các bản ghi đã được ghi lại, không phải là 61.400 mô hình đầy đủ chạy độc lập trong môi trường thực tế. AA-AgentPerf vẫn là một tiêu chuẩn mới và hiệu suất có thể tiếp tục được cải thiện thông qua tối ưu hóa phần mềm.

marsbit07/06 01:05

1 Megawatt nuôi sống 60.000 tác nhân thông minh, NVIDIA GB300 áp đảo thế hệ trước gấp 20 lần

marsbit07/06 01:05

活动图片