Vừa rồi, Xiaohongshu công bố nguồn mở dots3-note, mô hình cùng series đạt điểm IMO 42 điểm tuyệt đối đã có mặt

marsbitXuất bản vào 2026-08-14Cập nhật gần nhất vào 2026-08-14

Tóm tắt

Vừa qua, Xiaohongshu đã chính thức mở nguồn mô hình **dots3-note preview**, một phiên bản thuộc series mô hình từng đạt điểm số hoàn hảo 42/42 tại Kỳ thi Olympic Toán học Quốc tế (IMO). Đây là phiên bản đầu tiên của series dots3 được công bố, tập trung giải quyết các nhiệm vụ dài hạn phức tạp và khó đánh giá trong thực tế. Mô hình với 280B tham số (16B kích hoạt) hỗ trợ cửa sổ ngữ cảnh siêu dài 512K, có khả năng đa phương thức (văn bản, hình ảnh, giọng nói) và được tối ưu cho lập luận phức tạp, Agent và cảm nhận đa phương thức. Bài viết trình bày các kết quả thử nghiệm cho thấy khả năng của dots3-note preview trong việc xử lý các tác vụ dài, không có đáp án chuẩn như: chơi tựa game chiến thuật "Slay the Spire II", giải câu đố ARC-AGI 3, lên kế hoạch trang trí nội thất dựa trên hình ảnh, và thậm chí tự phát triển một ứng dụng visionOS hoàn chỉnh từ đầu đến cuối. Mô hình thể hiện khả năng học hỏi liên tục, ghi nhớ thông tin, tự đánh giá và điều chỉnh sai sót trong quá trình thực thi. Sức mạnh này đến từ sự kết hợp các kỹ thuật như **TEMPO** (phương pháp tối ưu hóa ước tính giá trị cho các bước macro), cơ chế **Self-Critiquing** (tự phê bình) và huấn luyện tăng cường trên các nhiệm vụ siêu dài. Xiaohongshu cũng giới thiệu hai bộ tiêu chuẩn đánh giá mới là **VibeSearchBench** và **VibeLifeBench** để đo lường khả năng của Agent trong các tình huống thực tế mơ hồ và biến đổi. Việc mở nguồn lần này bổ sung mảnh ghép Agent vào hệ sinh thái mã nguồn mở trước đó của Xiaohongshu. Ph...

Cuối cùng, phiên bản cùng series của mô hình đạt huy chương vàng IMO điểm tuyệt đối do Xiaohongshu phát triển đã được công bố nguồn mở!

Tháng trước, mô hình lớn tự nghiên cứu của Xiaohongshu "dots-note-3.0" đã thiết lập một kỷ lục lịch sử: Lần đầu tiên AI đạt được điểm số chính thức 42/42 tại một cuộc thi Olympic Toán học quốc tế. Kể từ đó, vấn đề cộng đồng quan tâm nhất là khi nào mô hình sẽ được mở mã nguồn.

Adina Yakup, người phụ trách liên quan về nghiên cứu AI và hệ sinh thái cộng đồng tại HuggingFace. Nguồn ảnh: X Post

Ngay hôm nay, Phòng thí nghiệm mô hình dots của Xiaohongshu (sau đây gọi là Phòng thí nghiệm dots) đã thông báo mã nguồn mở dots3-note preview! Đây cũng là phiên bản mã nguồn mở đầu tiên của dòng mô hình dots3, nhắm tới các tác vụ dài hạn phức tạp hơn, khó đánh giá hơn và gần với thực tế hơn.

Xét về tham số, dots3-note preview có tổng số tham số là 280B, trong đó tham số kích hoạt là 16B, hỗ trợ cửa sổ ngữ cảnh siêu dài 512K, có khả năng hiểu đa phương thức văn bản, hình ảnh và giọng nói, và được tối ưu hóa cho lập luận phức tạp, Agent và nhận thức đa phương thức.

Điểm vào API: https://dots.ai/platform/

Huggingface: https://huggingface.co/dots-studio/dots3-note-prev

GitHub:https://github.com/studio-dots-ai/dots3-note-prev

Việc đạt điểm tuyệt đối IMO đã xác minh khả năng của dòng mô hình này trong lập luận và chứng minh toán học. Lần công bố nguồn mở này đặt thử thách vào một loại kịch bản khác khó chuẩn hóa hơn: lập kế hoạch du lịch, chuẩn bị đám cưới, kinh doanh mở cửa hàng. Loại tác vụ này không có câu trả lời duy nhất, thời gian thậm chí có thể kéo dài hàng giờ, hàng ngày hoặc lâu hơn.

dots3-note preview tập trung vào các tác vụ dài hạn, cũng đã trúng vào một hướng phát triển chính hiện tại của Agent: Chúng bắt đầu được yêu cầu đảm nhận công việc ngày càng dài và hoàn chỉnh. OpenAI từng tiết lộ, vào tháng 5 năm nay, hơn 70% người dùng để Codex xử lý công việc mà con người cần hơn một giờ để hoàn thành; đến tháng 6, 1% người dùng tích cực được sử dụng nhiều nhất nội bộ tại OpenAI tạo ra hơn 60 giờ "agent turns" mỗi ngày.

Tuy nhiên, khi nhiệm vụ rơi vào các bối cảnh khác nhau, độ khó sẽ nhanh chóng có sự chênh lệch. Khác với các lĩnh vực như toán học, mã lệnh và kỹ thuật nơi Agent đã thể hiện tương đối trưởng thành, môi trường sống thực tế càng mở hơn, nhu cầu càng mơ hồ. dots3-note preview chọn đặt "phòng thi" ở đây, đòi hỏi cao hơn về khả năng lập kế hoạch dài hạn, phán đoán và sửa lỗi của chính nó.

Xét về dữ liệu từ nhiều benchmark chính thống, trên nhiều tác vụ lập luận và tác nhân thông minh, mô hình có thể sánh ngang hoặc vượt qua các mô hình cỡ lớn với quy mô tham số gấp nhiều lần chính nó, khả năng thị giác thể hiện nổi bật trong phạm vi kích thước tương tự.

Nguồn ảnh: Blog kỹ thuật chính thức

Nguồn ảnh: Blog kỹ thuật chính thức

Trước đây, Xiaohongshu đã lần lượt công bố nguồn mở mô hình văn bản lớn dots.llm1, mô hình phân tích bố cục tài liệu đa ngôn ngữ dots.ocr và mô hình lớn hiểu thị giác đa phương thức dots.vlm1. Lần công bố nguồn mở mới nhất này, đã ghép thêm mảnh ghép Agent.

Kiểm tra thực tế:

Nó có thể thực sự hoàn thành các tác vụ phức tạp không?

Khả năng thực tế của mô hình, chỉ nhìn vào bảng xếp hạng là chưa đủ. Tiếp theo, chúng ta hãy xem qua vài trường hợp, để xem mô hình này khi đối mặt với các tác vụ có thông tin rời rạc, nhiều bước, môi trường thay đổi liên tục, sẽ tiến hành và giao kết quả như thế nào.

Tiếp quản "Slay the Spire II"

Đầu tiên, hãy để dots3-note preview tiếp quản một ván "Slay the Spire II".

Điểm khó của trò chơi này nằm ở chỗ, chọn đường nào, lấy lá bài nào, có nên thử thách tinh anh không, tiền vàng tiêu thế nào, trại chọn nghỉ ngơi hay nâng cấp, đều sẽ ảnh hưởng đến xác suất sống sót sau hàng chục lượt. Lựa chọn tối ưu cục bộ, rất có thể sẽ tạo ra mối nguy tiềm ẩn cho trận chiến Boss sau này.

Mô hình trước đó không được huấn luyện đặc biệt cho trò chơi này, nhưng có thể học cơ chế bài và kẻ địch dựa trên phản hồi chiến đấu, đồng thời quản lý sinh mệnh, bộ bài, tiền vàng và thuốc, cân nhắc liên tục giữa cửa hàng, trại và trận tinh anh, chơi cho đến tầng 33.

Bẻ khóa ARC-AGI 3 từ đầu

Trong tác vụ lập luận dài hạn ARC-AGI 3, quy tắc hoàn toàn không biết, mô hình cần quan sát hình ảnh, đưa ra giả thuyết, sau đó xác minh thông qua thao tác.

dots3-note preview dần phát hiện ra quy luật đồng bộ lên xuống và phản chiếu trái phải của hai khối, và mò ra các cơ chế như ô nguy hiểm, đánh dấu có thể di chuyển, công tắc áp suất và cửa cống.

Mỗi khi giả thuyết sai, nó sẽ khởi động cơ chế Self-Critiquing (Tự phê bình) để đánh giá lại, ghi quy tắc đã sửa vào memory.md, tệp này giống như sổ ghi chép của mô hình, liên tục lưu giữ sự hiểu biết động về môi trường.

Cuối cùng, mô hình thông qua 320 bước thao tác để giải hết 6 cấp độ.

Đọc hình ảnh giải quyết vấn đề trang trí nhà cửa

Khả năng học hỏi và lập luận liên tục, cuối cùng vẫn phải quay về với cuộc sống thực tế.

Ví dụ như vấn đề trang trí nhà cửa điển hình dưới đây: đồng thời tải lên sơ đồ mặt bằng và ảnh chụp thông số hai mẫu tủ lạnh, đồng thời bổ sung thông tin: bức tường bếp gần phía phòng sách đã làm mặt bàn dài 1,5 mét, bây giờ muốn đặt tủ lạnh ở bức tường này, rốt cuộc có đặt vừa không?

Thông tin then chốt phân tán ở các hình ảnh khác nhau và cách diễn đạt văn bản, mô hình cần kết hợp sơ đồ mặt bằng, kích thước mặt bàn hiện có và thông số kỹ thuật của hai mẫu tủ lạnh, tính toán không gian còn lại trên tường, đưa ra kết luận phù hợp. Nó còn chủ động nhắc nhở người dùng đến hiện trường đo lại xác nhận.

Toàn bộ quá trình liên quan đến hiểu không gian thị giác, lập luận phức tạp và gọi công cụ, cũng thể hiện khả năng của mô hình trong việc tạo ra câu trả lời tùy chỉnh dựa trên môi trường thực tế cá nhân.

Sử dụng sơ đồ mặt bằng vừa rồi, tiếp tục để mô hình thiết kế vài phương án trang trí phong cách gỗ tự nhiên cho phòng sách.

Mô hình giữ lại thông tin kích thước và ánh sáng đã nhận biết trước đó, tìm kiếm các ghi chép liên quan trên Xiaohongshu, sắp xếp bốn phương án phong cách gỗ tự nhiên và tạo trang web, liên tục hoàn thành việc đọc ảnh, tính toán, truy xuất và tạo nội dung.

Chạy thông suốt quy trình phát triển ứng dụng visionOS từ đầu đến cuối

Cuối cùng, hãy xem liệu dots3-note preview có thể độc lập hoàn thành một nhiệm vụ kỹ thuật phần mềm từ đầu đến cuối đầy đủ hay không, hãy để nó "tham khảo thiết kế của Xiaohongshu, phát triển một ứng dụng gốc cho Apple Vision Pro".

Sau khi nhận nhiệm vụ, mô hình không vội viết mã, nó trước tiên hiểu yêu cầu sản phẩm và tham khảo 9 ảnh giao diện, tự chủ xác định phương án phát triển, bao gồm lựa chọn lộ trình kỹ thuật SwiftUI+RealityKit, lập kế hoạch tổ chức các mô-đun khác nhau như cửa sổ, không gian đắm chìm và hiển thị sản phẩm 3D. Sau khi phương án được quyết định, nó tiếp tục chuẩn bị các tư liệu như hình ảnh cục bộ và mô hình 3D, sau đó từng bước hoàn thành việc triển khai mã.

Toàn bộ dự án tạo ra 12 tệp Swift, 1876 dòng mã, thực hiện các giao diện như luồng thông tin, trang cá nhân, tin nhắn riêng, sản phẩm, và tích hợp mô hình 3D USDZ. Sau đó, mô hình lại tự động tạo dự án Xcode, gọi xcodebuild để biên dịch, và hoàn thành kiểm tra trong visionOS Simulator, cuối cùng hiển thị "BUILD SUCCEEDED" (XÂY DỰNG THÀNH CÔNG).

Từ hiểu yêu cầu, chọn công nghệ đến triển khai mã, biên dịch và xác minh, quy trình phát triển này cuối cùng đã được chạy thông suốt.

Xét về sản phẩm cuối cùng, đã có một bộ tương tác không gian khá hoàn chỉnh. Luồng thông tin có thể cuộn, ghi chép có thể vào trang chi tiết, trang cá nhân, tin nhắn riêng có thể mở rộng như cửa sổ độc lập.

Người dùng còn có thể xem trực tiếp và chuyển đổi các sản phẩm 3D khác nhau trong giao diện mua sắm.

Không có câu trả lời tiêu chuẩn,

Mô hình phải tiếp tục học hỏi, và tự sửa lỗi

Từ vài nhóm kiểm tra thực tế, khả năng nổi bật nhất của dots3-note preview là vừa khám phá, vừa ghi nhớ thông tin mới, gặp thay đổi hoặc phán đoán sai thì điều chỉnh, cho đến khi giao ra kết quả. Nó làm được điều đó như thế nào? Điều then chốt nằm ở hai việc: học và ghi nhớ thông tin thực sự hữu ích, và kịp thời phát hiện sự sai lệch trong phán đoán của bản thân và sửa chữa.

Vấn đề đầu tiên Phòng thí nghiệm dots phải giải quyết là: Sau khi kết thúc huấn luyện, mô hình có thể tiếp tục học từ môi trường và người dùng hay không.

Để huấn luyện khả năng này, Phòng thí nghiệm dots đã xây dựng hàng nghìn môi trường mới lạ siêu dài hạn không phụ thuộc vào kiến thức tiên nghiệm, để Agent khám phá liên tục trong các kịch bản chưa từng tiếp xúc trước đó, học quy tắc và kiến thức mới thông qua tương tác với môi trường, dùng cho quyết định sau này. Và, khi độ dài nhiệm vụ vượt quá đáng kể cửa sổ ngữ cảnh của mô hình, mô hình không thể mãi dựa vào thông tin đã có trong ngữ cảnh. Sau khi được huấn luyện tăng cường, nó sẽ dần học cách giữ lại thông tin hữu ích cho việc giải quyết vấn đề sau này. Khả năng này đã được xác minh trên ARC-AGI 3.

Từ biểu đồ dưới đây có thể thấy, dots3-note preview trên ARC-AGI-3 với chi phí chưa đến 500 đô la đạt khoảng 0.35 điểm, điểm số tuyệt đối tuy thấp hơn Claude Opus 4.8 (high), nhưng hiệu quả chi phí rõ ràng cao hơn.

Nhưng để huấn luyện ra quá trình như vậy, lại gặp phải một phiền phức lớn khác: Chi phí khám phá cho các tác vụ dài hạn quá cao, Agent hoàn thành một lần khám phá có thể phải chạy hàng chục giờ. Nếu tiếp tục sử dụng phương pháp học tăng cường không giá trị (value-free) phụ thuộc vào phần thưởng cuối cùng, thường phải đợi toàn bộ lộ trình kết thúc mới nhận được tín hiệu huấn luyện, không chỉ hiệu quả thấp, mà cũng khó phán đoán thành quả hoặc thất bại cuối cùng quy cho bước cụ thể nào trước đó.

Các phương pháp actor-critic như PPO có thể làm giảm vấn đề này, nhưng critic truyền thống thường ước tính giá trị trạng thái hiện tại thông qua một lần tính toán tiến cố định. Đối mặt với các nhiệm vụ Agent phức tạp, actor có thể lập luận lặp lại, gọi công cụ rồi quyết định bước tiếp theo, critic không thể làm như vậy, rất dễ dẫn đến phán đoán không chính xác về tiến triển hiện tại.

Phòng thí nghiệm dots đã đề xuất TEMPO (Ước tính Giá trị theo Tỷ lệ Thời gian Kiểm tra với Tối ưu Chính sách Bước Vĩ mô), nó cắt một lộ trình rất dài thành nhiều macro-step (bước vĩ mô), mỗi bước chứa nhiều vòng tương tác giữa mô hình và môi trường. Sau khi một giai đoạn kết thúc, mô hình sẽ tạm chuyển từ actor sang critic, và thông qua lập luận, gọi công cụ và tỷ lệ thời gian kiểm tra (test-time scaling) để ước tính trạng thái hiện tại có thể nhận được bao nhiêu phần thưởng trong tương lai, sau đó biến đánh giá này thành tín hiệu huấn luyện cho lộ trình chưa kết thúc.

Đáng chú ý là, trong quá trình huấn luyện TEMPO, mô hình vừa phải học cách hành động, vừa phải học cách đánh giá bản thân hiện tại làm như thế nào. Nhờ khả năng tự đánh giá này, việc huấn luyện học tăng cường có thể đặt vào các nhiệm vụ dài hơn, và liên tục tối ưu hóa hành vi trong lộ trình dài.

Kết quả cho thấy, Ưu thế của TEMPO chủ yếu xuất hiện sau khi nhiệm vụ bước vào giai đoạn sâu hơn. Khi số vòng tương tác tăng, điểm số của GRPO và Base checkpoint có xu hướng đình trệ, TEMPO vẫn có thể tiếp tục cải thiện. Xét về tiến độ hoàn thành, cả ba cũng có sự chênh lệch rõ ràng ở nửa sau nhiệm vụ.

Trong khi đó, sau khi giới thiệu cơ chế Self-Critiquing (Tự phê bình), khả năng tự đánh giá của dots3-note preview mạnh hơn dự kiến ban đầu. Ngay cả khi Agent chưa giải quyết được vấn đề nào đó, nó cũng có thể phán đoán từ hai trạng thái trung gian bề ngoài tương tự nhau, xem trạng thái nào có nhiều hy vọng đạt được đột phá hơn.

Khả năng tự đánh giá như vậy ngoài việc dùng cho huấn luyện học tăng cường, cũng thể hiện ở giai đoạn lập luận. Trong cuộc thi IMO 2026 trước đây, phiên bản nhánh cùng series của dots3-note preview vừa tạo chứng minh, vừa thông qua gọi công cụ liên tục kiểm tra các chứng minh này, và dựa trên kết quả đánh giá để sửa đổi tối ưu, cuối cùng đạt điểm tuyệt đối.

Trong tương lai, Phòng thí nghiệm dots sẽ khám phá tự đánh giá đệ quy (recursive self-critiquing) trong các "nhiệm vụ mở", để mô hình trong điều kiện thiếu phần thưởng bên ngoài rõ ràng, có thể tự phán đoán tiến triển nhiệm vụ, và dựa vào đó điều chỉnh trí nhớ và lập kế hoạch hành động tiếp theo.

Bộ kết hợp "ghi nhớ chủ động + học tăng cường lộ trình siêu dài + tự đánh giá giữa chừng" của Xiaohongshu đã đưa ra một giải pháp cụ thể cho Agent dài hạn bước vào thế giới thực.

Tại sao Xiaohongshu chọn "Agent dài hạn cuộc sống thực"?

Đối với cộng đồng quan tâm cuộc sống Xiaohongshu này, nó tự nhiên gần gũi với loại nhiệm vụ cuộc sống thực này. Rất nhiều vấn đề người dùng thảo luận hàng ngày không chỉ không có câu trả lời duy nhất, nhiều lúc chính người dùng cũng chưa chắc đã nghĩ rõ cuối cùng muốn gì.

Du lịch, đám cưới, trang trí nhà cửa, phối đồ... vốn dĩ mang đặc điểm sở thích khác nhau, điều kiện liên tục bổ sung, thông tin đa phương thức dày đặc. Xiaohongshu lâu dài đối mặt chính là loại nhu cầu phức tạp dài hạn này, vì vậy rất tự nhiên lấy chúng làm trọng tâm nghiên cứu và ứng dụng Agent.

Agent trong các lĩnh vực khác như toán học, mã lệnh đã để ngành công nghiệp thấy rằng, trong môi trường mục tiêu tương đối rõ ràng, kết quả có thể xác minh, AI có thể chia nhỏ nhiệm vụ phức tạp thành lượng lớn bước, và liên tục thực thi trong thời gian dài. Điều kiện trong cuộc sống thực phức tạp hơn nhiều, không có các trường hợp kiểm tra có thể sử dụng ở mọi nơi, mục tiêu và ràng buộc còn thay đổi cùng với nhiệm vụ. Tính mơ hồ này khiến điểm yếu của Agent dài hạn bộc lộ rõ ràng hơn.

Hai bộ tiêu chuẩn đánh giá mà Phòng thí nghiệm dots công bố nguồn mở, đã đặt sự chênh lệch và thiếu sót một cách trực quan.

Một bộ là VibeSearchBench, nó xem xét "Khi người dùng không nói rõ nhu cầu một lần, Agent có thể hiểu họ thực sự muốn gì không", bao phủ 20 lĩnh vực, 200 nhiệm vụ. Đánh giá mô phỏng người dùng thực tế, trong đối thoại nhiều vòng bổ sung dần nhu cầu và điều kiện hạn chế, sau đó xem mô hình có thể hiểu chính xác người dùng muốn gì không.

Bộ khác là VibeLifeBench, nhấn mạnh sự thay đổi thời gian và môi trường, xem xét "Sau khi điều kiện bên ngoài thay đổi, Agent có thể theo kịp không", bao phủ 10 lĩnh vực, 20 nhiệm vụ, mỗi nhiệm vụ chứa 20 đến 30 giai đoạn, và thiết lập 1247 kiểm tra nguyên tử (atomic checks), dùng để kiểm tra trạng thái có thể duy trì nhất quán không, công cụ có thực thi đúng không, và cuối cùng giao ra cái gì.

Kết quả cho thấy, ngay cả các mô hình hàng đầu toàn cầu như Claude Opus 5, GPT-5.5, trong hai bộ tiêu chuẩn đánh giá này cũng không đạt đến mức đỗ đã đặt.

Hình trái là bảng xếp hạng đầy đủ của VibeSearchBench, hình phải là bảng xếp hạng đầy đủ của VibeLifeBench.

Trang chủ VibeSearchBench: https://vibebench.github.io/VibeSearchBench.github.io/

Trang chủ VibeLifeBench: https://vibebench.github.io/VibeLifeBench_homepage/

Những kết quả này nói lên một điều: Mô hình đã đủ mạnh ở các nhiệm vụ điểm đơn độ khó cao, nhưng duy trì ổn định khả năng này trong vài giờ hoặc lâu hơn, vẫn là nơi Agent chưa với tới. Sự khám phá và bố trí của Xiaohongshu về điều này mới chỉ bắt đầu.

dots3-note là phiên bản nhẹ nhất trong dòng dots3, phiên bản preview hiện đã mở mã nguồn vẫn còn không gian để tiếp tục tối ưu hóa về trải nghiệm và chi tiết. Theo tiết lộ của Phòng thí nghiệm dots, phiên bản chính thức của dots3-note cũng sẽ được mở mã nguồn trong thời gian tới. Trong tương lai, dòng dots3 còn sẽ ra mắt jazz và aria, cùng với note tạo thành ba cấp độ, bao phủ nhu cầu ứng dụng với độ phức tạp nhiệm vụ, tốc độ phản hồi và chi phí tính toán khác nhau.

Chi tiết thêm về phương pháp huấn luyện vui lòng xem blog kỹ thuật chính thức (tiếng Trung): https://studio.dots.ai/dots/dots3-zh.html

Bài viết này đến từ tài khoản công chúng WeChat "机器之心" (ID:almosthuman2014), tác giả: 关注Agent的机器之心, biên tập viên: 杜伟, 杨文

Câu hỏi Liên quan

QMô hình dots3-note preview của Xiaohongshu có thông số kỹ thuật chính là gì?

AMô hình dots3-note preview có tổng số tham số là 280 tỷ (280B), trong đó số tham số được kích hoạt là 16 tỷ (16B). Nó hỗ trợ cửa sổ ngữ cảnh siêu dài 512K token, có khả năng hiểu đa phương thức (văn bản, hình ảnh và giọng nói), và được tối ưu hóa cho các nhiệm vụ lập luận phức tạp, tác nhân AI (Agent) và nhận thức đa phương thức.

QMô hình này đã thể hiện khả năng xử lý nhiệm vụ dài hạn và phức tạp như thế nào trong các bài kiểm tra thực tế?

ATrong các bài kiểm tra thực tế, mô hình đã thể hiện khả năng xử lý nhiệm vụ dài hạn và phức tạp thông qua việc tự học và điều chỉnh. Ví dụ: nó chơi trò chơi 'Slay the Spire II' đến tầng 33 mà không cần đào tạo trước; tự khám phá và giải quyết các quy tắc trong ARC-AGI 3 với hơn 300 bước; giải quyết vấn đề lắp đặt tủ lạnh thực tế từ hình ảnh và thông số kỹ thuật; và hoàn thành một dự án phát triển ứng dụng visionOS đầy đủ từ đầu đến cuối, bao gồm lập kế hoạch, viết mã, biên dịch và kiểm tra.

QTEMPO là gì và nó đã giúp cải thiện hiệu suất của mô hình trong các nhiệm vụ dài hạn như thế nào?

ATEMPO (Test-time-scaled Value Estimation with Macro-step Policy Optimization) là một phương pháp học tăng cường do phòng thí nghiệm dots phát triển. Nó chia một nhiệm vụ dài thành nhiều 'macro-step'. Sau mỗi giai đoạn, mô hình sẽ chuyển từ vai trò 'actor' sang 'critic' để tự đánh giá tiến độ và ước tính phần thưởng tiềm năng trong tương lai. Điều này cung cấp tín hiệu huấn luyện ngay cả khi nhiệm vụ chưa kết thúc, giúp mô hình học cách hành động và tự đánh giá hiệu quả hơn trong các nhiệm vụ rất dài, đặc biệt là ở các giai đoạn phức tạp về sau.

QXiaohongshu đã phát triển những tiêu chuẩn đánh giá (benchmark) nào để đo lường khả năng xử lý nhu cầu thực tế của các Agent AI?

AXiaohongshu (dots lab) đã phát triển hai bộ tiêu chuẩn đánh giá chính: VibeSearchBench và VibeLifeBench. VibeSearchBench tập trung vào việc Agent có thể hiểu nhu cầu không rõ ràng của người dùng qua đối thoại đa vòng trong 20 lĩnh vực với 200 nhiệm vụ. VibeLifeBench nhấn mạnh vào sự thay đổi theo thời gian và môi trường, đánh giá khả năng Agent theo kịp khi điều kiện thay đổi, bao gồm 10 lĩnh vực, 20 nhiệm vụ với nhiều giai đoạn và 1247 bài kiểm tra chi tiết.

QKế hoạch tương lai cho dòng mô hình dots3 của Xiaohongshu là gì?

ATheo phòng thí nghiệm dots, phiên bản chính thức của dots3-note sẽ sớm được mã nguồn mở. Trong tương lai, dòng mô hình dots3 sẽ bao gồm ba cấp độ: note, jazz và aria, nhằm đáp ứng các nhu cầu ứng dụng khác nhau về độ phức tạp nhiệm vụ, tốc độ phản hồi và chi phí tính toán.

Nội dung Liên quan

Phân tích Báo cáo của Nomura: Kết quả kinh doanh của Lumentum xác nhận tình trạng thiếu chip quang tiếp diễn, nhà cung cấp Trung Quốc đón cơ hội cấu trúc

Bài nghiên cứu của Nomura phân tích báo cáo kết quả kinh doanh của Lumentum, nhấn mạnh tình trạng thiếu hụt chip quang toàn cầu dự kiến kéo dài ít nhất đến năm tài chính 2026-2027. Doanh thu quý tháng 6 của Lumentum tăng 109%, với nhu cầu mạnh mẽ trên tất cả các phân khúc laser. Báo cáo chỉ ra rằng sự mất cân bằng cung-cầu đối với laser EML và CW vẫn rõ rệt, hỗ trợ triển vọng tăng trưởng cho thị trường module quang. Lộ trình nâng cấp công nghệ được xác định rõ, với NPO (quang học gần đóng gói) là bước trung gian trước khi CPO (quang học đồng đóng gói) được áp dụng rộng rãi vào cuối 2027-2028. Doanh thu OCS (bộ chuyển mạch mạch quang) của Lumentum tăng gấp đôi, hướng tới mục tiêu 400 triệu USD. Nomura cho rằng tình trạng thiếu hụt tạo ra cơ hội cấu trúc cho các nhà cung cấp Trung Quốc. Công ty như Yongjie Technology có thể giành thị phần chip quang toàn cầu, trong khi Zhongji Xuchuang và Tianfu Communication hưởng lợi từ nâng cấp lên 1.6T, thâm nhập silicon photonics và cơ hội gia tăng từ NPO. Xu hướng này nhấn mạnh nhu cầu băng thông từ các trung tâm dữ liệu AI đang thúc đẩy chuỗi cung ứng quang học, tạo ra khoảng thời gian quan trọng cho ngành công nghiệp Trung Quốc.

marsbit10 phút trước

Phân tích Báo cáo của Nomura: Kết quả kinh doanh của Lumentum xác nhận tình trạng thiếu chip quang tiếp diễn, nhà cung cấp Trung Quốc đón cơ hội cấu trúc

marsbit10 phút trước

Goldman Sachs ra tuyên bố về quyết định lãi suất tiếp theo của Fed! "Vào tháng 9..."

Phân tích gia Robert Kaplan của Goldman Sachs cho rằng quyết định của Fed giữ nguyên lãi suất vào tháng 7 là "hoàn toàn đúng đắn". Ông nhấn mạnh các nhà hoạch định chính sách nên tiếp cận dữ liệu trước cuộc họp tháng 9 một cách minh bạch, tránh những định hướng cứng nhắc từ trước. Kaplan chỉ ra môi trường kinh tế hiện tại chứa đựng nhiều yếu tố đẩy và kéo lạm phát. Đầu tư lớn vào cơ sở hạ tầng AI, thuế quan, thị trường lao động thắt chặt và giá dầu tăng có thể gây áp lực lạm phát. Ngược lại, việc ứng dụng AI có thể thúc đẩy năng suất, giảm chi phí và đẩy nhanh quá trình giảm lạm phát. Do đó, Fed cần đánh giá toàn diện các sự kiện kinh tế. Ông cũng bình luận về bài phát biểu sắp tới của Chủ tịch Fed tại Hội nghị Jackson Hole, cho rằng nó nên giải thích rõ ràng lý do giữ nguyên lãi suất tháng 7 thay vì mang tính triết lý chung chung, để thị trường hiểu rõ hơn về cách tiếp cận chính sách hiện tại. Ngoài ra, Kaplan cho rằng việc lợi tức trái phiếu kho bạc dài hạn của Mỹ tăng chủ yếu là do mất cân đối cung-cầu cơ cấu từ thâm hụt ngân sách lớn, không trực tiếp do chính sách của Fed.

cryptonews.ru31 phút trước

Goldman Sachs ra tuyên bố về quyết định lãi suất tiếp theo của Fed! "Vào tháng 9..."

cryptonews.ru31 phút trước

Tether lần đầu tiên trải qua cuộc kiểm toán độc lập toàn diện

Công ty phát hành stablecoin lớn nhất Tether đã lần đầu tiên vượt qua một cuộc kiểm toán độc lập toàn diện do công ty tư vấn lớn KPMG (Mỹ) thực hiện. Báo cáo tài chính năm 2025 cho thấy dự trữ của công ty vượt quá nghĩa vụ phải trả là 6,814 tỷ USD. Khác với các báo cáo hàng quý trước đây, cuộc kiểm toán lần này bao gồm phạm vi rộng hơn: giao dịch cả năm, hệ thống kế toán nội bộ, hồ sơ sở hữu tài sản và phương pháp định giá. KPMG cũng đích thân kiểm tra số vàng vật chất đảm bảo cho stablecoin vàng Tether Gold (XAUt). Trong năm 2025, lợi nhuận ròng của Tether vượt 10 tỷ USD, chủ yếu từ đầu tư vào trái phiếu kho bạc Mỹ. Stablecoin USDT của họ vẫn thống trị thị trường với vốn hóa khoảng 183 tỷ USD, chiếm 61% thị phần. Công ty cũng đang đa dạng hóa bằng các khoản đầu tư vào ngân hàng số, nền tảng tiền mã hóa và công nghệ AI. Kiểm toán thành công này giải quyết mối lo ngại lâu nay về tính minh bạch của Tether, vốn từng bị CFTC phạt vào năm 2021. Tuy nhiên, cần lưu ý rằng báo cáo chỉ phản ánh tình trạng tại một thời điểm (31/12/2025) chứ không phải giám sát liên tục.

cryptonews.ru40 phút trước

Tether lần đầu tiên trải qua cuộc kiểm toán độc lập toàn diện

cryptonews.ru40 phút trước

Thợ đào Bitcoin ngày càng kiếm tiền từ AI

Các công ty khai thác Bitcoin công khai đang cắt giảm năng lực tính toán nhanh hơn tốc độ giảm của tỷ lệ băm toàn mạng, do các nhà điều hành chuyển hướng ngày càng nhiều năng lượng và cơ sở hạ tầng trung tâm dữ liệu sang các tác vụ trí tuệ nhân tạo (AI) và điện toán hiệu suất cao (HPC). Ngành công nghiệp này đang ngày càng rời xa hoạt động khai thác tiền điện tử thuần túy. Báo cáo từ BlocksBridge Consulting cho thấy tỷ lệ băm đã triển khai của một nhóm các thợ đào Bitcoin lớn đã giảm 13,4%, từ 368,3 EH/s trong quý IV/2025 xuống 319 EH/s trong quý II/2026. Nếu loại trừ Bitdeer - công ty vẫn tập trung vào khai thác - thì mức giảm lên tới 21,2%. Trong khi đó, tỷ lệ băm trung bình của toàn mạng Bitcoin chỉ giảm 10,6% trong cùng kỳ. Sự thay đổi này diễn ra khi ngày càng nhiều thợ đào ghi nhận doanh thu tăng từ các lĩnh vực không liên quan đến khai thác Bitcoin. Ví dụ, Core Scientific kiếm được 136,7 triệu USD từ cho thuê năng lực máy tính trong quý II, so với chỉ 27,5 triệu USD từ khai thác. TeraWulf cũng có doanh thu từ HPC là 31,9 triệu USD, cao hơn 12,8 triệu USD từ khai thác. Các chuyên gia mô tả đây là sự đảo ngược chu kỳ bắt đầu sau lệnh cấm khai thác Bitcoin ở Trung Quốc năm 2021. Lợi nhuận khai thác thấp cùng với nhu cầu về cơ sở hạ tầng AI tăng mạnh từ năm 2022 đã thúc đẩy một số thợ đào chuyển đổi hoàn toàn cơ sở vật chất sang các nhiệm vụ khác. Tuy nhiên, việc chuyển đổi cơ sở hạ tạ tầng khai thác sang phục vụ AI là một quá trình phức tạp và tốn kém, do sự khác biệt về yêu cầu phần cứng và hệ thống làm mát giữa thiết bị ASIC cho khai thác và GPU cho AI. Mô hình kinh doanh mới này có tính ổn định cao hơn nhờ các hợp đồng cho thuê dài hạn, nhưng vẫn tiềm ẩn rủi ro nếu nhu cầu điện toán cho AI suy giảm trong tương lai.

cryptonews.ru41 phút trước

Thợ đào Bitcoin ngày càng kiếm tiền từ AI

cryptonews.ru41 phút trước

Giao dịch

Giao ngay
活动图片