Vừa rồi, Xiaohongshu công bố nguồn mở dots3-note, mô hình cùng series đạt điểm IMO 42 điểm tuyệt đối đã có mặt

marsbitXuất bản vào 2026-08-14Cập nhật gần nhất vào 2026-08-14

Tóm tắt

Vừa qua, Xiaohongshu đã chính thức mở nguồn mô hình **dots3-note preview**, một phiên bản thuộc series mô hình từng đạt điểm số hoàn hảo 42/42 tại Kỳ thi Olympic Toán học Quốc tế (IMO). Đây là phiên bản đầu tiên của series dots3 được công bố, tập trung giải quyết các nhiệm vụ dài hạn phức tạp và khó đánh giá trong thực tế. Mô hình với 280B tham số (16B kích hoạt) hỗ trợ cửa sổ ngữ cảnh siêu dài 512K, có khả năng đa phương thức (văn bản, hình ảnh, giọng nói) và được tối ưu cho lập luận phức tạp, Agent và cảm nhận đa phương thức. Bài viết trình bày các kết quả thử nghiệm cho thấy khả năng của dots3-note preview trong việc xử lý các tác vụ dài, không có đáp án chuẩn như: chơi tựa game chiến thuật "Slay the Spire II", giải câu đố ARC-AGI 3, lên kế hoạch trang trí nội thất dựa trên hình ảnh, và thậm chí tự phát triển một ứng dụng visionOS hoàn chỉnh từ đầu đến cuối. Mô hình thể hiện khả năng học hỏi liên tục, ghi nhớ thông tin, tự đánh giá và điều chỉnh sai sót trong quá trình thực thi. Sức mạnh này đến từ sự kết hợp các kỹ thuật như **TEMPO** (phương pháp tối ưu hóa ước tính giá trị cho các bước macro), cơ chế **Self-Critiquing** (tự phê bình) và huấn luyện tăng cường trên các nhiệm vụ siêu dài. Xiaohongshu cũng giới thiệu hai bộ tiêu chuẩn đánh giá mới là **VibeSearchBench** và **VibeLifeBench** để đo lường khả năng của Agent trong các tình huống thực tế mơ hồ và biến đổi. Việc mở nguồn lần này bổ sung mảnh ghép Agent vào hệ sinh thái mã nguồn mở trước đó của Xiaohongshu. Ph...

Cuối cùng, phiên bản cùng series của mô hình đạt huy chương vàng IMO điểm tuyệt đối do Xiaohongshu phát triển đã được công bố nguồn mở!

Tháng trước, mô hình lớn tự nghiên cứu của Xiaohongshu "dots-note-3.0" đã thiết lập một kỷ lục lịch sử: Lần đầu tiên AI đạt được điểm số chính thức 42/42 tại một cuộc thi Olympic Toán học quốc tế. Kể từ đó, vấn đề cộng đồng quan tâm nhất là khi nào mô hình sẽ được mở mã nguồn.

Adina Yakup, người phụ trách liên quan về nghiên cứu AI và hệ sinh thái cộng đồng tại HuggingFace. Nguồn ảnh: X Post

Ngay hôm nay, Phòng thí nghiệm mô hình dots của Xiaohongshu (sau đây gọi là Phòng thí nghiệm dots) đã thông báo mã nguồn mở dots3-note preview! Đây cũng là phiên bản mã nguồn mở đầu tiên của dòng mô hình dots3, nhắm tới các tác vụ dài hạn phức tạp hơn, khó đánh giá hơn và gần với thực tế hơn.

Xét về tham số, dots3-note preview có tổng số tham số là 280B, trong đó tham số kích hoạt là 16B, hỗ trợ cửa sổ ngữ cảnh siêu dài 512K, có khả năng hiểu đa phương thức văn bản, hình ảnh và giọng nói, và được tối ưu hóa cho lập luận phức tạp, Agent và nhận thức đa phương thức.

Điểm vào API: https://dots.ai/platform/

Huggingface: https://huggingface.co/dots-studio/dots3-note-prev

GitHub:https://github.com/studio-dots-ai/dots3-note-prev

Việc đạt điểm tuyệt đối IMO đã xác minh khả năng của dòng mô hình này trong lập luận và chứng minh toán học. Lần công bố nguồn mở này đặt thử thách vào một loại kịch bản khác khó chuẩn hóa hơn: lập kế hoạch du lịch, chuẩn bị đám cưới, kinh doanh mở cửa hàng. Loại tác vụ này không có câu trả lời duy nhất, thời gian thậm chí có thể kéo dài hàng giờ, hàng ngày hoặc lâu hơn.

dots3-note preview tập trung vào các tác vụ dài hạn, cũng đã trúng vào một hướng phát triển chính hiện tại của Agent: Chúng bắt đầu được yêu cầu đảm nhận công việc ngày càng dài và hoàn chỉnh. OpenAI từng tiết lộ, vào tháng 5 năm nay, hơn 70% người dùng để Codex xử lý công việc mà con người cần hơn một giờ để hoàn thành; đến tháng 6, 1% người dùng tích cực được sử dụng nhiều nhất nội bộ tại OpenAI tạo ra hơn 60 giờ "agent turns" mỗi ngày.

Tuy nhiên, khi nhiệm vụ rơi vào các bối cảnh khác nhau, độ khó sẽ nhanh chóng có sự chênh lệch. Khác với các lĩnh vực như toán học, mã lệnh và kỹ thuật nơi Agent đã thể hiện tương đối trưởng thành, môi trường sống thực tế càng mở hơn, nhu cầu càng mơ hồ. dots3-note preview chọn đặt "phòng thi" ở đây, đòi hỏi cao hơn về khả năng lập kế hoạch dài hạn, phán đoán và sửa lỗi của chính nó.

Xét về dữ liệu từ nhiều benchmark chính thống, trên nhiều tác vụ lập luận và tác nhân thông minh, mô hình có thể sánh ngang hoặc vượt qua các mô hình cỡ lớn với quy mô tham số gấp nhiều lần chính nó, khả năng thị giác thể hiện nổi bật trong phạm vi kích thước tương tự.

Nguồn ảnh: Blog kỹ thuật chính thức

Nguồn ảnh: Blog kỹ thuật chính thức

Trước đây, Xiaohongshu đã lần lượt công bố nguồn mở mô hình văn bản lớn dots.llm1, mô hình phân tích bố cục tài liệu đa ngôn ngữ dots.ocr và mô hình lớn hiểu thị giác đa phương thức dots.vlm1. Lần công bố nguồn mở mới nhất này, đã ghép thêm mảnh ghép Agent.

Kiểm tra thực tế:

Nó có thể thực sự hoàn thành các tác vụ phức tạp không?

Khả năng thực tế của mô hình, chỉ nhìn vào bảng xếp hạng là chưa đủ. Tiếp theo, chúng ta hãy xem qua vài trường hợp, để xem mô hình này khi đối mặt với các tác vụ có thông tin rời rạc, nhiều bước, môi trường thay đổi liên tục, sẽ tiến hành và giao kết quả như thế nào.

Tiếp quản "Slay the Spire II"

Đầu tiên, hãy để dots3-note preview tiếp quản một ván "Slay the Spire II".

Điểm khó của trò chơi này nằm ở chỗ, chọn đường nào, lấy lá bài nào, có nên thử thách tinh anh không, tiền vàng tiêu thế nào, trại chọn nghỉ ngơi hay nâng cấp, đều sẽ ảnh hưởng đến xác suất sống sót sau hàng chục lượt. Lựa chọn tối ưu cục bộ, rất có thể sẽ tạo ra mối nguy tiềm ẩn cho trận chiến Boss sau này.

Mô hình trước đó không được huấn luyện đặc biệt cho trò chơi này, nhưng có thể học cơ chế bài và kẻ địch dựa trên phản hồi chiến đấu, đồng thời quản lý sinh mệnh, bộ bài, tiền vàng và thuốc, cân nhắc liên tục giữa cửa hàng, trại và trận tinh anh, chơi cho đến tầng 33.

Bẻ khóa ARC-AGI 3 từ đầu

Trong tác vụ lập luận dài hạn ARC-AGI 3, quy tắc hoàn toàn không biết, mô hình cần quan sát hình ảnh, đưa ra giả thuyết, sau đó xác minh thông qua thao tác.

dots3-note preview dần phát hiện ra quy luật đồng bộ lên xuống và phản chiếu trái phải của hai khối, và mò ra các cơ chế như ô nguy hiểm, đánh dấu có thể di chuyển, công tắc áp suất và cửa cống.

Mỗi khi giả thuyết sai, nó sẽ khởi động cơ chế Self-Critiquing (Tự phê bình) để đánh giá lại, ghi quy tắc đã sửa vào memory.md, tệp này giống như sổ ghi chép của mô hình, liên tục lưu giữ sự hiểu biết động về môi trường.

Cuối cùng, mô hình thông qua 320 bước thao tác để giải hết 6 cấp độ.

Đọc hình ảnh giải quyết vấn đề trang trí nhà cửa

Khả năng học hỏi và lập luận liên tục, cuối cùng vẫn phải quay về với cuộc sống thực tế.

Ví dụ như vấn đề trang trí nhà cửa điển hình dưới đây: đồng thời tải lên sơ đồ mặt bằng và ảnh chụp thông số hai mẫu tủ lạnh, đồng thời bổ sung thông tin: bức tường bếp gần phía phòng sách đã làm mặt bàn dài 1,5 mét, bây giờ muốn đặt tủ lạnh ở bức tường này, rốt cuộc có đặt vừa không?

Thông tin then chốt phân tán ở các hình ảnh khác nhau và cách diễn đạt văn bản, mô hình cần kết hợp sơ đồ mặt bằng, kích thước mặt bàn hiện có và thông số kỹ thuật của hai mẫu tủ lạnh, tính toán không gian còn lại trên tường, đưa ra kết luận phù hợp. Nó còn chủ động nhắc nhở người dùng đến hiện trường đo lại xác nhận.

Toàn bộ quá trình liên quan đến hiểu không gian thị giác, lập luận phức tạp và gọi công cụ, cũng thể hiện khả năng của mô hình trong việc tạo ra câu trả lời tùy chỉnh dựa trên môi trường thực tế cá nhân.

Sử dụng sơ đồ mặt bằng vừa rồi, tiếp tục để mô hình thiết kế vài phương án trang trí phong cách gỗ tự nhiên cho phòng sách.

Mô hình giữ lại thông tin kích thước và ánh sáng đã nhận biết trước đó, tìm kiếm các ghi chép liên quan trên Xiaohongshu, sắp xếp bốn phương án phong cách gỗ tự nhiên và tạo trang web, liên tục hoàn thành việc đọc ảnh, tính toán, truy xuất và tạo nội dung.

Chạy thông suốt quy trình phát triển ứng dụng visionOS từ đầu đến cuối

Cuối cùng, hãy xem liệu dots3-note preview có thể độc lập hoàn thành một nhiệm vụ kỹ thuật phần mềm từ đầu đến cuối đầy đủ hay không, hãy để nó "tham khảo thiết kế của Xiaohongshu, phát triển một ứng dụng gốc cho Apple Vision Pro".

Sau khi nhận nhiệm vụ, mô hình không vội viết mã, nó trước tiên hiểu yêu cầu sản phẩm và tham khảo 9 ảnh giao diện, tự chủ xác định phương án phát triển, bao gồm lựa chọn lộ trình kỹ thuật SwiftUI+RealityKit, lập kế hoạch tổ chức các mô-đun khác nhau như cửa sổ, không gian đắm chìm và hiển thị sản phẩm 3D. Sau khi phương án được quyết định, nó tiếp tục chuẩn bị các tư liệu như hình ảnh cục bộ và mô hình 3D, sau đó từng bước hoàn thành việc triển khai mã.

Toàn bộ dự án tạo ra 12 tệp Swift, 1876 dòng mã, thực hiện các giao diện như luồng thông tin, trang cá nhân, tin nhắn riêng, sản phẩm, và tích hợp mô hình 3D USDZ. Sau đó, mô hình lại tự động tạo dự án Xcode, gọi xcodebuild để biên dịch, và hoàn thành kiểm tra trong visionOS Simulator, cuối cùng hiển thị "BUILD SUCCEEDED" (XÂY DỰNG THÀNH CÔNG).

Từ hiểu yêu cầu, chọn công nghệ đến triển khai mã, biên dịch và xác minh, quy trình phát triển này cuối cùng đã được chạy thông suốt.

Xét về sản phẩm cuối cùng, đã có một bộ tương tác không gian khá hoàn chỉnh. Luồng thông tin có thể cuộn, ghi chép có thể vào trang chi tiết, trang cá nhân, tin nhắn riêng có thể mở rộng như cửa sổ độc lập.

Người dùng còn có thể xem trực tiếp và chuyển đổi các sản phẩm 3D khác nhau trong giao diện mua sắm.

Không có câu trả lời tiêu chuẩn,

Mô hình phải tiếp tục học hỏi, và tự sửa lỗi

Từ vài nhóm kiểm tra thực tế, khả năng nổi bật nhất của dots3-note preview là vừa khám phá, vừa ghi nhớ thông tin mới, gặp thay đổi hoặc phán đoán sai thì điều chỉnh, cho đến khi giao ra kết quả. Nó làm được điều đó như thế nào? Điều then chốt nằm ở hai việc: học và ghi nhớ thông tin thực sự hữu ích, và kịp thời phát hiện sự sai lệch trong phán đoán của bản thân và sửa chữa.

Vấn đề đầu tiên Phòng thí nghiệm dots phải giải quyết là: Sau khi kết thúc huấn luyện, mô hình có thể tiếp tục học từ môi trường và người dùng hay không.

Để huấn luyện khả năng này, Phòng thí nghiệm dots đã xây dựng hàng nghìn môi trường mới lạ siêu dài hạn không phụ thuộc vào kiến thức tiên nghiệm, để Agent khám phá liên tục trong các kịch bản chưa từng tiếp xúc trước đó, học quy tắc và kiến thức mới thông qua tương tác với môi trường, dùng cho quyết định sau này. Và, khi độ dài nhiệm vụ vượt quá đáng kể cửa sổ ngữ cảnh của mô hình, mô hình không thể mãi dựa vào thông tin đã có trong ngữ cảnh. Sau khi được huấn luyện tăng cường, nó sẽ dần học cách giữ lại thông tin hữu ích cho việc giải quyết vấn đề sau này. Khả năng này đã được xác minh trên ARC-AGI 3.

Từ biểu đồ dưới đây có thể thấy, dots3-note preview trên ARC-AGI-3 với chi phí chưa đến 500 đô la đạt khoảng 0.35 điểm, điểm số tuyệt đối tuy thấp hơn Claude Opus 4.8 (high), nhưng hiệu quả chi phí rõ ràng cao hơn.

Nhưng để huấn luyện ra quá trình như vậy, lại gặp phải một phiền phức lớn khác: Chi phí khám phá cho các tác vụ dài hạn quá cao, Agent hoàn thành một lần khám phá có thể phải chạy hàng chục giờ. Nếu tiếp tục sử dụng phương pháp học tăng cường không giá trị (value-free) phụ thuộc vào phần thưởng cuối cùng, thường phải đợi toàn bộ lộ trình kết thúc mới nhận được tín hiệu huấn luyện, không chỉ hiệu quả thấp, mà cũng khó phán đoán thành quả hoặc thất bại cuối cùng quy cho bước cụ thể nào trước đó.

Các phương pháp actor-critic như PPO có thể làm giảm vấn đề này, nhưng critic truyền thống thường ước tính giá trị trạng thái hiện tại thông qua một lần tính toán tiến cố định. Đối mặt với các nhiệm vụ Agent phức tạp, actor có thể lập luận lặp lại, gọi công cụ rồi quyết định bước tiếp theo, critic không thể làm như vậy, rất dễ dẫn đến phán đoán không chính xác về tiến triển hiện tại.

Phòng thí nghiệm dots đã đề xuất TEMPO (Ước tính Giá trị theo Tỷ lệ Thời gian Kiểm tra với Tối ưu Chính sách Bước Vĩ mô), nó cắt một lộ trình rất dài thành nhiều macro-step (bước vĩ mô), mỗi bước chứa nhiều vòng tương tác giữa mô hình và môi trường. Sau khi một giai đoạn kết thúc, mô hình sẽ tạm chuyển từ actor sang critic, và thông qua lập luận, gọi công cụ và tỷ lệ thời gian kiểm tra (test-time scaling) để ước tính trạng thái hiện tại có thể nhận được bao nhiêu phần thưởng trong tương lai, sau đó biến đánh giá này thành tín hiệu huấn luyện cho lộ trình chưa kết thúc.

Đáng chú ý là, trong quá trình huấn luyện TEMPO, mô hình vừa phải học cách hành động, vừa phải học cách đánh giá bản thân hiện tại làm như thế nào. Nhờ khả năng tự đánh giá này, việc huấn luyện học tăng cường có thể đặt vào các nhiệm vụ dài hơn, và liên tục tối ưu hóa hành vi trong lộ trình dài.

Kết quả cho thấy, Ưu thế của TEMPO chủ yếu xuất hiện sau khi nhiệm vụ bước vào giai đoạn sâu hơn. Khi số vòng tương tác tăng, điểm số của GRPO và Base checkpoint có xu hướng đình trệ, TEMPO vẫn có thể tiếp tục cải thiện. Xét về tiến độ hoàn thành, cả ba cũng có sự chênh lệch rõ ràng ở nửa sau nhiệm vụ.

Trong khi đó, sau khi giới thiệu cơ chế Self-Critiquing (Tự phê bình), khả năng tự đánh giá của dots3-note preview mạnh hơn dự kiến ban đầu. Ngay cả khi Agent chưa giải quyết được vấn đề nào đó, nó cũng có thể phán đoán từ hai trạng thái trung gian bề ngoài tương tự nhau, xem trạng thái nào có nhiều hy vọng đạt được đột phá hơn.

Khả năng tự đánh giá như vậy ngoài việc dùng cho huấn luyện học tăng cường, cũng thể hiện ở giai đoạn lập luận. Trong cuộc thi IMO 2026 trước đây, phiên bản nhánh cùng series của dots3-note preview vừa tạo chứng minh, vừa thông qua gọi công cụ liên tục kiểm tra các chứng minh này, và dựa trên kết quả đánh giá để sửa đổi tối ưu, cuối cùng đạt điểm tuyệt đối.

Trong tương lai, Phòng thí nghiệm dots sẽ khám phá tự đánh giá đệ quy (recursive self-critiquing) trong các "nhiệm vụ mở", để mô hình trong điều kiện thiếu phần thưởng bên ngoài rõ ràng, có thể tự phán đoán tiến triển nhiệm vụ, và dựa vào đó điều chỉnh trí nhớ và lập kế hoạch hành động tiếp theo.

Bộ kết hợp "ghi nhớ chủ động + học tăng cường lộ trình siêu dài + tự đánh giá giữa chừng" của Xiaohongshu đã đưa ra một giải pháp cụ thể cho Agent dài hạn bước vào thế giới thực.

Tại sao Xiaohongshu chọn "Agent dài hạn cuộc sống thực"?

Đối với cộng đồng quan tâm cuộc sống Xiaohongshu này, nó tự nhiên gần gũi với loại nhiệm vụ cuộc sống thực này. Rất nhiều vấn đề người dùng thảo luận hàng ngày không chỉ không có câu trả lời duy nhất, nhiều lúc chính người dùng cũng chưa chắc đã nghĩ rõ cuối cùng muốn gì.

Du lịch, đám cưới, trang trí nhà cửa, phối đồ... vốn dĩ mang đặc điểm sở thích khác nhau, điều kiện liên tục bổ sung, thông tin đa phương thức dày đặc. Xiaohongshu lâu dài đối mặt chính là loại nhu cầu phức tạp dài hạn này, vì vậy rất tự nhiên lấy chúng làm trọng tâm nghiên cứu và ứng dụng Agent.

Agent trong các lĩnh vực khác như toán học, mã lệnh đã để ngành công nghiệp thấy rằng, trong môi trường mục tiêu tương đối rõ ràng, kết quả có thể xác minh, AI có thể chia nhỏ nhiệm vụ phức tạp thành lượng lớn bước, và liên tục thực thi trong thời gian dài. Điều kiện trong cuộc sống thực phức tạp hơn nhiều, không có các trường hợp kiểm tra có thể sử dụng ở mọi nơi, mục tiêu và ràng buộc còn thay đổi cùng với nhiệm vụ. Tính mơ hồ này khiến điểm yếu của Agent dài hạn bộc lộ rõ ràng hơn.

Hai bộ tiêu chuẩn đánh giá mà Phòng thí nghiệm dots công bố nguồn mở, đã đặt sự chênh lệch và thiếu sót một cách trực quan.

Một bộ là VibeSearchBench, nó xem xét "Khi người dùng không nói rõ nhu cầu một lần, Agent có thể hiểu họ thực sự muốn gì không", bao phủ 20 lĩnh vực, 200 nhiệm vụ. Đánh giá mô phỏng người dùng thực tế, trong đối thoại nhiều vòng bổ sung dần nhu cầu và điều kiện hạn chế, sau đó xem mô hình có thể hiểu chính xác người dùng muốn gì không.

Bộ khác là VibeLifeBench, nhấn mạnh sự thay đổi thời gian và môi trường, xem xét "Sau khi điều kiện bên ngoài thay đổi, Agent có thể theo kịp không", bao phủ 10 lĩnh vực, 20 nhiệm vụ, mỗi nhiệm vụ chứa 20 đến 30 giai đoạn, và thiết lập 1247 kiểm tra nguyên tử (atomic checks), dùng để kiểm tra trạng thái có thể duy trì nhất quán không, công cụ có thực thi đúng không, và cuối cùng giao ra cái gì.

Kết quả cho thấy, ngay cả các mô hình hàng đầu toàn cầu như Claude Opus 5, GPT-5.5, trong hai bộ tiêu chuẩn đánh giá này cũng không đạt đến mức đỗ đã đặt.

Hình trái là bảng xếp hạng đầy đủ của VibeSearchBench, hình phải là bảng xếp hạng đầy đủ của VibeLifeBench.

Trang chủ VibeSearchBench: https://vibebench.github.io/VibeSearchBench.github.io/

Trang chủ VibeLifeBench: https://vibebench.github.io/VibeLifeBench_homepage/

Những kết quả này nói lên một điều: Mô hình đã đủ mạnh ở các nhiệm vụ điểm đơn độ khó cao, nhưng duy trì ổn định khả năng này trong vài giờ hoặc lâu hơn, vẫn là nơi Agent chưa với tới. Sự khám phá và bố trí của Xiaohongshu về điều này mới chỉ bắt đầu.

dots3-note là phiên bản nhẹ nhất trong dòng dots3, phiên bản preview hiện đã mở mã nguồn vẫn còn không gian để tiếp tục tối ưu hóa về trải nghiệm và chi tiết. Theo tiết lộ của Phòng thí nghiệm dots, phiên bản chính thức của dots3-note cũng sẽ được mở mã nguồn trong thời gian tới. Trong tương lai, dòng dots3 còn sẽ ra mắt jazz và aria, cùng với note tạo thành ba cấp độ, bao phủ nhu cầu ứng dụng với độ phức tạp nhiệm vụ, tốc độ phản hồi và chi phí tính toán khác nhau.

Chi tiết thêm về phương pháp huấn luyện vui lòng xem blog kỹ thuật chính thức (tiếng Trung): https://studio.dots.ai/dots/dots3-zh.html

Bài viết này đến từ tài khoản công chúng WeChat "机器之心" (ID:almosthuman2014), tác giả: 关注Agent的机器之心, biên tập viên: 杜伟, 杨文

Câu hỏi Liên quan

QMô hình dots3-note preview của Xiaohongshu có thông số kỹ thuật chính là gì?

AMô hình dots3-note preview có tổng số tham số là 280 tỷ (280B), trong đó số tham số được kích hoạt là 16 tỷ (16B). Nó hỗ trợ cửa sổ ngữ cảnh siêu dài 512K token, có khả năng hiểu đa phương thức (văn bản, hình ảnh và giọng nói), và được tối ưu hóa cho các nhiệm vụ lập luận phức tạp, tác nhân AI (Agent) và nhận thức đa phương thức.

QMô hình này đã thể hiện khả năng xử lý nhiệm vụ dài hạn và phức tạp như thế nào trong các bài kiểm tra thực tế?

ATrong các bài kiểm tra thực tế, mô hình đã thể hiện khả năng xử lý nhiệm vụ dài hạn và phức tạp thông qua việc tự học và điều chỉnh. Ví dụ: nó chơi trò chơi 'Slay the Spire II' đến tầng 33 mà không cần đào tạo trước; tự khám phá và giải quyết các quy tắc trong ARC-AGI 3 với hơn 300 bước; giải quyết vấn đề lắp đặt tủ lạnh thực tế từ hình ảnh và thông số kỹ thuật; và hoàn thành một dự án phát triển ứng dụng visionOS đầy đủ từ đầu đến cuối, bao gồm lập kế hoạch, viết mã, biên dịch và kiểm tra.

QTEMPO là gì và nó đã giúp cải thiện hiệu suất của mô hình trong các nhiệm vụ dài hạn như thế nào?

ATEMPO (Test-time-scaled Value Estimation with Macro-step Policy Optimization) là một phương pháp học tăng cường do phòng thí nghiệm dots phát triển. Nó chia một nhiệm vụ dài thành nhiều 'macro-step'. Sau mỗi giai đoạn, mô hình sẽ chuyển từ vai trò 'actor' sang 'critic' để tự đánh giá tiến độ và ước tính phần thưởng tiềm năng trong tương lai. Điều này cung cấp tín hiệu huấn luyện ngay cả khi nhiệm vụ chưa kết thúc, giúp mô hình học cách hành động và tự đánh giá hiệu quả hơn trong các nhiệm vụ rất dài, đặc biệt là ở các giai đoạn phức tạp về sau.

QXiaohongshu đã phát triển những tiêu chuẩn đánh giá (benchmark) nào để đo lường khả năng xử lý nhu cầu thực tế của các Agent AI?

AXiaohongshu (dots lab) đã phát triển hai bộ tiêu chuẩn đánh giá chính: VibeSearchBench và VibeLifeBench. VibeSearchBench tập trung vào việc Agent có thể hiểu nhu cầu không rõ ràng của người dùng qua đối thoại đa vòng trong 20 lĩnh vực với 200 nhiệm vụ. VibeLifeBench nhấn mạnh vào sự thay đổi theo thời gian và môi trường, đánh giá khả năng Agent theo kịp khi điều kiện thay đổi, bao gồm 10 lĩnh vực, 20 nhiệm vụ với nhiều giai đoạn và 1247 bài kiểm tra chi tiết.

QKế hoạch tương lai cho dòng mô hình dots3 của Xiaohongshu là gì?

ATheo phòng thí nghiệm dots, phiên bản chính thức của dots3-note sẽ sớm được mã nguồn mở. Trong tương lai, dòng mô hình dots3 sẽ bao gồm ba cấp độ: note, jazz và aria, nhằm đáp ứng các nhu cầu ứng dụng khác nhau về độ phức tạp nhiệm vụ, tốc độ phản hồi và chi phí tính toán.

Nội dung Liên quan

Vận may trước mắt, nhưng Applied Materials AMAT lại tỏ ra nhát gan?

Ứng dụng Vật liệu (AMAT) đã công bố báo cáo tài chính quý III năm tài chính 2026 (kết thúc vào tháng 7/2026) với doanh thu 9,12 tỷ USD, tăng 25% so với cùng kỳ và vượt kỳ vọng thị trường. Tăng trưởng chủ yếu đến từ việc mở rộng cơ sở hạ tầng điện toán AI, thúc đẩy nhu cầu về thiết bị logic tiên tiến, DRAM và đóng gói tiên tiến. Tỷ suất lợi nhuận gộp đạt 50,3%, đáp ứng kỳ vọng. Tuy nhiên, cổ phiếu AMAT đã giảm mạnh sau giờ giao dịch, chủ yếu do định hướng bảo thủ của ban lãnh đạo. Mặc dù các hãng sản xuất wafer lớn như TSMC, Micron, Samsung và SK Hynix đều đã điều chỉnh tăng chi tiêu vốn cho năm 2026 (dự kiến tăng khoảng 40%), AMAT vẫn duy trì dự báo tăng trưởng cho thiết bị bán dẫn là "trên 30%" trong năm 2026 mà không đưa ra con số định lượng cụ thể hay điều chỉnh tăng rõ ràng. Điều này khiến thị trường thất vọng, vì kỳ vọng vào một sự điều chỉnh tăng mạnh. Phân tích sâu hơn cho thấy, ngay cả khi tốc độ tăng trưởng thiết bị bán dẫn đạt 40% trong năm 2026, điều đó ngụ ý sự giảm tốc đáng kể về tốc độ tăng trưởng theo quý trong năm tài chính của AMAT, với quý sau (Q1 FY27) gần như không tăng trưởng nếu điều chỉnh theo số tuần. Dù vậy, động lực cơ bản cho ngành thiết bị bán dẫn vẫn mạnh mẽ, được thúc đẩy bởi chi tiêu vốn AI và sự phục hồi của bán dẫn truyền thống. Miễn là chu kỳ mở rộng bán dẫn tiếp tục, nhu cầu từ khách hàng và sự gia tăng đầu tư vẫn có khả năng thúc đẩy hiệu suất và định giá của công ty trong tương lai.

marsbit16 phút trước

Vận may trước mắt, nhưng Applied Materials AMAT lại tỏ ra nhát gan?

marsbit16 phút trước

Còn nhớ NFT không? Giá của dự án mới đã vượt qua cả Bored Ape Yacht Club

NFT, một chủ đề đã bị lãng quên khá lâu, đang có dấu hiệu hồi sinh trở lại trên mạng Robinhood, chủ yếu nhờ sự tương tác giữa Giám đốc điều hành Vlad Tenev và nghệ sĩ NFT nổi tiếng Beeple. Sự kiện này đã thúc đẩy mạnh mẽ giá trị của các bộ sưu tập NFT liên quan, điển hình là Cash Cat với mức tăng gấp 5 lần chỉ trong 2 ngày. Đặc biệt, bộ sưu tập StonkBroker, được coi là NFT hàng đầu trên Robinhood, đã đạt mức giá sàn cao hơn cả Bored Ape Yacht Club (BAYC), với tổng vốn hóa thị trường vượt 100 triệu USD. Sự phục hưng này tập trung vào ba xu hướng chính: NFT đi kèm meme coin (như Cash Cat), các dự án "StonkBroker系" kết hợp NFT với tiện ích thực tế và phân phối lợi nhuận, và làn sóng "tái khởi nghiệp" của những người chơi hoặc dự án NFT cũ chuyển sang Robinhood. Tuy nhiên, bài viết cũng cảnh báo về tính thanh khoản thấp của NFT so với meme coin, khiến việc mua bán với khối lượng lớn trở nên khó khăn. Dù sự quan tâm đang tăng lên, thị trường NFT trên Robinhood vẫn cần thêm các sự kiện thu hút sự chú ý hoặc sự xuất hiện của những dự án NFT thuần túy thành công để có thể khẳng định một xu hướng bền vững thực sự.

marsbit41 phút trước

Còn nhớ NFT không? Giá của dự án mới đã vượt qua cả Bored Ape Yacht Club

marsbit41 phút trước

Giao dịch

Giao ngay
活动图片