Cuối cùng, phiên bản cùng series của mô hình đạt huy chương vàng IMO điểm tuyệt đối do Xiaohongshu phát triển đã được công bố nguồn mở!
Tháng trước, mô hình lớn tự nghiên cứu của Xiaohongshu "dots-note-3.0" đã thiết lập một kỷ lục lịch sử: Lần đầu tiên AI đạt được điểm số chính thức 42/42 tại một cuộc thi Olympic Toán học quốc tế. Kể từ đó, vấn đề cộng đồng quan tâm nhất là khi nào mô hình sẽ được mở mã nguồn.

Adina Yakup, người phụ trách liên quan về nghiên cứu AI và hệ sinh thái cộng đồng tại HuggingFace. Nguồn ảnh: X Post
Ngay hôm nay, Phòng thí nghiệm mô hình dots của Xiaohongshu (sau đây gọi là Phòng thí nghiệm dots) đã thông báo mã nguồn mở dots3-note preview! Đây cũng là phiên bản mã nguồn mở đầu tiên của dòng mô hình dots3, nhắm tới các tác vụ dài hạn phức tạp hơn, khó đánh giá hơn và gần với thực tế hơn.
Xét về tham số, dots3-note preview có tổng số tham số là 280B, trong đó tham số kích hoạt là 16B, hỗ trợ cửa sổ ngữ cảnh siêu dài 512K, có khả năng hiểu đa phương thức văn bản, hình ảnh và giọng nói, và được tối ưu hóa cho lập luận phức tạp, Agent và nhận thức đa phương thức.
Điểm vào API: https://dots.ai/platform/
Huggingface: https://huggingface.co/dots-studio/dots3-note-prev
GitHub:https://github.com/studio-dots-ai/dots3-note-prev
Việc đạt điểm tuyệt đối IMO đã xác minh khả năng của dòng mô hình này trong lập luận và chứng minh toán học. Lần công bố nguồn mở này đặt thử thách vào một loại kịch bản khác khó chuẩn hóa hơn: lập kế hoạch du lịch, chuẩn bị đám cưới, kinh doanh mở cửa hàng. Loại tác vụ này không có câu trả lời duy nhất, thời gian thậm chí có thể kéo dài hàng giờ, hàng ngày hoặc lâu hơn.
dots3-note preview tập trung vào các tác vụ dài hạn, cũng đã trúng vào một hướng phát triển chính hiện tại của Agent: Chúng bắt đầu được yêu cầu đảm nhận công việc ngày càng dài và hoàn chỉnh. OpenAI từng tiết lộ, vào tháng 5 năm nay, hơn 70% người dùng để Codex xử lý công việc mà con người cần hơn một giờ để hoàn thành; đến tháng 6, 1% người dùng tích cực được sử dụng nhiều nhất nội bộ tại OpenAI tạo ra hơn 60 giờ "agent turns" mỗi ngày.
Tuy nhiên, khi nhiệm vụ rơi vào các bối cảnh khác nhau, độ khó sẽ nhanh chóng có sự chênh lệch. Khác với các lĩnh vực như toán học, mã lệnh và kỹ thuật nơi Agent đã thể hiện tương đối trưởng thành, môi trường sống thực tế càng mở hơn, nhu cầu càng mơ hồ. dots3-note preview chọn đặt "phòng thi" ở đây, đòi hỏi cao hơn về khả năng lập kế hoạch dài hạn, phán đoán và sửa lỗi của chính nó.
Xét về dữ liệu từ nhiều benchmark chính thống, trên nhiều tác vụ lập luận và tác nhân thông minh, mô hình có thể sánh ngang hoặc vượt qua các mô hình cỡ lớn với quy mô tham số gấp nhiều lần chính nó, khả năng thị giác thể hiện nổi bật trong phạm vi kích thước tương tự.

Nguồn ảnh: Blog kỹ thuật chính thức

Nguồn ảnh: Blog kỹ thuật chính thức
Trước đây, Xiaohongshu đã lần lượt công bố nguồn mở mô hình văn bản lớn dots.llm1, mô hình phân tích bố cục tài liệu đa ngôn ngữ dots.ocr và mô hình lớn hiểu thị giác đa phương thức dots.vlm1. Lần công bố nguồn mở mới nhất này, đã ghép thêm mảnh ghép Agent.
Kiểm tra thực tế:
Nó có thể thực sự hoàn thành các tác vụ phức tạp không?
Khả năng thực tế của mô hình, chỉ nhìn vào bảng xếp hạng là chưa đủ. Tiếp theo, chúng ta hãy xem qua vài trường hợp, để xem mô hình này khi đối mặt với các tác vụ có thông tin rời rạc, nhiều bước, môi trường thay đổi liên tục, sẽ tiến hành và giao kết quả như thế nào.
Tiếp quản "Slay the Spire II"
Đầu tiên, hãy để dots3-note preview tiếp quản một ván "Slay the Spire II".
Điểm khó của trò chơi này nằm ở chỗ, chọn đường nào, lấy lá bài nào, có nên thử thách tinh anh không, tiền vàng tiêu thế nào, trại chọn nghỉ ngơi hay nâng cấp, đều sẽ ảnh hưởng đến xác suất sống sót sau hàng chục lượt. Lựa chọn tối ưu cục bộ, rất có thể sẽ tạo ra mối nguy tiềm ẩn cho trận chiến Boss sau này.
Mô hình trước đó không được huấn luyện đặc biệt cho trò chơi này, nhưng có thể học cơ chế bài và kẻ địch dựa trên phản hồi chiến đấu, đồng thời quản lý sinh mệnh, bộ bài, tiền vàng và thuốc, cân nhắc liên tục giữa cửa hàng, trại và trận tinh anh, chơi cho đến tầng 33.
Bẻ khóa ARC-AGI 3 từ đầu
Trong tác vụ lập luận dài hạn ARC-AGI 3, quy tắc hoàn toàn không biết, mô hình cần quan sát hình ảnh, đưa ra giả thuyết, sau đó xác minh thông qua thao tác.
dots3-note preview dần phát hiện ra quy luật đồng bộ lên xuống và phản chiếu trái phải của hai khối, và mò ra các cơ chế như ô nguy hiểm, đánh dấu có thể di chuyển, công tắc áp suất và cửa cống.

Mỗi khi giả thuyết sai, nó sẽ khởi động cơ chế Self-Critiquing (Tự phê bình) để đánh giá lại, ghi quy tắc đã sửa vào memory.md, tệp này giống như sổ ghi chép của mô hình, liên tục lưu giữ sự hiểu biết động về môi trường.


Cuối cùng, mô hình thông qua 320 bước thao tác để giải hết 6 cấp độ.

Đọc hình ảnh giải quyết vấn đề trang trí nhà cửa
Khả năng học hỏi và lập luận liên tục, cuối cùng vẫn phải quay về với cuộc sống thực tế.
Ví dụ như vấn đề trang trí nhà cửa điển hình dưới đây: đồng thời tải lên sơ đồ mặt bằng và ảnh chụp thông số hai mẫu tủ lạnh, đồng thời bổ sung thông tin: bức tường bếp gần phía phòng sách đã làm mặt bàn dài 1,5 mét, bây giờ muốn đặt tủ lạnh ở bức tường này, rốt cuộc có đặt vừa không?
Thông tin then chốt phân tán ở các hình ảnh khác nhau và cách diễn đạt văn bản, mô hình cần kết hợp sơ đồ mặt bằng, kích thước mặt bàn hiện có và thông số kỹ thuật của hai mẫu tủ lạnh, tính toán không gian còn lại trên tường, đưa ra kết luận phù hợp. Nó còn chủ động nhắc nhở người dùng đến hiện trường đo lại xác nhận.
Toàn bộ quá trình liên quan đến hiểu không gian thị giác, lập luận phức tạp và gọi công cụ, cũng thể hiện khả năng của mô hình trong việc tạo ra câu trả lời tùy chỉnh dựa trên môi trường thực tế cá nhân.

Sử dụng sơ đồ mặt bằng vừa rồi, tiếp tục để mô hình thiết kế vài phương án trang trí phong cách gỗ tự nhiên cho phòng sách.
Mô hình giữ lại thông tin kích thước và ánh sáng đã nhận biết trước đó, tìm kiếm các ghi chép liên quan trên Xiaohongshu, sắp xếp bốn phương án phong cách gỗ tự nhiên và tạo trang web, liên tục hoàn thành việc đọc ảnh, tính toán, truy xuất và tạo nội dung.

Chạy thông suốt quy trình phát triển ứng dụng visionOS từ đầu đến cuối
Cuối cùng, hãy xem liệu dots3-note preview có thể độc lập hoàn thành một nhiệm vụ kỹ thuật phần mềm từ đầu đến cuối đầy đủ hay không, hãy để nó "tham khảo thiết kế của Xiaohongshu, phát triển một ứng dụng gốc cho Apple Vision Pro".
Sau khi nhận nhiệm vụ, mô hình không vội viết mã, nó trước tiên hiểu yêu cầu sản phẩm và tham khảo 9 ảnh giao diện, tự chủ xác định phương án phát triển, bao gồm lựa chọn lộ trình kỹ thuật SwiftUI+RealityKit, lập kế hoạch tổ chức các mô-đun khác nhau như cửa sổ, không gian đắm chìm và hiển thị sản phẩm 3D. Sau khi phương án được quyết định, nó tiếp tục chuẩn bị các tư liệu như hình ảnh cục bộ và mô hình 3D, sau đó từng bước hoàn thành việc triển khai mã.
Toàn bộ dự án tạo ra 12 tệp Swift, 1876 dòng mã, thực hiện các giao diện như luồng thông tin, trang cá nhân, tin nhắn riêng, sản phẩm, và tích hợp mô hình 3D USDZ. Sau đó, mô hình lại tự động tạo dự án Xcode, gọi xcodebuild để biên dịch, và hoàn thành kiểm tra trong visionOS Simulator, cuối cùng hiển thị "BUILD SUCCEEDED" (XÂY DỰNG THÀNH CÔNG).
Từ hiểu yêu cầu, chọn công nghệ đến triển khai mã, biên dịch và xác minh, quy trình phát triển này cuối cùng đã được chạy thông suốt.

Xét về sản phẩm cuối cùng, đã có một bộ tương tác không gian khá hoàn chỉnh. Luồng thông tin có thể cuộn, ghi chép có thể vào trang chi tiết, trang cá nhân, tin nhắn riêng có thể mở rộng như cửa sổ độc lập.

Người dùng còn có thể xem trực tiếp và chuyển đổi các sản phẩm 3D khác nhau trong giao diện mua sắm.

Không có câu trả lời tiêu chuẩn,
Mô hình phải tiếp tục học hỏi, và tự sửa lỗi
Từ vài nhóm kiểm tra thực tế, khả năng nổi bật nhất của dots3-note preview là vừa khám phá, vừa ghi nhớ thông tin mới, gặp thay đổi hoặc phán đoán sai thì điều chỉnh, cho đến khi giao ra kết quả. Nó làm được điều đó như thế nào? Điều then chốt nằm ở hai việc: học và ghi nhớ thông tin thực sự hữu ích, và kịp thời phát hiện sự sai lệch trong phán đoán của bản thân và sửa chữa.
Vấn đề đầu tiên Phòng thí nghiệm dots phải giải quyết là: Sau khi kết thúc huấn luyện, mô hình có thể tiếp tục học từ môi trường và người dùng hay không.
Để huấn luyện khả năng này, Phòng thí nghiệm dots đã xây dựng hàng nghìn môi trường mới lạ siêu dài hạn không phụ thuộc vào kiến thức tiên nghiệm, để Agent khám phá liên tục trong các kịch bản chưa từng tiếp xúc trước đó, học quy tắc và kiến thức mới thông qua tương tác với môi trường, dùng cho quyết định sau này. Và, khi độ dài nhiệm vụ vượt quá đáng kể cửa sổ ngữ cảnh của mô hình, mô hình không thể mãi dựa vào thông tin đã có trong ngữ cảnh. Sau khi được huấn luyện tăng cường, nó sẽ dần học cách giữ lại thông tin hữu ích cho việc giải quyết vấn đề sau này. Khả năng này đã được xác minh trên ARC-AGI 3.
Từ biểu đồ dưới đây có thể thấy, dots3-note preview trên ARC-AGI-3 với chi phí chưa đến 500 đô la đạt khoảng 0.35 điểm, điểm số tuyệt đối tuy thấp hơn Claude Opus 4.8 (high), nhưng hiệu quả chi phí rõ ràng cao hơn.

Nhưng để huấn luyện ra quá trình như vậy, lại gặp phải một phiền phức lớn khác: Chi phí khám phá cho các tác vụ dài hạn quá cao, Agent hoàn thành một lần khám phá có thể phải chạy hàng chục giờ. Nếu tiếp tục sử dụng phương pháp học tăng cường không giá trị (value-free) phụ thuộc vào phần thưởng cuối cùng, thường phải đợi toàn bộ lộ trình kết thúc mới nhận được tín hiệu huấn luyện, không chỉ hiệu quả thấp, mà cũng khó phán đoán thành quả hoặc thất bại cuối cùng quy cho bước cụ thể nào trước đó.
Các phương pháp actor-critic như PPO có thể làm giảm vấn đề này, nhưng critic truyền thống thường ước tính giá trị trạng thái hiện tại thông qua một lần tính toán tiến cố định. Đối mặt với các nhiệm vụ Agent phức tạp, actor có thể lập luận lặp lại, gọi công cụ rồi quyết định bước tiếp theo, critic không thể làm như vậy, rất dễ dẫn đến phán đoán không chính xác về tiến triển hiện tại.
Phòng thí nghiệm dots đã đề xuất TEMPO (Ước tính Giá trị theo Tỷ lệ Thời gian Kiểm tra với Tối ưu Chính sách Bước Vĩ mô), nó cắt một lộ trình rất dài thành nhiều macro-step (bước vĩ mô), mỗi bước chứa nhiều vòng tương tác giữa mô hình và môi trường. Sau khi một giai đoạn kết thúc, mô hình sẽ tạm chuyển từ actor sang critic, và thông qua lập luận, gọi công cụ và tỷ lệ thời gian kiểm tra (test-time scaling) để ước tính trạng thái hiện tại có thể nhận được bao nhiêu phần thưởng trong tương lai, sau đó biến đánh giá này thành tín hiệu huấn luyện cho lộ trình chưa kết thúc.
Đáng chú ý là, trong quá trình huấn luyện TEMPO, mô hình vừa phải học cách hành động, vừa phải học cách đánh giá bản thân hiện tại làm như thế nào. Nhờ khả năng tự đánh giá này, việc huấn luyện học tăng cường có thể đặt vào các nhiệm vụ dài hơn, và liên tục tối ưu hóa hành vi trong lộ trình dài.
Kết quả cho thấy, Ưu thế của TEMPO chủ yếu xuất hiện sau khi nhiệm vụ bước vào giai đoạn sâu hơn. Khi số vòng tương tác tăng, điểm số của GRPO và Base checkpoint có xu hướng đình trệ, TEMPO vẫn có thể tiếp tục cải thiện. Xét về tiến độ hoàn thành, cả ba cũng có sự chênh lệch rõ ràng ở nửa sau nhiệm vụ.

Trong khi đó, sau khi giới thiệu cơ chế Self-Critiquing (Tự phê bình), khả năng tự đánh giá của dots3-note preview mạnh hơn dự kiến ban đầu. Ngay cả khi Agent chưa giải quyết được vấn đề nào đó, nó cũng có thể phán đoán từ hai trạng thái trung gian bề ngoài tương tự nhau, xem trạng thái nào có nhiều hy vọng đạt được đột phá hơn.
Khả năng tự đánh giá như vậy ngoài việc dùng cho huấn luyện học tăng cường, cũng thể hiện ở giai đoạn lập luận. Trong cuộc thi IMO 2026 trước đây, phiên bản nhánh cùng series của dots3-note preview vừa tạo chứng minh, vừa thông qua gọi công cụ liên tục kiểm tra các chứng minh này, và dựa trên kết quả đánh giá để sửa đổi tối ưu, cuối cùng đạt điểm tuyệt đối.
Trong tương lai, Phòng thí nghiệm dots sẽ khám phá tự đánh giá đệ quy (recursive self-critiquing) trong các "nhiệm vụ mở", để mô hình trong điều kiện thiếu phần thưởng bên ngoài rõ ràng, có thể tự phán đoán tiến triển nhiệm vụ, và dựa vào đó điều chỉnh trí nhớ và lập kế hoạch hành động tiếp theo.
Bộ kết hợp "ghi nhớ chủ động + học tăng cường lộ trình siêu dài + tự đánh giá giữa chừng" của Xiaohongshu đã đưa ra một giải pháp cụ thể cho Agent dài hạn bước vào thế giới thực.
Tại sao Xiaohongshu chọn "Agent dài hạn cuộc sống thực"?
Đối với cộng đồng quan tâm cuộc sống Xiaohongshu này, nó tự nhiên gần gũi với loại nhiệm vụ cuộc sống thực này. Rất nhiều vấn đề người dùng thảo luận hàng ngày không chỉ không có câu trả lời duy nhất, nhiều lúc chính người dùng cũng chưa chắc đã nghĩ rõ cuối cùng muốn gì.
Du lịch, đám cưới, trang trí nhà cửa, phối đồ... vốn dĩ mang đặc điểm sở thích khác nhau, điều kiện liên tục bổ sung, thông tin đa phương thức dày đặc. Xiaohongshu lâu dài đối mặt chính là loại nhu cầu phức tạp dài hạn này, vì vậy rất tự nhiên lấy chúng làm trọng tâm nghiên cứu và ứng dụng Agent.
Agent trong các lĩnh vực khác như toán học, mã lệnh đã để ngành công nghiệp thấy rằng, trong môi trường mục tiêu tương đối rõ ràng, kết quả có thể xác minh, AI có thể chia nhỏ nhiệm vụ phức tạp thành lượng lớn bước, và liên tục thực thi trong thời gian dài. Điều kiện trong cuộc sống thực phức tạp hơn nhiều, không có các trường hợp kiểm tra có thể sử dụng ở mọi nơi, mục tiêu và ràng buộc còn thay đổi cùng với nhiệm vụ. Tính mơ hồ này khiến điểm yếu của Agent dài hạn bộc lộ rõ ràng hơn.
Hai bộ tiêu chuẩn đánh giá mà Phòng thí nghiệm dots công bố nguồn mở, đã đặt sự chênh lệch và thiếu sót một cách trực quan.
Một bộ là VibeSearchBench, nó xem xét "Khi người dùng không nói rõ nhu cầu một lần, Agent có thể hiểu họ thực sự muốn gì không", bao phủ 20 lĩnh vực, 200 nhiệm vụ. Đánh giá mô phỏng người dùng thực tế, trong đối thoại nhiều vòng bổ sung dần nhu cầu và điều kiện hạn chế, sau đó xem mô hình có thể hiểu chính xác người dùng muốn gì không.
Bộ khác là VibeLifeBench, nhấn mạnh sự thay đổi thời gian và môi trường, xem xét "Sau khi điều kiện bên ngoài thay đổi, Agent có thể theo kịp không", bao phủ 10 lĩnh vực, 20 nhiệm vụ, mỗi nhiệm vụ chứa 20 đến 30 giai đoạn, và thiết lập 1247 kiểm tra nguyên tử (atomic checks), dùng để kiểm tra trạng thái có thể duy trì nhất quán không, công cụ có thực thi đúng không, và cuối cùng giao ra cái gì.
Kết quả cho thấy, ngay cả các mô hình hàng đầu toàn cầu như Claude Opus 5, GPT-5.5, trong hai bộ tiêu chuẩn đánh giá này cũng không đạt đến mức đỗ đã đặt.

Hình trái là bảng xếp hạng đầy đủ của VibeSearchBench, hình phải là bảng xếp hạng đầy đủ của VibeLifeBench.
Trang chủ VibeSearchBench: https://vibebench.github.io/VibeSearchBench.github.io/
Trang chủ VibeLifeBench: https://vibebench.github.io/VibeLifeBench_homepage/
Những kết quả này nói lên một điều: Mô hình đã đủ mạnh ở các nhiệm vụ điểm đơn độ khó cao, nhưng duy trì ổn định khả năng này trong vài giờ hoặc lâu hơn, vẫn là nơi Agent chưa với tới. Sự khám phá và bố trí của Xiaohongshu về điều này mới chỉ bắt đầu.
dots3-note là phiên bản nhẹ nhất trong dòng dots3, phiên bản preview hiện đã mở mã nguồn vẫn còn không gian để tiếp tục tối ưu hóa về trải nghiệm và chi tiết. Theo tiết lộ của Phòng thí nghiệm dots, phiên bản chính thức của dots3-note cũng sẽ được mở mã nguồn trong thời gian tới. Trong tương lai, dòng dots3 còn sẽ ra mắt jazz và aria, cùng với note tạo thành ba cấp độ, bao phủ nhu cầu ứng dụng với độ phức tạp nhiệm vụ, tốc độ phản hồi và chi phí tính toán khác nhau.
Chi tiết thêm về phương pháp huấn luyện vui lòng xem blog kỹ thuật chính thức (tiếng Trung): https://studio.dots.ai/dots/dots3-zh.html
Bài viết này đến từ tài khoản công chúng WeChat "机器之心" (ID:almosthuman2014), tác giả: 关注Agent的机器之心, biên tập viên: 杜伟, 杨文





