Mô hình nhỏ 3B, điểm lập trình sánh ngang Opus 4.5, mô hình bí ẩn gây xôn xao, hóa ra là sản phẩm trong nước

marsbitXuất bản vào 2026-06-18Cập nhật gần nhất vào 2026-06-18

Tóm tắt

Trong những ngày gần đây, mô hình nhỏ VibeThinker-3B (3 tỷ tham số) từ đội ngũ Weibo (Trung Quốc) đã gây chú ý trên mạng X nhờ khả năng lập trình và suy luận có thể kiểm chứng, được cho là ngang bằng với các mô hình tiên tiến lớn hơn nhiều như GPT-5, Claude Opus 4.5 hay Gemini 3 Pro. Mô hình này được xây dựng dựa trên Qwen2.5-Coder-3B và trải qua quy trình đào tạo nâng cao "Spectrum-to-Signal", bao gồm tinh chỉnh có giám sát hai giai đoạn theo lộ trình, học tăng cường đa lĩnh vực, tự chưng cất ngoại tuyến và học tăng cường theo chỉ dẫn (Instruct RL). Nó cũng giới thiệu chiến lược đánh giá độ tin cậy theo tuyên bố (Claim-Level Reliability - CLR) để nâng cao hiệu suất trong các bài kiểm tra. Kết quả ấn tượng: AIME26: 94.3 (97.1 với CLR), HMMT25: 89.3 (95.4 với CLR), tỷ lệ Pass@1 trên LiveCodeBench v6 là 80.2%, và tỷ lệ giải đúng các bài LeetCode mới nhất đạt 96.1%. Báo cáo kỹ thuật đưa ra "giả thuyết nén tham số": khả năng suy luận có thể kiểm chứng (như toán học, lập trình) có thể được nén hiệu quả vào mô hình nhỏ với phản hồi đáng tin cậy, trong khi kiến thức thực tế tổng quát và đối thoại mở lại phụ thuộc nhiều hơn vào quy mô tham số lớn. Mục tiêu không phải là thay thế mô hình lớn, mà là thăm dò giới hạn của mô hình nhỏ trong các lĩnh vực cụ thể, mở ra hướng nghiên cứu mới bổ sung cho mô hình truyền thống. Mô hình có sẵn trên HuggingFace và arXiv, nhưng cần lưu ý nó được thiết kế cho các nhiệm vụ suy luận có thể xác minh, không phải cho kiến thức tổng quát hay đối thoại...

Mấy ngày gần đây, một mô hình nhỏ 3B đã gây sốt trên X, vì trong một số nhiệm vụ suy luận có thể xác minh độ khó (ví dụ như lập trình), nó đã lọt vào phạm vi hiệu suất của các mô hình tiên phong như Gemini 3 Pro, GPT-5 high, Claude Opus 4.5, GLM-5, Kimi K2.5, trong khi kích thước của nó nhỏ hơn rất nhiều so với các mô hình này.

Mô hình này có tên là VibeThinker-3B, là một mô hình suy luận đặc chắc với 3 tỷ tham số, nhằm mục đích khám phá xem, trong quy mô mô hình nhỏ nghiêm ngặt, khả năng suy luận có thể xác minh có thể được đẩy đến mức độ nào.

Sau khi mô hình được công bố, nhiều người đã kinh ngạc trước thành tích của nó, và nói rằng muốn tự mình trải nghiệm.

Đáng chú ý là, nó còn là một mô hình trong nước, đến từ đội ngũ Weibo Sina.

Báo cáo kỹ thuật cho thấy, mô hình này được thiết kế chuyên biệt cho các nhiệm vụ có tín hiệu xác minh đáng tin cậy, bao gồm suy luận toán học, lập trình thi đấu, suy luận STEM và thực thi lệnh với các ràng buộc rõ ràng.

Do đó, nó thể hiện xuất sắc trong các bài kiểm tra chuẩn. Nó đạt 94.3 điểm trong bài kiểm tra AIME26, 89.3 điểm trong bài kiểm tra HMMT25, 80.2 điểm (Pass@1) trong bài kiểm tra LiveCodeBench v6, và đạt tỷ lệ vượt qua 96.1% trong các cuộc thi tuần và thi đôi (biweekly contests) mới nhất không công khai trên LeetCode từ ngày 25/4/2026 đến 31/5/2026.

Mô hình này được huấn luyện như thế nào? Báo cáo kỹ thuật tiết lộ một số chi tiết.

Đầu tiên, nó được xây dựng dựa trên Qwen2.5-Coder-3B, và sử dụng quy trình Spectrum-to-Signal nâng cấp để huấn luyện hậu kỳ (post-training). Quy trình này tăng cường tổng hợp dữ liệu, lọc chất lượng và học theo lộ trình (curriculum learning) trong quá trình tinh chỉnh có giám sát (SFT), mở rộng việc học tăng cường theo phong cách MGPO sang nhiều lĩnh vực có thể xác minh, giữ lại toàn bộ đường đi suy luận ngữ cảnh dài, và củng cố các khả năng thông qua tự cô đặc ngoại tuyến (offline self-distillation) và học tăng cường chỉ dẫn (Instruct RL).

Quy trình huấn luyện tổng thể của VibeThinker-3B

Quy trình Spectrum-to-Signal.

Ngoài ra, VibeThinker-3B còn giới thiệu Đánh giá Độ tin cậy Cấp độ Tuyên bố (Claim-Level Reliability - CLR), một chiến lược mở rộng quy mô lúc kiểm tra (test-time scaling) hướng tới suy luận có câu trả lời có thể xác minh. CLR tiếp tục nâng cao hiệu suất trong các bài kiểm tra chuẩn toán học, nâng AIME26 từ 94.3 lên 97.1, HMMT25 từ 89.3 lên 95.4, và nâng BruMO25 lên 99.2.

Quy trình huấn luyện cụ thể của nó như sau:

  • SFT hai giai đoạn dựa trên lộ trình. Giai đoạn đầu tập trung vào phạm vi khả năng rộng rãi như toán học, lập trình, suy luận STEM, hội thoại chung và tuân thủ chỉ dẫn. Giai đoạn hai chuyển sang các mẫu suy luận khó hơn và tầm nhìn rộng hơn. Sự cô đặc khám phá đa dạng (Diversity exploration distillation) được sử dụng để giữ lại nhiều đường giải pháp hiệu quả.
  • Học tăng cường suy luận đa lĩnh vực. VibeThinker-3B tái sử dụng MGPO. Học tăng cường được áp dụng lần lượt cho các nhiệm vụ toán học, lập trình và suy luận STEM. Quá trình huấn luyện sử dụng một cửa sổ ngữ cảnh dài 64K duy nhất để giữ lại toàn bộ đường đi suy luận miền thời gian dài.
  • Tự cô đặc ngoại tuyến. Lọc và cô đặc các đường đi chất lượng cao từ các checkpoint RL toán học, lập trình và STEM, cuối cùng tạo thành một mô hình học sinh thống nhất. Điểm tiềm năng học tập được sử dụng để ưu tiên những đường đi đúng nhưng mô hình học sinh chưa bắt chước tốt.
  • Instruct RL. Giai đoạn cuối cùng nâng cao khả năng kiểm soát đối với các hướng dẫn hướng tới người dùng. Đối với dữ liệu hướng dẫn nhạy cảm về định dạng và mở, bộ xác thực dựa trên quy tắc và mô hình phần thưởng dựa trên tiêu chí chấm điểm được sử dụng.

Trong một bài đăng gần đây, nhà nghiên cứu AI và blogger nổi tiếng Sebastian Raschka đã tổng kết có hệ thống các điểm chính được tiết lộ trong báo cáo kỹ thuật VibeThinker-3B, bao gồm những điểm sau:

Nếu bạn quan tâm đến những nội dung này, có thể đi xem chi tiết báo cáo kỹ thuật của họ. Hiện tại, mô hình cũng có thể tải xuống công khai.

Tiêu đề báo cáo: VibeThinker-3B: Exploring the Frontier of Verifiable Reasoning in Small Language Models

Liên kết báo cáo: https://arxiv.org/pdf/2606.16140

Liên kết HuggingFace: https://huggingface.co/WeiboAI/VibeThinker-3B

Tuy nhiên, phạm vi áp dụng của mô hình này có những hạn chế rõ ràng, vì nó không thể hiện xuất sắc trong các lĩnh vực cần kiến thức tổng quát.

Bên chính thức cũng chỉ rõ điểm này, và đưa ra "Giả thuyết Nén Tham số Bao phủ": các khả năng khác nhau phụ thuộc vào tham số mô hình theo những cách hoàn toàn khác nhau. Suy luận có thể xác minh gần hơn với một khả năng có thể nén cao, đặc chắc tham số, cốt lõi của nó nằm ở suy luận nhiều bước, thỏa mãn ràng buộc, tự sửa lỗi và xác minh câu trả lời. Khi không gian nhiệm vụ có cấu trúc đủ rõ ràng và tín hiệu phản hồi đủ đáng tin cậy, một mô hình nhỏ gọn cũng có thể có khả năng suy luận gần với mức tiên phong. Ngược lại, kiến thức lĩnh vực mở, hội thoại chung và hiểu biết các tình huống đuôi dài (long-tail) lại phụ thuộc nhiều hơn vào tham số quy mô lớn để bao phủ rộng rãi các sự kiện, khái niệm và kiến thức thế giới. Giả thuyết này rất mang tính gợi mở. VentureBeat trong bài báo đã viết: "Nó tiết lộ rằng có sự tách rời một phần giữa khả năng suy luận và kiến thức thực tế, và khả năng trước có thể được nén hiệu quả hơn so với những gì được nghĩ trước đây — một hiểu biết sâu sắc có tác động sâu rộng đến cách ngành công nghiệp nhìn nhận về thiết kế mô hình, chi phí triển khai và tính phổ biến của các tính năng AI cao cấp."

Tác giả cho biết, mục tiêu của họ không phải là tạo ra một mô hình nhỏ thay thế cho các mô hình quy mô lớn, mà là xem xét ranh giới thực sự của các mô hình nhỏ dọc theo các chiều kích khả năng cụ thể. Với VibeThinker-3B, họ hy vọng chỉ ra rằng, mô hình nhỏ không nên chỉ được coi là một giải pháp thỏa hiệp để giảm chi phí triển khai. Trong các lĩnh vực khả năng có cơ chế phản hồi và xác minh rõ ràng, các mô hình ngôn ngữ nhỏ đang thể hiện một con đường nghiên cứu đầy hứa hẹn, có khả năng đạt được hiệu suất ở mức tiên phong, và hình thành một mối quan hệ bổ sung cơ bản với mô hình mở rộng quy mô tham số truyền thống.

Hiện tại, mô hình này trong cộng đồng vẫn đang phải đối mặt với một số nghi ngờ. Nếu mọi người quan tâm đến mô hình này, tốt nhất nên tự mình thử nghiệm.

Liên kết tham khảo:

https://x.com/orcus108/status/2066876960073281582

Bài viết này đến từ tài khoản WeChat công cộng "机器之心" (ID:almosthuman2014), tác giả: Zhang Qian

Câu hỏi Liên quan

QMô hình VibeThinker-3B có những đặc điểm nổi bật nào?

AVibeThinker-3B là một mô hình suy luận dày đặc với 3 tỷ tham số, được phát triển bởi đội ngũ Weibo (Sina Weibo). Nó nổi bật với khả năng đạt điểm số tương đương các mô hình lớn như GPT-4 hay Claude Opus trong các nhiệm vụ suy luận có thể xác minh được, chẳng hạn như lập trình và toán học, mặc dù có kích thước nhỏ hơn rất nhiều. Mô hình được huấn luyện chuyên biệt cho các nhiệm vụ có tín hiệu xác minh rõ ràng.

QVibeThinker-3B đạt kết quả thế nào trong các bài kiểm tra chuẩn?

ATrong các bài kiểm tra chuẩn, VibeThinker-3B đạt được điểm số rất cao: 94.3 điểm trên AIME26, 89.3 điểm trên HMMT25, 80.2 điểm trên LiveCodeBench v6, và tỷ lệ vượt qua 96.1% trên các cuộc thi LeetCode mới nhất (chưa công bố). Khi áp dụng chiến lược CLR, điểm số còn được cải thiện hơn nữa.

QQuy trình đào tạo của VibeThinker-3B có những bước chính nào?

AQuy trình đào tạo của VibeThinker-3B bao gồm: 1) SFT hai giai đoạn dựa trên chương trình giảng dạy, 2) Học tăng cường lý luận đa lĩnh vực (sử dụng MGPO), 3) Tự chưng cất ngoại tuyến để hợp nhất các khả năng, và 4) Học tăng cường theo chỉ dẫn (Instruct RL) để cải thiện khả năng điều khiển theo lời nhắc của người dùng. Nó được xây dựng dựa trên Qwen2.5-Coder-3B.

QGiả thuyết 'nén tham số' được đề cập trong bài là gì và có ý nghĩa thế nào?

AGiả thuyết 'nén tham số' cho rằng khả năng suy luận có thể xác minh và kiến thức thực tế phần nào tách rời nhau. Khả năng suy luận (như giải toán, lập trình) có tính nén cao và phụ thuộc nhiều vào tham số hơn, có thể đạt hiệu suất cao ngay cả ở mô hình nhỏ nếu nhiệm vụ có cấu trúc rõ ràng và tín hiệu phản hồi đáng tin cậy. Trong khi đó, kiến thức thực tế và đối thoại mở cần nhiều tham số hơn để bao phủ rộng. Điều này mở ra hướng nghiên cứu mới về thiết kế và triển khai mô hình hiệu quả.

QMô hình VibeThinker-3B có hạn chế gì và ở đâu có thể tải xuống?

AHạn chế chính của VibeThinker-3B là nó không xuất sắc trong các lĩnh vực đòi hỏi kiến thức chung rộng, như đối thoại mở hoặc hiểu các tình huống đuôi dài. Mô hình được tối ưu hóa chuyên biệt cho các nhiệm vụ suy luận có thể xác minh. Báo cáo kỹ thuật và mô hình có thể được tải xuống công khai từ liên kết arXiv và HuggingFace được cung cấp trong bài viết.

Nội dung Liên quan

Đối thoại với Ray Dalio: Chúng ta đang ở trong bong bóng AI, 1% danh mục đầu tư của tôi là Bitcoin

Ray Dalio, người sáng lập Bridgewater Associates, trong một cuộc phỏng vấn đã chỉ ra rằng thế giới hiện tại đang trong một "AI bubble" (bong bóng AI) cổ điển, với giá tài sản tăng vọt và đầu cơ quá mức. Ông cảnh báo bong bóng có thể vỡ do lãi suất tăng, nguồn cung cổ phiếu dư thừa hoặc khi nhà đầu tư cần tiền mặt trả nợ, dẫn đến suy thoái kinh tế. Đồng thời, Dalio mô tả một "chu kỳ lớn" kéo dài khoảng 80 năm, bao gồm ba động lực chồng chéo: khoảng cách giàu nghèo và xung đột nội bộ, thâm hụt ngân sách chính phủ khổng lồ và thay đổi địa chính trị. Ông nhấn mạnh rằng Mỹ và Anh đang đối mặt với những thách thức trong giai đoạn suy yếu này. Để bảo vệ của cải, Dalio khuyến nghị đa dạng hóa danh mục đầu tư với cổ phiếu, vàng, trái phiếu, bất động sản thay vì chỉ giữ tiền mặt. Ông tiết lộ khoảng 1% danh mục của mình là Bitcoin, nhưng vẫn ưa chuộng vàng vật chất hơn do tính ổn định và vai trò tiền tệ dự trữ. Về tác động của AI, Dalio cho rằng nó không chỉ thay thế lao động chân tay mà còn cả tư duy, làm trầm trọng thêm bất bình đẳng thu nhập. Con người cần phát huy trí tuệ cảm xúc và trực giác - những thứ AI chưa có - và học cách hợp tác với AI. Cuối cùng, ông phân tích những rủi ro của thuế tài sản và xu hướng thế giới có thể trở nên "khu vực hóa" hơn, với các khối như châu Mỹ và châu Á - Thái Bình Dương, trong bối cảnh sự thống trị toàn cầu của Mỹ đang suy yếu.

marsbit1 giờ trước

Đối thoại với Ray Dalio: Chúng ta đang ở trong bong bóng AI, 1% danh mục đầu tư của tôi là Bitcoin

marsbit1 giờ trước

Hơn 7.2 nghìn tỷ won trong một ngày, ngoại hải nước ngoài mua ròng kỷ lục vào thứ Sáu! Phố Wall: Cơn gió ngược về mặt vốn của thị trường chứng khoán Hàn Quốc đã tan biến

Dòng vốn nước ngoài đổ mạnh vào thị trường chứng khoán Hàn Quốc (KOSPI) với mức mua ròng kỷ lục 7,2 nghìn tỷ won chỉ trong ngày 31/7, đánh dấu sự đảo chiều rõ rệt sau nhiều tháng bán ròng mạnh. Theo báo cáo từ Citigroup, áp lực bán từ dòng vốn nước ngoài đã giảm đáng kể, với mức bán ròng tháng 7 thu hẹp còn 9,8 nghìn tỷ won so với mức 48,4 và 44,5 nghìn tỷ won trong tháng 6 và tháng 5. Đồng thời, các quỹ hưu trí và quỹ đầu tư trong nước cũng chuyển sang vị thế mua ròng 1,0 nghìn tỷ won trong tháng 7. Một yếu tố hỗ trợ khác là quy định mới từ Ủy ban Dịch vụ Tài chính Hàn Quốc (FSC), có hiệu lực từ 31/7, siết chặt điều kiện đầu tư vào các ETF có đòn bẩy đối với nhà đầu tư cá nhân. Quy định này đã ngay lập tức làm giảm khoảng 50% khối lượng giao dịch của các ETF này, góp phần kỳ vọng giảm bớt biến động cho thị trường. Citigroup duy trì mục tiêu chỉ số KOSPI ở mức 10.000 điểm, dựa trên các yếu tố thuận lợi như ngành chip bán dẫn ổn định, định giá thị trường thấp, nền tảng kinh tế vững mạnh và các chính sách hỗ trợ. Họ nhận định áp lực dòng vốn ngược chiều đang giảm dần, tạo điều kiện cho các yếu tố cơ bản và chính sách tích cực phát huy tác dụng.

marsbit1 giờ trước

Hơn 7.2 nghìn tỷ won trong một ngày, ngoại hải nước ngoài mua ròng kỷ lục vào thứ Sáu! Phố Wall: Cơn gió ngược về mặt vốn của thị trường chứng khoán Hàn Quốc đã tan biến

marsbit1 giờ trước

Làm thế nào để khiến bản thân trở nên không thể bị thay thế bởi trí tuệ nhân tạo

**Tóm tắt: Làm thế nào để trở nên không thể bị thay thế bởi AI** Bài viết phản đối việc than vãn về AI và thay vào đó đề xuất một giải pháp căn cơ: trở thành một "siêu cá nhân" không thể bị thuê mướn. Mối đe dọa thực sự không phải là AI, mà là tình trạng "nô lệ lương thưởng" – phụ thuộc hoàn toàn vào người khác để sinh tồn, làm công việc nhàm chán mà không có mục đích. Để thoát khỏi vòng luẩn quẩn này và phát triển mạnh trong kỷ nguyên AI, bạn cần trau dồi 5 yếu tố then chốt: 1. **Tính tự chủ:** Khả năng hành động mà không cần chờ chỉ thị. 2. **Khiếu thẩm mỹ:** Khả năng nhận biết điều gì thực sự có giá trị. 3. **Khả năng thuyết phục:** Thu hút sự chú ý và sự công nhận. 4. **Sự kiên trì:** Không sợ thất bại, xem đó là bài học. 5. **Khả năng lặp:** Điều chỉnh dựa trên phản hồi để tiến tới mục tiêu. Giải pháp là đầu tư vào sự nghiệp của chính mình. Trong khi AI giỏi tạo ra "tài sản" (nội dung, code), nó không thể thay thế được khả năng phân biệt thứ gì đáng để tạo ra, làm cho mọi người quan tâm và kiên trì theo đuổi. Trong hai kỹ năng đòn bẩy mạnh mẽ là **Code (Lập trình)** và **Media (Nội dung)**, bài viết nhấn mạnh **Nội dung** quan trọng hơn. Giá trị của nội dung là chủ quan và đòi hỏi sự am hiểu, trải nghiệm mà AI khó có được, tạo không gian cho các cá nhân sáng tạo thực sự. **Cách bắt đầu (Bài tập 15 phút):** 1. **Khai thác nguyên liệu thô của bạn:** Xác định chủ đề bạn am hiểu sâu, vấn đề bạn tự giải quyết được, hay sở thích đặc biệt từ nhỏ. 2. **Xác định "trục phản biện" của bạn:** Tìm ra quan điểm độc đáo của bạn – những điều bạn tin là đúng nhưng số đông lại sai trong lĩnh vực của mình. 3. **Xuất bản ý tưởng đầu tiên:** Kết hợp câu trả lời từ bước 1 và 2, tạo ra một nội dung (bài đăng, video) và đăng nó lên. Hành động này mang lại phản hồi thực tế, bắt đầu quá trình học hỏi, lặp lại và phát triển kỹ năng thuyết phục. Bằng cách xây dựng một sự nghiệp xoay quanh con người thật, trải nghiệm thật và góc nhìn độc đáo của mình thông qua nội dung, bạn có thể tạo ra giá trị mà AI không thể sao chép, từ đó trở nên không thể thay thế.

marsbit3 giờ trước

Làm thế nào để khiến bản thân trở nên không thể bị thay thế bởi trí tuệ nhân tạo

marsbit3 giờ trước

Nhờ việc tung xúc xắc, chìa khóa Bitcoin được lưu trữ offline, nhưng không phải ai cũng muốn làm điều này

Cảm biến từ cuộc tranh cãi gần đây xung quanh lỗ hổng trong ví phần cứng Coldcard, bài viết thảo luận về phương pháp tạo seed (cụm từ khôi phục) cho ví Bitcoin bằng cách xúc xắc vật lý. Mỗi lần xúc xắc công bằng cung cấp khoảng 2,6 bit entropy (thước đo tính ngẫu nhiên). Để đạt mức entropy an toàn cho một seed 12 từ (128 bit), cần khoảng 50 lần xúc xắc; Coldcard khuyến nghị 99 lần để đạt mức bảo mật cao hơn. Lợi thế chính của phương pháp này là tách biệt hoàn toàn với bất kỳ lỗi phần cứng hoặc phần mềm nào trong trình tạo số ngẫu nhiên của thiết bị, từ đó bảo vệ seed chính của ví. Tuy nhiên, bài viết cảnh báo rằng trong sự cố Coldcard, các chức năng phụ khác của thiết bị (như tạo ví giấy, khóa đa chữ ký, mật mã phiên USB) vẫn có thể bị ảnh hưởng nếu chúng dựa vào trình tạo số lỗi, ngay cả khi seed chính được tạo an toàn bằng xúc xắc. Nhược điểm lớn của việc dùng xúc xắc là quá trình thủ công, dễ xảy ra sai sót, tốn thời gian và không thực tế cho đa số người dùng mới. Người dùng có thể ghi chép sai, sử dụng xúc xắc gian lận, hoặc để lộ chuỗi kết quả. Do đó, mặc dù có nền tảng toán học vững chắc, phương pháp này đòi hỏi sự tỉ mỉ cao và không phải là giải pháp khả thi cho việc áp dụng Bitcoin rộng rãi. Bài viết kết luận rằng mục tiêu dài hạn vẫn là phát triển phần cứng/phần mềm tạo số ngẫu nhiên mạnh mẽ và đáng tin cậy, trong khi vẫn giữ phương pháp thủ công như một tùy chọn cho người dùng có kinh nghiệm. Cuối cùng, bài viết đưa ra khuyến nghị cho chủ sở hữu Coldcard: cập nhật firmware, kiểm tra các chức năng phụ đã sử dụng và xem xét các biện pháp bảo mật bổ sung như ví đa chữ ký kết hợp nhiều nhà sản xuất để giảm thiểu rủi ro từ một điểm yếu đơn lẻ.

cryptonews.ru7 giờ trước

Nhờ việc tung xúc xắc, chìa khóa Bitcoin được lưu trữ offline, nhưng không phải ai cũng muốn làm điều này

cryptonews.ru7 giờ trước

Giao dịch

Giao ngay
活动图片