Mô hình nhỏ 3B, điểm lập trình sánh ngang Opus 4.5, mô hình bí ẩn gây xôn xao, hóa ra là sản phẩm trong nước

marsbitXuất bản vào 2026-06-18Cập nhật gần nhất vào 2026-06-18

Tóm tắt

Trong những ngày gần đây, mô hình nhỏ VibeThinker-3B (3 tỷ tham số) từ đội ngũ Weibo (Trung Quốc) đã gây chú ý trên mạng X nhờ khả năng lập trình và suy luận có thể kiểm chứng, được cho là ngang bằng với các mô hình tiên tiến lớn hơn nhiều như GPT-5, Claude Opus 4.5 hay Gemini 3 Pro. Mô hình này được xây dựng dựa trên Qwen2.5-Coder-3B và trải qua quy trình đào tạo nâng cao "Spectrum-to-Signal", bao gồm tinh chỉnh có giám sát hai giai đoạn theo lộ trình, học tăng cường đa lĩnh vực, tự chưng cất ngoại tuyến và học tăng cường theo chỉ dẫn (Instruct RL). Nó cũng giới thiệu chiến lược đánh giá độ tin cậy theo tuyên bố (Claim-Level Reliability - CLR) để nâng cao hiệu suất trong các bài kiểm tra. Kết quả ấn tượng: AIME26: 94.3 (97.1 với CLR), HMMT25: 89.3 (95.4 với CLR), tỷ lệ Pass@1 trên LiveCodeBench v6 là 80.2%, và tỷ lệ giải đúng các bài LeetCode mới nhất đạt 96.1%. Báo cáo kỹ thuật đưa ra "giả thuyết nén tham số": khả năng suy luận có thể kiểm chứng (như toán học, lập trình) có thể được nén hiệu quả vào mô hình nhỏ với phản hồi đáng tin cậy, trong khi kiến thức thực tế tổng quát và đối thoại mở lại phụ thuộc nhiều hơn vào quy mô tham số lớn. Mục tiêu không phải là thay thế mô hình lớn, mà là thăm dò giới hạn của mô hình nhỏ trong các lĩnh vực cụ thể, mở ra hướng nghiên cứu mới bổ sung cho mô hình truyền thống. Mô hình có sẵn trên HuggingFace và arXiv, nhưng cần lưu ý nó được thiết kế cho các nhiệm vụ suy luận có thể xác minh, không phải cho kiến thức tổng quát hay đối thoại...

Mấy ngày gần đây, một mô hình nhỏ 3B đã gây sốt trên X, vì trong một số nhiệm vụ suy luận có thể xác minh độ khó (ví dụ như lập trình), nó đã lọt vào phạm vi hiệu suất của các mô hình tiên phong như Gemini 3 Pro, GPT-5 high, Claude Opus 4.5, GLM-5, Kimi K2.5, trong khi kích thước của nó nhỏ hơn rất nhiều so với các mô hình này.

Mô hình này có tên là VibeThinker-3B, là một mô hình suy luận đặc chắc với 3 tỷ tham số, nhằm mục đích khám phá xem, trong quy mô mô hình nhỏ nghiêm ngặt, khả năng suy luận có thể xác minh có thể được đẩy đến mức độ nào.

Sau khi mô hình được công bố, nhiều người đã kinh ngạc trước thành tích của nó, và nói rằng muốn tự mình trải nghiệm.

Đáng chú ý là, nó còn là một mô hình trong nước, đến từ đội ngũ Weibo Sina.

Báo cáo kỹ thuật cho thấy, mô hình này được thiết kế chuyên biệt cho các nhiệm vụ có tín hiệu xác minh đáng tin cậy, bao gồm suy luận toán học, lập trình thi đấu, suy luận STEM và thực thi lệnh với các ràng buộc rõ ràng.

Do đó, nó thể hiện xuất sắc trong các bài kiểm tra chuẩn. Nó đạt 94.3 điểm trong bài kiểm tra AIME26, 89.3 điểm trong bài kiểm tra HMMT25, 80.2 điểm (Pass@1) trong bài kiểm tra LiveCodeBench v6, và đạt tỷ lệ vượt qua 96.1% trong các cuộc thi tuần và thi đôi (biweekly contests) mới nhất không công khai trên LeetCode từ ngày 25/4/2026 đến 31/5/2026.

Mô hình này được huấn luyện như thế nào? Báo cáo kỹ thuật tiết lộ một số chi tiết.

Đầu tiên, nó được xây dựng dựa trên Qwen2.5-Coder-3B, và sử dụng quy trình Spectrum-to-Signal nâng cấp để huấn luyện hậu kỳ (post-training). Quy trình này tăng cường tổng hợp dữ liệu, lọc chất lượng và học theo lộ trình (curriculum learning) trong quá trình tinh chỉnh có giám sát (SFT), mở rộng việc học tăng cường theo phong cách MGPO sang nhiều lĩnh vực có thể xác minh, giữ lại toàn bộ đường đi suy luận ngữ cảnh dài, và củng cố các khả năng thông qua tự cô đặc ngoại tuyến (offline self-distillation) và học tăng cường chỉ dẫn (Instruct RL).

Quy trình huấn luyện tổng thể của VibeThinker-3B

Quy trình Spectrum-to-Signal.

Ngoài ra, VibeThinker-3B còn giới thiệu Đánh giá Độ tin cậy Cấp độ Tuyên bố (Claim-Level Reliability - CLR), một chiến lược mở rộng quy mô lúc kiểm tra (test-time scaling) hướng tới suy luận có câu trả lời có thể xác minh. CLR tiếp tục nâng cao hiệu suất trong các bài kiểm tra chuẩn toán học, nâng AIME26 từ 94.3 lên 97.1, HMMT25 từ 89.3 lên 95.4, và nâng BruMO25 lên 99.2.

Quy trình huấn luyện cụ thể của nó như sau:

  • SFT hai giai đoạn dựa trên lộ trình. Giai đoạn đầu tập trung vào phạm vi khả năng rộng rãi như toán học, lập trình, suy luận STEM, hội thoại chung và tuân thủ chỉ dẫn. Giai đoạn hai chuyển sang các mẫu suy luận khó hơn và tầm nhìn rộng hơn. Sự cô đặc khám phá đa dạng (Diversity exploration distillation) được sử dụng để giữ lại nhiều đường giải pháp hiệu quả.
  • Học tăng cường suy luận đa lĩnh vực. VibeThinker-3B tái sử dụng MGPO. Học tăng cường được áp dụng lần lượt cho các nhiệm vụ toán học, lập trình và suy luận STEM. Quá trình huấn luyện sử dụng một cửa sổ ngữ cảnh dài 64K duy nhất để giữ lại toàn bộ đường đi suy luận miền thời gian dài.
  • Tự cô đặc ngoại tuyến. Lọc và cô đặc các đường đi chất lượng cao từ các checkpoint RL toán học, lập trình và STEM, cuối cùng tạo thành một mô hình học sinh thống nhất. Điểm tiềm năng học tập được sử dụng để ưu tiên những đường đi đúng nhưng mô hình học sinh chưa bắt chước tốt.
  • Instruct RL. Giai đoạn cuối cùng nâng cao khả năng kiểm soát đối với các hướng dẫn hướng tới người dùng. Đối với dữ liệu hướng dẫn nhạy cảm về định dạng và mở, bộ xác thực dựa trên quy tắc và mô hình phần thưởng dựa trên tiêu chí chấm điểm được sử dụng.

Trong một bài đăng gần đây, nhà nghiên cứu AI và blogger nổi tiếng Sebastian Raschka đã tổng kết có hệ thống các điểm chính được tiết lộ trong báo cáo kỹ thuật VibeThinker-3B, bao gồm những điểm sau:

Nếu bạn quan tâm đến những nội dung này, có thể đi xem chi tiết báo cáo kỹ thuật của họ. Hiện tại, mô hình cũng có thể tải xuống công khai.

Tiêu đề báo cáo: VibeThinker-3B: Exploring the Frontier of Verifiable Reasoning in Small Language Models

Liên kết báo cáo: https://arxiv.org/pdf/2606.16140

Liên kết HuggingFace: https://huggingface.co/WeiboAI/VibeThinker-3B

Tuy nhiên, phạm vi áp dụng của mô hình này có những hạn chế rõ ràng, vì nó không thể hiện xuất sắc trong các lĩnh vực cần kiến thức tổng quát.

Bên chính thức cũng chỉ rõ điểm này, và đưa ra "Giả thuyết Nén Tham số Bao phủ": các khả năng khác nhau phụ thuộc vào tham số mô hình theo những cách hoàn toàn khác nhau. Suy luận có thể xác minh gần hơn với một khả năng có thể nén cao, đặc chắc tham số, cốt lõi của nó nằm ở suy luận nhiều bước, thỏa mãn ràng buộc, tự sửa lỗi và xác minh câu trả lời. Khi không gian nhiệm vụ có cấu trúc đủ rõ ràng và tín hiệu phản hồi đủ đáng tin cậy, một mô hình nhỏ gọn cũng có thể có khả năng suy luận gần với mức tiên phong. Ngược lại, kiến thức lĩnh vực mở, hội thoại chung và hiểu biết các tình huống đuôi dài (long-tail) lại phụ thuộc nhiều hơn vào tham số quy mô lớn để bao phủ rộng rãi các sự kiện, khái niệm và kiến thức thế giới. Giả thuyết này rất mang tính gợi mở. VentureBeat trong bài báo đã viết: "Nó tiết lộ rằng có sự tách rời một phần giữa khả năng suy luận và kiến thức thực tế, và khả năng trước có thể được nén hiệu quả hơn so với những gì được nghĩ trước đây — một hiểu biết sâu sắc có tác động sâu rộng đến cách ngành công nghiệp nhìn nhận về thiết kế mô hình, chi phí triển khai và tính phổ biến của các tính năng AI cao cấp."

Tác giả cho biết, mục tiêu của họ không phải là tạo ra một mô hình nhỏ thay thế cho các mô hình quy mô lớn, mà là xem xét ranh giới thực sự của các mô hình nhỏ dọc theo các chiều kích khả năng cụ thể. Với VibeThinker-3B, họ hy vọng chỉ ra rằng, mô hình nhỏ không nên chỉ được coi là một giải pháp thỏa hiệp để giảm chi phí triển khai. Trong các lĩnh vực khả năng có cơ chế phản hồi và xác minh rõ ràng, các mô hình ngôn ngữ nhỏ đang thể hiện một con đường nghiên cứu đầy hứa hẹn, có khả năng đạt được hiệu suất ở mức tiên phong, và hình thành một mối quan hệ bổ sung cơ bản với mô hình mở rộng quy mô tham số truyền thống.

Hiện tại, mô hình này trong cộng đồng vẫn đang phải đối mặt với một số nghi ngờ. Nếu mọi người quan tâm đến mô hình này, tốt nhất nên tự mình thử nghiệm.

Liên kết tham khảo:

https://x.com/orcus108/status/2066876960073281582

Bài viết này đến từ tài khoản WeChat công cộng "机器之心" (ID:almosthuman2014), tác giả: Zhang Qian

Câu hỏi Liên quan

QMô hình VibeThinker-3B có những đặc điểm nổi bật nào?

AVibeThinker-3B là một mô hình suy luận dày đặc với 3 tỷ tham số, được phát triển bởi đội ngũ Weibo (Sina Weibo). Nó nổi bật với khả năng đạt điểm số tương đương các mô hình lớn như GPT-4 hay Claude Opus trong các nhiệm vụ suy luận có thể xác minh được, chẳng hạn như lập trình và toán học, mặc dù có kích thước nhỏ hơn rất nhiều. Mô hình được huấn luyện chuyên biệt cho các nhiệm vụ có tín hiệu xác minh rõ ràng.

QVibeThinker-3B đạt kết quả thế nào trong các bài kiểm tra chuẩn?

ATrong các bài kiểm tra chuẩn, VibeThinker-3B đạt được điểm số rất cao: 94.3 điểm trên AIME26, 89.3 điểm trên HMMT25, 80.2 điểm trên LiveCodeBench v6, và tỷ lệ vượt qua 96.1% trên các cuộc thi LeetCode mới nhất (chưa công bố). Khi áp dụng chiến lược CLR, điểm số còn được cải thiện hơn nữa.

QQuy trình đào tạo của VibeThinker-3B có những bước chính nào?

AQuy trình đào tạo của VibeThinker-3B bao gồm: 1) SFT hai giai đoạn dựa trên chương trình giảng dạy, 2) Học tăng cường lý luận đa lĩnh vực (sử dụng MGPO), 3) Tự chưng cất ngoại tuyến để hợp nhất các khả năng, và 4) Học tăng cường theo chỉ dẫn (Instruct RL) để cải thiện khả năng điều khiển theo lời nhắc của người dùng. Nó được xây dựng dựa trên Qwen2.5-Coder-3B.

QGiả thuyết 'nén tham số' được đề cập trong bài là gì và có ý nghĩa thế nào?

AGiả thuyết 'nén tham số' cho rằng khả năng suy luận có thể xác minh và kiến thức thực tế phần nào tách rời nhau. Khả năng suy luận (như giải toán, lập trình) có tính nén cao và phụ thuộc nhiều vào tham số hơn, có thể đạt hiệu suất cao ngay cả ở mô hình nhỏ nếu nhiệm vụ có cấu trúc rõ ràng và tín hiệu phản hồi đáng tin cậy. Trong khi đó, kiến thức thực tế và đối thoại mở cần nhiều tham số hơn để bao phủ rộng. Điều này mở ra hướng nghiên cứu mới về thiết kế và triển khai mô hình hiệu quả.

QMô hình VibeThinker-3B có hạn chế gì và ở đâu có thể tải xuống?

AHạn chế chính của VibeThinker-3B là nó không xuất sắc trong các lĩnh vực đòi hỏi kiến thức chung rộng, như đối thoại mở hoặc hiểu các tình huống đuôi dài. Mô hình được tối ưu hóa chuyên biệt cho các nhiệm vụ suy luận có thể xác minh. Báo cáo kỹ thuật và mô hình có thể được tải xuống công khai từ liên kết arXiv và HuggingFace được cung cấp trong bài viết.

Nội dung Liên quan

Thị trường chứng khoán Hàn Quốc bật tăng mạnh sau quá trình giảm đòn bẩy kịch tính, SK Hynix tăng 30%

Ngày 31/7, thị trường chứng khoán Hàn Quốc phục hồi mạnh mẽ. Chỉ số KOSPI tăng 18,27%, SK Hynix tăng trần 30%. Đợt phục hồi diễn ra sau một cơn bão thanh lý đòn bẩy dữ dội khiến KOSPI giảm gần 40% trong hơn một tháng. Các chuyên gia từ Nomura chỉ ra nguyên nhân sụt giảm chủ yếu do yếu tố thanh khoản và cấu trúc sản phẩm ETF đòn bẩy, tạo ra vòng xoáy "giảm giá - thanh lý - giảm sâu hơn", chứ không phải do cơ bản doanh nghiệp xấu đi. Ba yếu tố chính thúc đẩy đợt bật tăng: 1. Báo cáo tài chính tích cực từ các nhà cung cấp đám mây Bắc Mỹ như Microsoft và Amazon đã xua tan lo ngại về "bong bóng AI". 2. Chủ tịch tập đoàn SK, Choi Tae-won, mua vào cổ phiếu SK Hynix, thể hiện sự tự tin vào giá trị dài hạn. 3. Chính phủ Hàn Quốc công bố kế hoạch đầu tư 20 nghìn tỷ Won vào AI và cơ sở hạ tầng. Sau cơn bão thanh lý, chính phủ Hàn Quốc siết chặt quản lý đối với ETF đòn bẩy, tăng yêu cầu ký quỹ và hạn chế đầu tư cho nhà đầu tư nhỏ lẻ. Nomura nhận định quá trình giảm đòn bẩy là điều kiện tiên quyết để thị trường chuyển từ động lực thanh khoản sang cơ bản. Các tín hiệu như dòng vốn ngoại bán tháo chậm lại và quy mô ETF đòn bẩy giảm đã xuất hiện. Tuy nhiên, một số nhà phân tích cảnh báo đợt phục hồi có thể chỉ là điều chỉnh kỹ thuật sau mức giảm quá mức và sự giải tỏa áp lực thanh khoản, chưa hẳn là sự đảo chiều xu hướng. Sự ổn định lâu dài của KOSPI vẫn phụ thuộc vào chỉ dẫn chi tiêu vốn của các gã khổng lồ công nghệ toàn cầu và chu kỳ giá chip bán dẫn.

marsbit9 phút trước

Thị trường chứng khoán Hàn Quốc bật tăng mạnh sau quá trình giảm đòn bẩy kịch tính, SK Hynix tăng 30%

marsbit9 phút trước

Công ty tiền điện tử Wintermute đưa ra tuyên bố bi quan về sự tăng trưởng dự kiến của altcoin! Dưới đây là chi tiết

Công ty tạo lập thị trường tiền mã hóa Wintermute đã đưa ra nhận định ít lạc quan về đợt tăng trưởng sắp tới của altcoin. Công ty cho rằng mùa altcoin theo kiểu truyền thống, với hàng trăm đồng tiền cùng tăng giá, có thể sẽ không lặp lại. Thay vào đó, vốn đang có xu hướng tập trung vào một nhóm nhỏ các dự án. Dữ liệu từ Wintermute cho thấy 72% khối lượng giao dịch OTC của họ trong nửa đầu năm 2026 đến từ khách hàng tổ chức, mức cao kỷ lục. Dòng tiền tổ chức được nhận thấy là hành động chọn lọc hơn, tập trung vào các token cụ thể và nhanh chóng rút lui sau đợt tăng giá mạnh, trong khi nhà đầu tư cá nhân duy trì sự quan tâm lâu hơn. Các số liệu thị trường khác cũng củng cố nhận định này. CryptoQuant báo cáo khối lượng giao dịch cặp altcoin/Bitcoin gần chạm mức thấp nhất từ năm 2021, trong khi 10 altcoin hàng đầu (không tính stablecoin) chiếm tới 80,5% tổng vốn hóa thị trường altcoin. Tương tự, Kaiko ghi nhận 63% tổng khối lượng giao dịch altcoin hiện tập trung vào 10 đồng tiền hàng đầu, tăng so với mức 50% cách đây vài tháng. Các phân tích cho rằng trong bối cảnh mới, chỉ những dự án có ứng dụng thuyết phục, tính thanh khoản cao, hệ sinh thái vững chắc và được các nhà đầu tư tổ chức quan tâm mới có thể nổi bật. Do đó, một mùa tăng giá altcoin tiềm năng sắp tới có thể sẽ không có quy mô rộng khắp như trước, mà lợi nhuận sẽ tập trung vào một số ít dự án triển vọng.

cryptonews.ru11 phút trước

Công ty tiền điện tử Wintermute đưa ra tuyên bố bi quan về sự tăng trưởng dự kiến của altcoin! Dưới đây là chi tiết

cryptonews.ru11 phút trước

Phần bù "không rủi ro" của trái phiếu Kho bạc Mỹ đang biến mất

Tác giả: WuBlockchain Biên dịch: Deep Wave TechFlow Bài viết phân tích một rủi ro cấu trúc thị trường đang đánh giá thấp: phần bù "tài sản phi rủi ro" cho trái phiếu kho bạc Mỹ đang dần biến mất. Tín hiệu này được phản ánh rõ trong chính đường cong lợi suất. **Phân tích đường cong lợi suất:** Tính đến ngày 27/7/2026, toàn bộ đường cong lợi suất trái phiếu Mỹ từ kỳ hạn ngắn đến dài đều nằm trên lãi suất chính sách (EFFR). Điểm cao nhất là trái phiếu 20 năm (+152 điểm cơ bản), cho thấy phí bù đắp kỳ hạn và rủi ro tín dụng chủ quyền tập trung ở khu vực dài hạn, không phải chỉ là kỳ vọng chính sách tiền tệ. So sánh lịch sử cho thấy mức phí bù đắp kỳ hạn thuần túy (20 năm trừ 2 năm) hiện đã bằng 2/3 đỉnh năm 1994, trong khi tỷ lệ nợ/GDP cao gấp đôi. **So sánh toàn cầu:** Khi đo bằng chênh lệch giữa lợi suất 10 năm và lãi suất chính sách, Mỹ (+102 điểm cơ bản) xếp ngang với Đức (+88 điểm). Ở kỳ hạn ngắn (2 năm), Mỹ gần bằng các nước như Ấn Độ. Điều này cho thấy uy tín của Fed không còn mang lại chiết khấu cho trái phiếu ngắn hạn. Mỹ vẫn được hưởng "chiết khấu dự trữ toàn cầu", nhưng nếu điều này trở về mức trung bình của G10, lợi suất dài hạn có thể tăng thêm ~50 điểm cơ bản. **Thị trường quyền chọn:** Thị trường đang định giá một phân phối hai đỉnh: một trạng thái ổn định và một đuôi rủi ro sự kiện tài khóa đắt đỏ. Sự không nhất quán giữa biến động lãi suất, chỉ số SKEW (dự báo rủi ro) và biến động cổ phiếu cho thấy bảo vệ giảm giá cổ phiếu có thể bị định giá thấp. **Kết cục lịch sử:** Lịch sử cho thấy ba kịch bản chính để khắc phục tổn thất uy tín: củng cố tài khóa (thập niên 1950, 1990), lạm phát và lệ thuộc vào chính sách tiền tệ (thập niên 1940, 1970), hoặc một sự kiện kỷ luật từ bên ngoài (Volcker). Chưa từng xảy ra vỡ nợ. **Tác động đến thị trường mới nổi & chiến lược trung lập:** Cú sốc định giá lại lan truyền, ví dụ điển hình là sự sụp đổ của thị trường Hàn Quốc (liên quan đến đòn bẩy của nhà đầu tư nhỏ lẻ và chuỗi cung ứng AI). Chiến lược trung lập không miễn nhiễm, vì rủi ro chuyển từ delta sang gamma, chi phí vốn và mức độ tập trung vị thế. **Điểm theo dõi then chốt:** Các chỉ số phí bù đắp kỳ hạn (ACM, CR), khoảng cách giữa độ lệch quyền chọn cổ phiếu 25-delta và chỉ số SKEW, sức mạnh của quyền chọn mua vàng, kết quả đấu giá trái phiếu 20 năm, dòng vốn ra/vào thị trường mới nổi, và đặc biệt là việc trái phiếu không còn phòng hộ rủi ro khi thị trường biến động.

marsbit16 phút trước

Phần bù "không rủi ro" của trái phiếu Kho bạc Mỹ đang biến mất

marsbit16 phút trước

UNI Bật Công Tắc Phí: Uniswap Hoàn Thành Màn Ra Mắt Thương Mại Hóa, Tháng 9 Đón Thử Thách Đầu Tiên

Tác giả: Jae, PANews Ngày 30/7, giá UNI của Uniswap tăng mạnh trên 10%, vượt mốc 4 USD, nhờ việc kích hoạt "công tắc phí" (Fee Switch) trên Uniswap V4 từ ngày 27/7. Điều này giúp doanh thu hàng ngày của giao thức tăng vọt từ 118k USD lên ~318k USD, chủ yếu được thúc đẩy bởi Robinhood Chain - hiện chiếm hơn 52% tổng doanh thu và trở thành nguồn thu chính. Cơ chế mới tự động chuyển một phần phí giao dịch vào "TokenJar", khuyến khích các nhà giao dịch chênh lệch giá mua và đốt UNI để lấy phí, tạo ra vòng xoáy tích cực: phí giao dịch tăng -> UNI bị đốt -> nguồn cung giảm -> giá trị token tăng. Tuy nhiên, sự tăng trưởng này tiềm ẩn nhiều rủi ro. Phần lớn khối lượng giao dịch trên Robinhood Chain (~99%) đến từ các meme coin như CASHCAT. Một thử thách lớn sẽ đến vào cuối tháng 9 khi chính sách miễn phí gas của Robinhood Chain kết thúc, có thể làm nguội sự sôi động hiện tại. Ngoài ra, định giá của UNI đang ở mức cao (P/E ~100 lần), phản ánh kỳ vọng tăng trưởng lớn. Tranh cãi cũng nổ ra về việc liệu phí giao thức mới có làm giảm lợi nhuận của các nhà cung cấi thanh khoản (LP) hay không. Người sáng lập Hayden Adams khẳng định đây là khoản phí "bổ sung" cho người giao dịch, không cắt giảm lợi nhuận của LP, nhưng tác động dài hạn đến khối lượng giao dịch vẫn cần theo dõi. Tóm lại, Uniswap đã có màn ra mắt thương mại hóa thành công, nhưng tính bền vững phụ thuộc vào khả năng mở rộng sang các ứng dụng có giá trị lâu dài hơn là chỉ dựa vào giao dịch meme coin.

marsbit19 phút trước

UNI Bật Công Tắc Phí: Uniswap Hoàn Thành Màn Ra Mắt Thương Mại Hóa, Tháng 9 Đón Thử Thách Đầu Tiên

marsbit19 phút trước

Giao dịch

Giao ngay
活动图片