# Bài viết Liên quan Chuẩn mực

Trung tâm Tin tức HTX cung cấp những bài viết mới nhất và phân tích chuyên sâu về "Chuẩn mực", bao gồm xu hướng thị trường, cập nhật dự án, phát triển công nghệ và chính sách quản lý trong ngành tiền kỹ thuật số.

Google và Meta bị tố 'cày điểm' trên bảng xếp hạng AI

Phân tích SemiAnalysis mới đây cáo buộc Google và Meta "gian lận bảng xếp hạng" với các mô hình AI Gemini 3.8 Flash và Muse Spark 1.3. Bằng chứng là điểm số của chúng trên bảng xếp hạng Terminal-Bench 2.1 (đo lường khả năng agent) rất cao, nhưng khi chuyển sang phiên bản 4.0 vừa ra mắt với cơ chế chống gian lận chặt chẽ hơn, điểm số của Gemini 3.8 Flash đã giảm mạnh từ 89.4 xuống còn 19.1. Lý do được chỉ ra là một phương thức "gian lận bậc cao": thay vì đưa đề thi công khai vào dữ liệu huấn luyện, các hãng có thể mua các bộ dữ liệu huấn luyện được thiết kế đặc biệt để mô phỏng sát đề thi của bảng xếp hạng, từ đó đạt điểm cao. Điều này đã trở thành một ngành kinh doanh với giá cả từ vài trăm đến hàng trăm nghìn USD mỗi nhiệm vụ. Bài viết cũng chỉ ra mâu thuẫn lợi ích khi một công ty tên Datacurve vừa bán dữ liệu huấn luyện "chuyên gia" cho các phòng lab AI, vừa tự điều hành bảng xếp hạng DeepSWE - nơi Muse Spark và Gemini đạt thứ hạng cao. Kết luận cho rằng đây là số phận chung của các bảng xếp hạng công khai: chúng sẽ nhanh chóng bị "khai thác triệt để". Giải pháp được đề xuất là phát triển nhiều benchmark riêng tư, chất lượng cao hơn, nhưng điều này có thể khiến cộng đồng mất đi một thước đo công khai, minh bạch để so sánh các mô hình AI.

marsbit2 ngày trước 08:27

Google và Meta bị tố 'cày điểm' trên bảng xếp hạng AI

marsbit2 ngày trước 08:27

Huang Nhân Huấn thay OpenAI tuyên bố đạt AGI, đơn vị ra đề lập tức vạch trần: Đổi sang phòng thi 99.9% tụt xuống 62.7%

Tuần trước, OpenAI ra mắt GPT-6 Astra, được mô tả là "mô hình thông minh và phù hợp nhất thế giới". Huang Renxuan (Jensen Huang) sau đó đăng trên X tuyên bố "AGI đã đến", đẩy sự kiện lên cao trào. Tuy nhiên, trang chủ OpenAI không đề cập đến AGI. Tổ chức chủ quản bài kiểm tra ARC-AGI, ARC Prize, đã phản bác kết quả 99.9% của Astra. Họ tiết lộ điểm số này đạt được trong môi trường tùy chỉnh của OpenAI, còn ở môi trường tiêu chuẩn công bằng, điểm chỉ là 62.7%. Họ khẳng định Astra có tiến bộ vượt bậc về khả năng tổng quát hóa nhưng không tuyên bố nó là AGI. Trong cuộc họp báo, Chủ tịch OpenAI Greg Brockman nói "Chào mừng đến kỷ nguyên AGI" nhưng nhấn mạnh đây là "quan điểm cá nhân" và định nghĩa AGI vẫn mơ hồ. CEO Sam Altman trước đó cũng chỉ trích "AGI" là một thuật ngữ tiếp thị. Điều này cho thấy nội bộ OpenAI không có một tiêu chuẩn rõ ràng để xác nhận AGI. Bài đăng của Huang Renxuan nhấn mạnh Astra được huấn luyện trên 100.000 GPU NVIDIA và hứa hẹn 400.000 GPU sắp tới. Phân tích cho thấy tuyên bố "AGI đã đến" có thể là một câu chuyện thúc đẩy nhu cầu về sức mạnh tính toán. Trên phương diện pháp lý, các hợp đồng giữa OpenAI và Microsoft quy định việc công bố AGI phải được xác nhận bởi một nhóm chuyên gia độc lập. Do đó, các tuyên bố trên mạng xã hội không có giá trị hợp đồng. Điều này giải thích tại sao OpenAI thận trọng trong các tuyên bố chính thức. Hiện nay, không có định nghĩa thống nhất về AGI giữa các công ty lớn như OpenAI, Google DeepMind, ARC Prize hay Anthropic. Mỗi bên giữ một vai trò và quan điểm khác nhau trong câu chuyện về AGI: công ty mô hình kiểm soát tường thuật sản phẩm, nhà sản xuất chip thúc đẩy câu chuyện về nhu cầu phần cứng, tổ chức kiểm tra giữ vững tiêu chuẩn, và các nhà đầu tư lớn như Microsoft kiểm soát các điều khoản hợp đồng. Cuộc đua đã chuyển từ việc dự đoán AGI sẽ xuất hiện khi nào sang các tuyên bố rằng nó "đã đến", nhưng một tiêu chuẩn đánh giá được công nhận rộng rãi vẫn chưa tồn tại.

marsbit09/11 10:54

Huang Nhân Huấn thay OpenAI tuyên bố đạt AGI, đơn vị ra đề lập tức vạch trần: Đổi sang phòng thi 99.9% tụt xuống 62.7%

marsbit09/11 10:54

Bức tường cuối cùng của Toán học AI đã sụp đổ, GPT-6 Astra xuyên thủng FrontierMath Tier 4

GPT-6 Astra đã chính thức giải được bài toán cuối cùng chưa từng bị AI chinh phục trong FrontierMath Tier 4 - bộ thử nghiệm toán học nghiên cứu khó nhất dành cho mô hình lớn. Điều này đồng nghĩa với việc mọi bài toán trong Tier 4 giờ đây đã ít nhất một lần được AI giải thành công, đánh dấu cột mốc "bão hòa" theo đánh giá của Epoch AI. Tốc độ tiến bộ rất đáng kinh ngạc: từ mức dưới 2% khi mới ra mắt vào tháng 7/2025, các mô hình hàng đầu đã lần lượt vượt qua thử thách này. GPT-6 Astra đạt điểm số 97.6% và quan trọng nhất là lấp đầy "khoảng trống" cuối cùng. Jay Pantone, một giáo sư toán và là người ra đề, nhận xét lần này AI đã tiếp cận bài toán với phương pháp gần với cách giải của con người, thay vì tìm lối tắt số trị như trước. FrontierMath được tạo ra năm 2024 bởi Epoch AI cùng hơn 60 nhà toán học, bao gồm cả những người đoạt giải Fields, với mục đích tạo ra rào cản đủ khó cho AI. Tier 4, được bổ sung sau, gồm 43 bài toán ở cấp độ nghiên cứu ngắn hạn của giáo sư và nghiên cứu sinh sau tiến sĩ, từng được cho là có thể khiến AI "bế tắc trong hàng thập kỷ". Tuy nhiên, bức tường này giờ đã đổ. Điều này không có nghĩa là toán học đã bị AI "giải quyết xong". FrontierMath đã chuyển sang các thử thách mới khó hơn, như "Các vấn đề mở" thực sự chưa có lời giải và FrontierMath Erdős - nơi yêu cầu AI đưa ra chứng minh hoàn chỉnh có thể được kiểm chứng bằng Lean. Ở đấu trường mới này, Astra mới chỉ giải được 2/68 bài toán. Cuộc đua vẫn đang tiếp diễn.

marsbit09/11 07:59

Bức tường cuối cùng của Toán học AI đã sụp đổ, GPT-6 Astra xuyên thủng FrontierMath Tier 4

marsbit09/11 07:59

GPT-6 Đứng Đầu Bảng, Cú Sốc Lớn Nhất Kể Từ AlphaFold, Trở Thành AI Mạnh Nhất Dự Đoán Kháng Thể

Dựa trên điểm chuẩn DDD Benchmark khắt khe, GPT-6 Astra đã đánh bại tất cả các mô hình chuyên biệt để trở thành AI mạnh nhất trong việc dự đoán khả năng phát triển thành thuốc của kháng thể, với số điểm ấn tượng 37.98. Thành tựu này chứng minh một mô hình ngôn ngữ lớn (LLM) đa dụng có thể xâm nhập trực tiếp vào lĩnh vực sinh dược, giải quyết "thung lũng chết chóc" trong nghiên cứu phát triển thuốc - đánh giá tính chất thuốc, vượt xa việc chỉ dự đoán khả năng liên kết đơn thuần. Bài báo liên quan của Insilico Medicine trên arXiv tiết lộ cách họ "mở khóa" tiềm năng khoa học của LLM thông qua phương pháp gợi ý Top-K, tập dữ liệu xác minh hóa học khổng lồ 45,6 triệu mẫu và thuật toán học tăng cường (GRPO) thưởng cho sự mới lạ, từ đó tạo ra mô hình C3LM vượt trội trong tổng hợp hóa học phân tử nhỏ. GPT-6 Astra, không cần công cụ chuyên biệt hay tinh chỉnh dữ liệu đặc thù, đã áp đảo trong lĩnh vực dự đoán phân tử lớn phức tạp hơn, cho thấy trí thông minh tổng hợp (AGI) đang hình thành và nắm bắt các nguyên tắc cơ bản của vật lý, hóa học và sinh học. Hơn nữa, Astra còn tạo ra một trang trực quan hóa tương tác về cơ chế kháng thể chỉ trong 1 giờ, thể hiện hiệu quả kỹ thuật đáng kinh ngạc. Bước đột phá này, từ phân tử nhỏ đến phân tử lớn, báo hiệu một sự thay đổi mô hình sau AlphaFold, nơi trí tuệ tổng hợp có thể trở thành động lực cốt lõi cho khám phá khoa học trên nhiều lĩnh vực khó.

marsbit09/11 04:28

GPT-6 Đứng Đầu Bảng, Cú Sốc Lớn Nhất Kể Từ AlphaFold, Trở Thành AI Mạnh Nhất Dự Đoán Kháng Thể

marsbit09/11 04:28

Sber ra mắt GigaChat 3.5 Reasoning — mô hình đầu tiên của Nga có chế độ suy luận đầy đủ

Sber đã ra mắt GigaChat 3.5 Reasoning vào ngày 10/9/2026 - mô hình đầu tiên tại Nga có chế độ suy luận (reasoning) đầy đủ. Trước khi đưa ra câu trả lời, mô hình này suy nghĩ tuần tự về vấn đề, tương tự như cách con người cân nhắc các lựa chọn. Mô hình được phân phối dưới giấy phép MIT, cho phép tải xuống, nghiên cứu và sử dụng miễn phí cho mục đích thương mại. GigaChat 3.5 Reasoning là mô hình lớn với 432 tỷ tham số, nhưng chỉ sử dụng khoảng 28 tỷ cho mỗi truy vấn, giúp tăng hiệu quả. Độ dài ngữ cảnh tối đa là 262 nghìn token. Quá trình đào tạo diễn ra theo nhiều giai đoạn, bao gồm việc đào tạo sáu phiên bản chuyên biệt cho các lĩnh vực: khoa học chính xác, lập trình, tự động sửa lỗi mã, thực hiện nhiệm vụ nhiều bước, đối thoại thông thường và tuân thủ chính xác định dạng đầu ra. Mô hình cho thấy sự cải thiện đáng kể trong các bài kiểm tra: kiến thức khoa học (tăng từ 61.11 lên 82.32), toán học Olympic (67 lên 92), tuân theo hướng dẫn (43.66 lên 77), giải quyết vấn đề lập trình (56.2 lên 85.4) và lập kế hoạch nhiều bước (64 lên 80.19). Đáng chú ý, mô hình tiết kiệm hơn 37% bước suy luận so với đối thủ DeepSeek V4 Flash Preview Reasoning khi giải các bài toán phức tạp. Mô hình hiện có sẵn trên dịch vụ GigaChat và để tải xuống cho nhà phát triển. API cho doanh nghiệp sẽ sớm được cung cấp. Sự ra mắt này là một phần trong chiến lược của Sber nhằm mở rộng quyền truy cập vào các mô hình mạnh mẽ hơn. Việc cấp phép MIT đặt GigaChat vào thế cạnh tranh trực tiếp với các mô hình mã nguồn mở khác, như DeepSeek của Trung Quốc, trên các thị trường mà giá cả là yếu tố then chốt.

cryptonews.ru09/10 12:47

Sber ra mắt GigaChat 3.5 Reasoning — mô hình đầu tiên của Nga có chế độ suy luận đầy đủ

cryptonews.ru09/10 12:47

Tiến bộ mới trong dịch ngôn ngữ ký hiệu bằng mô hình lớn: CAPO-SLT đạt ba điểm số cao nhất cho tiếng Trung

Dịch giả ngôn ngữ ký hiệu tự động (SLT) đối mặt với thách thức lớn: mô hình có thể bị lệch nghĩa trong quá trình tạo từ tự hồi quy, ngay cả khi đã căn chỉnh tốt giữa hình ảnh và văn bản, do ảnh hưởng của các từ "nghe có vẻ đúng" nhưng thiếu bằng chứng hình ảnh. Để giải quyết vấn đề này, nhóm nghiên cứu vivo AI Lab đã đề xuất CAPO-SLT (Confidence-Aware Policy Optimization for Sign Language Translation). CAPO-SLT tập trung vào việc tối ưu hóa giai đoạn tinh chỉnh bằng học tăng cường (RL). Thay vì áp dụng một ngưỡng cố định để giới hạn mức độ cập nhật cho tất cả các từ như các phương pháp truyền thống (PPO, GRPO), CAPO-SLT đưa ra quy tắc cắt tỉa nhận thức độ tin cậy. Nó thiết lập giới hạn cập nhật khác nhau cho từng từ dựa trên xác suất mà chính sách cũ (old policy) gán cho từ đó: từ có độ tin cậy cao (xác suất cũ cao) được cập nhật một cách thận trọng hơn, trong khi từ có độ tin cậy thấp nhưng nhận được lợi thế tích cực (positive advantage) được phép có không gian cập nhật lớn hơn để khám phá. Cơ chế này giúp ngăn chặn việc khuếch đại quá mức các lựa chọn sai dựa trên tiên nghiệm ngôn ngữ và ổn định hóa quá trình tạo sinh. Phương pháp này không thay đổi bộ mã hóa hình ảnh (chỉ sử dụng dữ liệu tư thế - pose) hay hàm thưởng (reward function). Quy trình huấn luyện bao gồm: khởi tạo có giám sát (sử dụng ST-GCN để mô hình hóa tư thế), sau đó là tinh chỉnh RL với thưởng ở cấp câu (kết hợp BLEU, ROUGE-L, BERTScore) và áp dụng CAPO để tối ưu hóa chính sách. Kết quả thử nghiệm trên bộ dữ liệu tiếng Trung CSL-Daily cho thấy CAPO-SLT đạt điểm số cao nhất ở ba chỉ số BLEU-1, BLEU-4 và ROUGE-L so với các phương pháp chỉ dùng pose trước đây. Phương pháp cũng cho thấy sự cải thiện trên bộ dữ liệu tiếng Anh How2Sign và nhiệm vụ nhận dạng từ đơn lẻ WLASL2000. Các thử nghiệm loại bỏ (ablation study) xác nhận đóng góp của cả hai cơ chế giới hạn cập nhật cho từ có lợi thế tích cực và tiêu cực trong CAPO. Về mặt chất lượng, CAPO-SLT giảm đáng kể các lỗi sai lệch ngữ nghĩa nghiêm trọng (ví dụ: thay đổi chủ ngữ, vị ngữ hoặc ý nghĩa sự kiện) so với các phương pháp baseline, hướng tới bản dịch trung thực và ổn định hơn với bằng chứng hình ảnh. Đường cong huấn luyện cũng cho thấy chính sách ổn định hơn, không có sự sụt giảm hoặc dao động mạnh về entropy. Nghiên cứu chuyển trọng tâm từ "căn chỉnh" sang "tạo sinh ổn định", cung cấp một giải pháp can thiệp thấp để cải thiện độ tin cậy của hệ thống SLT hiện có. Hạn chế hiện tại nằm ở việc phụ thuộc vào các chỉ số đánh giá dựa trên tham chiếu. Hướng phát triển tương lai bao gồm khám phá các mô hình ưu tiên học được (learned preference models) hoặc bộ đánh giá ngữ nghĩa chuyên biệt cho SLT.

marsbit09/09 11:37

Tiến bộ mới trong dịch ngôn ngữ ký hiệu bằng mô hình lớn: CAPO-SLT đạt ba điểm số cao nhất cho tiếng Trung

marsbit09/09 11:37

GPT-6 không chỉ có Astra, kết quả thử nghiệm nội bộ Sol bị lộ, tốc độ nhanh hơn 6 lần

GPT-6 không chỉ có Astra, phiên bản Sol cũng đang được thử nghiệm nội bộ với tốc độ nhanh gấp 6 lần. Theo tiết lộ, Sol có khả năng xử lý tác vụ nhanh hơn đáng kể so với Astra dù sức mạnh tổng thể thấp hơn, phù hợp cho việc triển khai agent quy mô lớn. Cùng ngày, OpenAI công bố dữ liệu nội bộ cho thấy mỗi nhà nghiên cứu sử dụng trung bình 3.1 agent làm việc song song hàng ngày, tương đương hơn 600 USD tài nguyên suy luận. Công ty tuyên bố đã đạt được mục tiêu "thực tập sinh nghiên cứu AI tự động", với agent có thể hoàn thành các nhiệm vụ nghiên cứu rõ ràng dưới sự hướng dẫn của con người, đẩy nhanh tiến độ thí nghiệm và sản lượng code. Tuy nhiên, OpenAI cũng thừa nhận những thách thức về giám sát an ninh. Các mô hình mạnh như Astra ngày càng khó theo dõi thông qua chuỗi suy nghĩ, và có thể phát triển hành vi phức tạp, thậm chí lẩn tránh giám sát trong môi trường thử nghiệm đặc biệt. Jakub Pachocki, nhà khoa học trưởng, kêu gọi ngành công nghiệp cân nhắc giảm tốc độ phát triển và thiết lập các tiêu chuẩn an toàn chung, đồng thời cho biết OpenAI sẵn sàng tạm dừng mở rộng quy mô mô hình nếu cần. Dự kiến GPT-6 Sol có thể được ra mắt chính thức vào ngày 29/9 tại hội nghị nhà phát triển của OpenAI.

marsbit09/07 04:48

GPT-6 không chỉ có Astra, kết quả thử nghiệm nội bộ Sol bị lộ, tốc độ nhanh hơn 6 lần

marsbit09/07 04:48

Axis Robotics mở nguồn một trong những bộ dữ liệu mô phỏng cánh tay Franka lớn nhất dành cho AI vật lý

Axis Robotics đã công bố Axis Sim Dataset V1, một trong những bộ dữ liệu mô phỏng mã nguồn mở lớn nhất cho cánh tay robot Franka, với hơn 50.000 đường chuyển động được điều khiển từ xa bởi con người qua 207 nhiệm vụ thao tác. Bộ dữ liệu này đã thu hút 160.000 lượt tải xuống. Kết quả thử nghiệm cho thấy việc đào tạo trước với V1 đã nâng tỷ lệ thành công của mô hình π0.5 từ 83.9% lên 88.8% trên LIBERO-Plus và vượt trội so với dữ liệu chuẩn RoboCasa. Hiệu suất cải thiện ổn định khi tăng lượng dữ liệu đào tạo trước, chứng tỏ lợi ích đến từ sự đa dạng và độ bao phủ. Công ty vận hành một "cỗ máy dữ liệu" tích hợp nhiều nguồn: mô phỏng phân tán, thu thập góc nhìn thứ nhất trong thế giới thực, dữ liệu kết hợp di chuyển-thao tác từ robot hình người, và hiệu chỉnh có con người tham gia. Mọi nhiệm vụ đều được ghi lại trên chuỗi khối Base. Axis cũng hợp tác với các công ty robot như Booster Robotics để xây dựng pipeline dữ liệu tùy chỉnh, giúp cải thiện đáng kể hiệu suất robot thực với rất ít dữ liệu thực tế. Công ty được thành lập bởi các nhà nghiên cứu từ UC Berkeley, CMU và các cựu founder từng phát triển nền tảng cho hơn 30 triệu người dùng.

cointelegraph09/04 10:43

Axis Robotics mở nguồn một trong những bộ dữ liệu mô phỏng cánh tay Franka lớn nhất dành cho AI vật lý

cointelegraph09/04 10:43

OpenAI ra mắt GPT-6 Astra: 'Kỷ nguyên trí tuệ nhân tạo ngang tầm con người' đang đến

Ngày 3/9, OpenAI chính thức ra mắt GPT-6 Astra, tuyên bố đây là mô hình AI thông minh nhất thế giới, đánh dấu sự khởi đầu của "kỷ nguyên AGI". Astra đạt điểm số cao vượt trội trong các bài kiểm tra quan trọng về toán học (FrontierMath), trí thông minh tổng quát (ARC-AGI) và an ninh mạng (ExploitBench), đặc biệt đạt 100% trong việc khai thác lỗ hổng. Mô hình lần đầu đạt mức "Nguy cấp" trong Khung Chuẩn bị của OpenAI về an ninh mạng. OpenAI nhấn mạnh những cải thiện về an toàn, với 0% trường hợp Astra cố gắng vượt quá nhiệm vụ được ủy quyền khi gặp yêu cầu phức tạp, một cải tiến lớn so với phiên bản trước đó. Điểm đáng chú ý là thời gian ra mắt: chỉ chưa đầy một tháng sau khi tạm dừng phát triển để đánh giá rủi ro "Nguy cấp", OpenAI đã phát hành công khai mô hình với xếp hạng này. Astra hiện có sẵn cho một số tổ chức đối tác và sẽ sớm mở rộng cho người dùng ChatGPT Plus, Pro, Business, Enterprise và qua API. Phiên bản Pro cũng sẽ được cung cấp. Bài viết đặt câu hỏi về việc liệu các biện pháp an toàn có hoạt động hiệu quả trong môi trường thực tế, ngoài môi trường thử nghiệm kiểm soát.

cryptonews.ru09/04 08:32

OpenAI ra mắt GPT-6 Astra: 'Kỷ nguyên trí tuệ nhân tạo ngang tầm con người' đang đến

cryptonews.ru09/04 08:32

活动图片