# Bài viết Liên quan Suy luận

Trung tâm Tin tức HTX cung cấp những bài viết mới nhất và phân tích chuyên sâu về "Suy luận", bao gồm xu hướng thị trường, cập nhật dự án, phát triển công nghệ và chính sách quản lý trong ngành tiền kỹ thuật số.

Nỗi lo bộ nhớ của mô hình lớn, giải pháp được nghĩ tới từ ổ USB

Nỗi lo về bộ nhớ của các mô hình lớn (AI) có thể tìm thấy giải pháp từ một công nghệ quen thuộc: NAND Flash trong USB. Thông thường, Flash bị coi là chậm, nhưng SanDisk và SK Hynix đang phát triển một hướng tiếp cận mới gọi là **High Bandwidth Flash (HBF)**. Ý tưởng là áp dụng kỹ thuật đóng gói tiên tiến và xếp chồng chip từ bộ nhớ HBM (High Bandwidth Memory) vào NAND Flash, biến nó thành một bộ nhớ đọc có dung lượng lớn và băng thông cao. HBF hướng đến mục tiêu đạt **dung lượng 512GB và băng thông đọc 1.6TB/s** cho một chồng chip, với lộ trình nâng lên 3.2TB/s. Điểm mấu chốt là HBF không nhằm thay thế HBM siêu nhanh. Thay vào đó, nó tìm thấy vị trí lý tưởng trong **giai đoạn suy luận (inference) của AI**. Ở giai đoạn này, các tham số mô hình đã được đào tạo xong và chủ yếu chỉ cần đọc ra, phù hợp với ưu điểm đọc nhanh và chi phí thấp của Flash. HBM vẫn đảm nhận xử lý dữ liệu nóng cần tốc độ cực cao, trong khi HBF đóng vai trò như một "bể chứa" dung lượng lớn cho các trọng số mô hình tĩnh. Cách tiếp cận phân tầng bộ nhớ này (HBM cho tốc độ, HBF cho dung lượng đọc lớn, SSD cho lưu trữ rẻ) hứa hẹn giúp giảm nghẽn cổ chai dung lượng HBM, giảm số lượng card gia tốc cần thiết, từ đó hạ chi phí và mức tiêu thụ năng lượng cho hệ thống suy luận AI. Mặc dù HBF vẫn cần vài năm nữa để hoàn thiện và triển khai, nó báo hiệu một sự điều chỉnh trong kiến trúc bộ nhớ, hướng tới các giải pháp thiết thực hơn cho bài toán mở rộng quy mô mô hình lớn.

marsbit07/20 00:21

Nỗi lo bộ nhớ của mô hình lớn, giải pháp được nghĩ tới từ ổ USB

marsbit07/20 00:21

GPT-5.6 Lần Đầu Vượt Ngưỡng IQ 130 - Đường Ranh Giới Thiên Tài, Thông Minh Hơn 99% Nhân Loại

Hiện nay, 99% dân số toàn cầu có chỉ số IQ thấp hơn một AI. Trong bài kiểm tra IQ ngoại tuyến mới nhất của Tracking AI, nhiều phiên bản của GPT-5.6 đều đạt điểm số ấn tượng: 136 điểm. Đây là lần đầu tiên một mô hình ngôn ngữ lớn (LLM) vượt qua ngưỡng 130 điểm - "vạch xuất phát của thiên tài" trong thang đo IQ của con người, mà chỉ khoảng 1% dân số đạt được. Điều này có nghĩa là GPT-5.6 được đánh giá là thông minh hơn 99% nhân loại. Điểm số này có được từ bộ đề "ngoại tuyến" khó và chống gian lận của Tracking AI, không phải từ các bài test công khai. Trên bảng xếp hạng này, các biến thể của GPT-5.6 (bao gồm cả phiên bản thị giác) đồng loạt đạt 136 điểm, dẫn trước đối thủ gần nhất là Claude-5 Fable (130 điểm) một khoảng cách lớn. GPT-5.6 là mô hình đầu tiên phá vỡ rào cản 130 điểm sau một thời gian dài nhiều mô hình hàng đầu khác đều bị kẹt lại. Không chỉ dừng ở điểm số, khi được đưa vào thực tế công việc, GPT-5.6 thể hiện khả năng thực hành ấn tượng. Các nhà phát triển chia sẻ rằng nó có thể tạo ra một mô phỏng vật lý hoàn chỉnh, xây dựng hệ thống hỗ trợ khách hàng dựa trên RAG, hay sửa lỗi mã hiệu quả chỉ với một gợi ý đơn giản. So với một số mô hình tập trung quá mức vào độ chính xác kỹ thuật, cách tiếp cận thực tế và thiết thực của GPT-5.6 giúp hoàn thành công việc tốt hơn. Tuy nhiên, cần lưu ý rằng điểm IQ 136 này đến từ một bài kiểm tra cụ thể, tập trung vào nhận thức tiêu chuẩn hóa như nhận diện mẫu và lý luận logic. Nó không đo lường được độ tin cậy, khả năng sử dụng công cụ hay hiệu quả trong các tình huống nghề nghiệp thực tế của AI. Bài kiểm tra IQ chỉ là một lát cắt hẹp của "trí thông minh". Nhưng trải nghiệm thực tế từ người dùng cho thấy GPT-5.6 dường như đang kết hợp ngày càng tốt hơn giữa "biết làm bài kiểm tra" và "biết làm việc thực tế". Thách thức thực sự nằm ở việc giải quyết các vấn đề mới, chưa từng gặp, và không có đáp án để sao chép.

marsbit07/16 08:24

GPT-5.6 Lần Đầu Vượt Ngưỡng IQ 130 - Đường Ranh Giới Thiên Tài, Thông Minh Hơn 99% Nhân Loại

marsbit07/16 08:24

GPT-5.6 Chỉ Trong 1 Giờ Phá Vỡ Bài Toán Toán Học 50 Năm, 64 AI Cướp Được Vương Miện Lý Thuyết Đồ Thị

Ngày 11/7, OpenAI công bố GPT-5.6 Sol Ultra đã chứng minh thành công "Giả thuyết Phủ Kép Chu trình" - bài toán tồn tại suốt 50 năm trong lý thuyết đồ thị, chỉ trong chưa đầy một giờ. Giả thuyết này, do nhiều nhà toán học huyền thoại đề xuất, khẳng định mọi đồ thị vô hướng, hữu hạn, không có cầu đều tồn tại một tập hợp các chu trình sao cho mỗi cạnh được bao phủ đúng hai lần. Dù đã có nhiều kết quả một phần, chứng minh tổng quát vẫn là thách thức. GPT-5.6 Sol Ultra đã giải quyết vấn đề bằng một hệ thống gồm 64 tác nhân thông minh chạy song song, mô phỏng một đội nghiên cứu. Hệ thống này được lập trình để tránh các lỗi thường gặp: khám phá nhiều hướng tiếp cận khác nhau ngay từ đầu, cấm bắt chước ý tưởng phổ biến, và có cơ chế "kiểm tra lỗi" chuyên nghiên cử để phê bình, tấn công mọi chứng minh ứng viên. Chỉ những chứng minh nào vượt qua được sự kiểm tra khắt khe mới được chuyển sang vòng tiếp theo. Chiến lược chứng minh của AI bao gồm các bước chính: 1) Thu gọn bài toán về đồ thị lập phương; 2) Vận dụng định lý "8-dòng" của Tutte để gán nhãn véctơ cho các cạnh; 3) Xây dựng Bổ đề 2.1 về việc gán nhãn tập hợp hai phần tử; và 4) Chuyển đổi vấn đề thành một hệ phương trình đại số tuyến tính (Bổ đề 2.2), rồi chứng minh hệ luôn có nghiệm. Noam Brown của OpenAI cho biết đột phá này dựa trên việc mở rộng "Tính toán trong Thời gian Kiểm tra song song" (Parallel Test-Time Computation), cho phép tăng cường suy luận thông qua xử lý đồng thời thay vì kéo dài thời gian suy nghĩ tuần tự. Điều này biến những nhiệm vụ cần suy luận lâu dài trở nên khả thi. Sự kiện gây chấn động giới AI và toán học, với nhiều ý kiến cho rằng khả năng suy luận logic trừu tượng cấp cao của AI đã vượt con người trong lĩnh vực này, mở ra tiềm năng ứng dụng để giải quyết những vấn đề khoa học phức tạp khác.

marsbit07/15 08:01

GPT-5.6 Chỉ Trong 1 Giờ Phá Vỡ Bài Toán Toán Học 50 Năm, 64 AI Cướp Được Vương Miện Lý Thuyết Đồ Thị

marsbit07/15 08:01

Bài báo về Kỹ thuật Prompt được nhận vào ICML 2026, cộng đồng mạng tranh luận sôi nổi

Bài báo "Prompt Engineering" với tựa đề "Verbalized Sampling" (VS) đã được chấp nhận tại hội nghị ICML 2026, gây ra nhiều tranh cãi trên cộng đồng mạng. Nghiên cứu này đề xuất một phương pháp đơn giản chỉ bằng việc điều chỉnh prompt (câu lệnh) để cải thiện đáng kể tính đa dạng trong đầu ra của mô hình ngôn ngữ lớn (LLM), giải quyết vấn đề "Mode Collapse" (suy giảm đa dạng). Thay vì điều chỉnh thuật toán huấn luyện hay tham số, phương pháp VS yêu cầu mô hình không chỉ đưa ra câu trả lời mà còn xuất cả phân phối xác suất dự kiến của chúng. Ví dụ, thay vì yêu cầu "kể một câu chuyện cười", prompt sẽ là "tạo 5 câu chuyện cười và gán xác suất cho từng cái". Cách tiếp cận này giúp khôi phục sự đa dạng vốn có từ giai đoạn tiền huấn luyện của mô hình. Bài báo lập luận nguyên nhân gốc rễ của Mode Collapse không nằm ở thuật toán mà ở "thiên lệch tính điển hình" trong dữ liệu ưu tiên của con người được dùng để huấn luyện. Các thử nghiệm trên nhiều bộ dữ liệu và mô hình cho thấy VS có thể tăng tính đa dạng lên 1.6 đến 2.1 lần trong các nhiệm vụ sáng tạo, mà không làm giảm độ chính xác hay tính an toàn. Tuy nhiên, việc một nghiên cứu chủ yếu dựa vào kỹ thuật prompt lại được chấp nhận tại một hội nghị hàng đầu như ICML đã gây tranh luận. Một số người cho rằng đóng góp này quá mỏng, dễ bị ảnh hưởng bởi từng mô hình cụ thể và thiếu tính tổng quát lý thuyết. Số khác lại bảo vệ, cho rằng nghiên cứu chất lượng nằm ở việc xác định vấn đề rõ ràng, thí nghiệm nghiêm ngặt và kết quả có thể tái lập, đồng thời so sánh với sự ra đời mang tính bước ngoặt của "Chain-of-Thought" (CoT) trước đây. Nghiên cứu được thực hiện bởi nhóm từ Đại học Northeastern, Phòng thí nghiệm Manning của Stanford và Đại học West Virginia, với các tác giả chính là Jiayi Zhang, Simon Yu và Derek Chong. Sự kiện này có thể báo hiệu xu hướng các kỹ thuật tối ưu hóa trong giai đoạn suy luận (inference) ngày càng đóng vai trò quan trọng trong nghiên cứu máy học.

marsbit07/15 07:59

Bài báo về Kỹ thuật Prompt được nhận vào ICML 2026, cộng đồng mạng tranh luận sôi nổi

marsbit07/15 07:59

GPT-5.6 Sol Bỗng Nhiên Trở Nên 'Đần', Ngân Sách Suy Nghĩ Bị Cắt Từ 960 Xuống 128, Không Còn Model Cố Định Về Trí Tuệ?

Tất cả mọi người đều nói GPT-5.6 Sol đã trở nên "ngu ngốc" hơn, nhưng OpenAI phủ nhận việc "giảm trí thông minh", cho rằng đó chỉ là một "thí nghiệm" để điều tra việc sử dụng token gia tăng sau khi phát hành GPT-5.6. Trong thí nghiệm này, một thông số nội bộ chưa từng được công khai có tên "juice value" - đại diện cho ngân sách tài nguyên suy luận - đã bị giảm từ 960 xuống 128 ở chế độ Max, khiến người dùng cảm thấy mô hình suy nghĩ nông hơn và ít "đào sâu" hơn trước. Tibo từ OpenAI xác nhận việc điều chỉnh thông số này và cho biết đã khôi phục lại mức cũ. Anh ta giải thích việc tối ưu hóa hiệu suất suy luận sẽ tiết kiệm tài nguyên và tăng khoảng 10% lượt sử dụng cho người đăng ký. Ngữ cảnh tối đa cũng tạm thời được điều chỉnh từ 372k về 272k token để sửa lỗi tính phí, và sẽ được khôi phục trong vài ngày tới. Sự việc này làm dấy lên tranh cãi trong cộng đồng về việc các nhà cung cấp AI có toàn quyền điều chỉnh hiệu suất của mô hình mà người dùng đăng ký. Nó phá vỡ ảo tưởng về một "trí thông minh cố định", so sánh việc đăng ký một mô hình giống như mua một bóng đèn có nút chỉnh độ sáng nằm trong tay nền tảng. Nếu AI muốn trở thành cơ sở hạ tầng doanh nghiệp, các nhà cung cấp cần định nghĩa rõ ràng hơn các thông số đảm bảo cho người dùng, thay vì chỉ là một cái tên mô hình chung chung.

marsbit07/15 03:32

GPT-5.6 Sol Bỗng Nhiên Trở Nên 'Đần', Ngân Sách Suy Nghĩ Bị Cắt Từ 960 Xuống 128, Không Còn Model Cố Định Về Trí Tuệ?

marsbit07/15 03:32

Nhà máy Token AI bùng nổ, thầy trò Đại học Thanh Hoa gọi vốn 10 tỷ trong nửa năm

AI đang tạo ra một nhu cầu khổng lồ về "Token" - đơn vị cơ bản của xử lý ngôn ngữ. Công ty khởi nghiệp Tendence AI, được thành lập bởi đội ngũ giảng viên và sinh viên Đại học Thanh Hoa, đã chọn con đường riêng: tập trung vào hạ tầng suy luận AI (AI inference) thay vì đào tạo mô hình lớn, với sứ mệnh xây dựng "nhà máy Token AI chất lượng cao". Trong vòng nửa năm, Tendence AI đã huy động thành công hơn 10 tỷ nhân dân tệ từ các nhà đầu tư như Quỹ Hà Nam Investment Group Huirong, Chân Tri Capital, và các cổ đông hiện tại tiếp tục tăng vốn mạnh mẽ. Công ty phát triển nền tảng ATaaS dựa trên công nghệ độc quyền như "hệ thống dị thể phối hợp toàn phần", "tính toán dựa trên bộ nhớ" và "cấu trúc ảo-thực đồng nhất", nhằm tối ưu hóa toàn bộ quy trình sản xuất Token, nâng cao hiệu suất hàng loạt. Chiến lược "ít mô hình, tối ưu sâu" giúp công ty tập trung nguồn lực vào một số mô hình lớn then chốt và kịch bản giá trị cao. Kết quả là, từ Tết Nguyên đán 2026, hiệu suất sản xuất Token trên mỗi đơn vị tính toán trung bình đã tăng hơn 3 lần, và tổng sản lượng Token chất lượng cao tăng hơn 30 lần. Doanh thu chỉ trong tháng 6/2026 đã vượt tổng doanh thu cả năm 2025. Với hai mô hình kinh doanh chính: vận hành trực tiếp và đồng vận hành, Tendence AI không chỉ tự sản xuất Token mà còn giúp các đối tác (như trung tâm trí tuệ nhân tạo, doanh nghiệp nhà nước) chuyển đổi từ cho thuê sức mạnh tính toán sang bán Token AI chất lượng cao. Khi Token trở thành "điện, nước, than" của kỷ nguyên AI, Tendence AI đang định vị mình là một mắt xích quan trọng trong hệ sinh thái, kết nối các đối tác mô hình, phần cứng và ứng dụng, thúc đẩy ngành công nghiệp AI phát triển bền vững.

marsbit07/13 03:45

Nhà máy Token AI bùng nổ, thầy trò Đại học Thanh Hoa gọi vốn 10 tỷ trong nửa năm

marsbit07/13 03:45

DeepSeek bí mật tự sản xuất chip, chuyên tấn công vào lĩnh vực suy luận, đã khởi động từ một năm trước, quá trình tuyển dụng hoàn toàn không công khai

DeepSeek, công ty AI Trung Quốc nổi tiếng với các mô hình thuật toán, đang bí mật phát triển chip AI tự thiết kế của riêng mình, với mục tiêu giảm sự phụ thuộc vào Nvidia. Theo nguồn tin từ Reuters, dự án tập trung vào chip chuyên cho suy luận (inference) hơn là đào tạo (training) và đã được khởi động từ khoảng một năm trước. Dự án hiện vẫn trong giai đoạn đầu. DeepSeek được cho là đã tiếp xúc với các công ty thiết kế chip, nhà máy sản xuất bán dẫn và nhà cung cấp bộ nhớ. Công ty đã tuyển dụng kỹ sư thiết kế chip một cách kín đáo, không đăng thông tin trên các nền tảng tuyển dụng công khai. Xu hướng này không đơn lẻ khi các hãng AI lớn như OpenAI và Anthropic cũng đang theo đuổi chip tự thiết kế. DeepSeek, vốn đã tối ưu hóa thuật toán để hiệu quả hơn trên phần cứng hiện có (như chip Nvidia H800 hay Huawei Ascend), nay muốn kiểm soát hoàn toàn nền tảng phần cứng. Chip chuyên dụng cho suy luận có thể mang lại hiệu quả chi phí và năng lượng cao hơn, yếu tố quan trọng cho việc mở rộng thương mại hóa. Kế hoạch được hậu thuẫn bởi khoản tài trợ 74 tỷ USD (khoảng 510 tỷ nhân dân tệ) mà DeepSeek huy động được vào tháng 6/2026. Số tiền này sẽ dùng cho việc xây dựng trung tâm dữ liệu dùng chip nội địa, tự nghiên cứu chip AI và mở rộng đội ngũ nhân tài. Công ty cũng đang tuyển dụng kỹ sư thiết kế trung tâm dữ liệu, với các địa điểm được đề cập như Ulanqab, Nội Mông. Mặc dù vậy, thách thức vẫn rất lớn vì việc phát triển một con chip AI cạnh tranh đòi hỏi nhiều năm và nguồn vốn khổng lồ, với kết quả không được đảm bảo. DeepSeek vẫn giữ thái độ im lặng trước thông tin này.

marsbit07/08 02:05

DeepSeek bí mật tự sản xuất chip, chuyên tấn công vào lĩnh vực suy luận, đã khởi động từ một năm trước, quá trình tuyển dụng hoàn toàn không công khai

marsbit07/08 02:05

1 Megawatt nuôi sống 60.000 tác nhân thông minh, NVIDIA GB300 áp đảo thế hệ trước gấp 20 lần

Cùng một megawatt điện, hệ thống GB300 NVL72 mới nhất của Nvidia có thể xử lý đồng thời 61.400 tác nhân AI (agent), trong khi thế hệ trước H200 chỉ xử lý được khoảng 2.600. Khoảng cách hiệu suất lên tới 20 lần. Sự khác biệt này được đo bằng thước đo mới: AA-AgentPerf, tiêu chuẩn đo lường đầu tiên được thiết kế riêng cho tác nhân AI. Thay vì đo tokens mỗi giây, nó đo "số lượng tác nhân đồng thời trên mỗi megawatt", phản ánh khả năng hệ thống "nuôi" bao nhiêu agent làm việc thực tế cùng lúc với một mức điện năng cố định. Lý do là các bài kiểm tra cũ, tập trung vào các yêu cầu đơn lẻ có độ dài cố định, không thể đo lường chính xác khối lượng công việc phức tạp của agent. Một agent hoạt động giống như một cuộc chạy tiếp sức, chia nhỏ mục tiêu thành hàng chục hoặc hàng trăm bước, với các lần gọi mô hình lớn, gọi công cụ và ngữ cảnh ngày càng mở rộng được xâu chuỗi với nhau. AA-AgentPerf sử dụng các bản ghi agent lập trình thực tế, với các phiên dài tới 200 lượt và ngữ cảnh lên đến hơn 100.000 token. Nó đặt ra các mục tiêu cấp độ dịch vụ (SLO) về tốc độ phản hồi, sau đó đo xem hệ thống có thể duy trì bao nhiêu agent đồng thời trong khi vẫn đáp ứng SLO. Nó cũng cho phép tất cả các tối ưu hóa thực tế được sử dụng trong sản xuất. Kết quả cho thấy, đối với một mô hình MoE tiên tiến, GB300 NVL72 đạt 61.400 agent/MW (57,5 agent/GPU), trong khi H200 đạt khoảng 2.600 agent/MW (1,4 agent/GPU). Sự nhảy vọt này không chỉ đến từ sức mạnh chip đơn lẻ mà còn là chiến thắng ở cấp độ hệ thống. GB300 NVL72 kết nối 72 GPU thành một khối thống nhất qua NVLink, cho phép phân phối mô hình hiệu quả và chia sẻ dữ liệu nhanh chóng. Cần lưu ý rằng con số 61.400 là từ mô phỏng trong điều kiện kiểm tra chuẩn, sử dụng các bản ghi đã được ghi lại, không phải là 61.400 mô hình đầy đủ chạy độc lập trong môi trường thực tế. AA-AgentPerf vẫn là một tiêu chuẩn mới và hiệu suất có thể tiếp tục được cải thiện thông qua tối ưu hóa phần mềm.

marsbit07/06 01:05

1 Megawatt nuôi sống 60.000 tác nhân thông minh, NVIDIA GB300 áp đảo thế hệ trước gấp 20 lần

marsbit07/06 01:05

OpenAI và Anthropic Đều Muốn "Tự Nghiên Cứu Chip", Ngoài Chi Phí Ra, Quan Trọng Hơn Là Quyền Kiểm Soát Năng Lực Tính Toán

Theo The Information, Anthropic đang đàm phán với Samsung về việc thiết kế chip AI tùy chỉnh và đã khởi động công việc phát triển chip tự thiết kế. Động thái này được xem là việc Anthropic đi theo xu hướng của OpenAI, vốn đã triển khai dự án chip tùy chỉnh từ sớm hơn, hướng tới cạnh tranh tích hợp phần cứng và phần mềm. Nhu cầu điện toán cho việc huấn luyện và vận hành mô hình lớn rất cao, khiến chi phí duy trì ở mức cao. Đối với các công ty như OpenAI và Anthropic, chip không chỉ là vật tư mua ngoài mà còn là tư liệu sản xuất cốt lõi. Do đó, tự thiết kế chip trước hết là vấn đề giành quyền kiểm soát năng lực tính toán, tạo ra lựa chọn công nghệ dự phòng và tăng sức mạnh đàm phán. Lý do trực tiếp nhất là giảm chi phí, nhưng mục tiêu then chốt hơn là sự phối hợp đa tầng giữa mô hình, lõi phần mềm và chip, nhằm cải thiện hiệu suất tổng thể. Cấu trúc mô hình của OpenAI và Anthropic khác biệt, dẫn đến yêu cầu phần cứng khác nhau, khiến chip tùy chỉnh trở nên cần thiết. Tuy nhiên, việc tự thiết kế chip khó có thể thay thế ngay lập tức vai trò của nhà cung cấp như Nvidia, do quá trình từ thiết kế đến triển khai mất 18-24 tháng và hệ sinh thái phần mềm hiện tại phần lớn được tối ưu cho GPU. Chiến lược này thiết lập một con đường thứ hai, sử dụng ASIC tự thiết kế cho các tác vụ cụ thể như suy luận, trong khi vẫn duy trì sử dụng các nguồn lực tính toán bên ngoài. Xu hướng này cho thấy cuộc cạnh tranh AI đang mở rộng từ "mô hình nào mạnh hơn" sang "ai kiểm soát tốt hơn năng lực tính toán, vốn và ngăn xếp phần cứng". Các gã khổng lồ công nghệ như Google, Amazon, Meta, Microsoft đều đã bố trí sâu trong lĩnh vực chip tự thiết kế.

marsbit07/03 13:40

OpenAI và Anthropic Đều Muốn "Tự Nghiên Cứu Chip", Ngoài Chi Phí Ra, Quan Trọng Hơn Là Quyền Kiểm Soát Năng Lực Tính Toán

marsbit07/03 13:40

活动图片