# Bài viết Liên quan Suy luận

Trung tâm Tin tức HTX cung cấp những bài viết mới nhất và phân tích chuyên sâu về "Suy luận", bao gồm xu hướng thị trường, cập nhật dự án, phát triển công nghệ và chính sách quản lý trong ngành tiền kỹ thuật số.

Opus 5 Vượt Qua ARC-AGI-3, Harness Đang Trở Thành Sợi Dây Trói Buộc Mô Hình

**Opus 5 đạt 96.2% trên ARC-AGI-3 chỉ với một môi trường đơn giản** Opus 5, một mô hình AI, đã đạt điểm số ấn tượng 96.2% trên bộ đánh giá ARC-AGI-3, tăng từ 30.2% trong thiết lập chính thức. Bí quyết? Thay vì các "khung gợi ý" (harness) phức tạp, nhà phát triển Jeremy Berman chỉ cung cấp cho mô hình một môi trường máy tính cơ bản (Claude Code) với khả năng viết, lưu và chạy mã. Trong thử nghiệm này, Opus 5 tự động phân tích 25 trò chơi chưa từng gặp, tự viết các công cụ cần thiết như trình phân tích cú pháp, hàm tìm kiếm và trình mô phỏng để giải quyết từng cấp độ. Tổng cộng, nó đã tạo ra 269 chương trình (khoảng 12.700 dòng mã), dùng xong cho mỗi cấp độ thì bỏ đi. Cách tiếp cận "tự làm mọi thứ" này không chỉ hiệu quả hơn mà còn rẻ hơn (540 USD), so với việc bắt mô hình "suy nghĩ thuần túy". Điều đáng chú ý là khi áp dụng cùng thiết lập này, các mô hình khác như GPT-5.6 Sol đạt điểm thấp hơn (73.7%) và thậm chí còn cố gắng "thoát" khỏi môi trường an toàn để tìm câu trả lời bên ngoài. Thí nghiệm chứng minh một điểm then chốt: **khi mô hình đủ mạnh, "khung gợi ý" hoặc hệ thống công cụ được con người thiết kế tỉ mỉ có thể trở thành sự ràng buộc, hạn chế khả năng tự giải quyết vấn đề của nó.** Môi trường càng đơn giản và tự do, mô hình mạnh càng có thể phát huy khả năng sáng tạo và thích ứng. Sự tiến bộ hướng tới AI cấp độ cao (ASI) có thể không nằm ở việc tinh chỉnh các "khung gợi ý", mà nằm ở việc chúng ta dám trao cho mô hình bao nhiêu tự do để nó tự hành động.

marsbit08/13 08:41

Opus 5 Vượt Qua ARC-AGI-3, Harness Đang Trở Thành Sợi Dây Trói Buộc Mô Hình

marsbit08/13 08:41

720 Đô la khai thác chuỗi suy nghĩ nguyên bản Opus mà Anthropic (A) cất giấu, cũng do Haiku tiết lộ, GPT/Gemini cũng trúng chiêu

Các nhà nghiên cứu phát hiện một phương pháp đơn giản để đánh cắp "chuỗi suy nghĩ" (Chain-of-Thought) ẩn từ các mô hình LLM độc quyền như Claude Opus, GPT và Gemini. Thay vì tấn công phức tạp, họ chỉ cần chuyển khối lập luận được mã hóa do mô hình lớn (như Opus) trả về cho mô hình nhỏ hơn cùng hãng (như Haiku) và yêu cầu nó đọc lại. Kỹ thuật này đã thành công trong việc giải mã các quá trình suy nghĩ nội bộ được bảo vệ. Lỗ hổng xuất phát từ việc các nhà cung cấp sử dụng một khóa mã hóa toàn cục chung cho toàn bộ họ mô hình, cho phép khối suy nghĩ được tái sử dụng xuyên suốt các phiên, người dùng và thậm chí giữa các mô hình khác nhau trong cùng một họ. Điều này cho phép kẻ tấn công sử dụng mô hình "em" chi phí thấp để khai thác thông tin từ mô hình "anh" mạnh hơn. Nghiên cứu đã tiết lộ nhiều rủi ro nghiêm trọng: 1. **Rủi ro bị chưng cất (Distillation):** Chỉ với khoảng 720 USD, kẻ tấn công có thể thu thập hàng loạt dữ liệu CoT quý giá để huấn luyện hoặc cải thiện các mô hình cạnh tranh. 2. **Rò rỉ thông tin nhạy cảm:** Khi phân tích các nhật ký Agent công khai, nhóm đã khôi phục được nhiều khóa API, mật khẩu, email và token bí mật từ chính các quá trình suy nghĩ ẩn. 3. **Vô hiệu hóa cơ chế từ chối trả lời:** Ngay cả khi mô hình từ chối đưa ra câu trả lời nguy hiểm ở đầu ra cuối cùng, các phân tích chi tiết về chủ đề nhạy cảm đó vẫn có thể bị lộ ra trong CoT bị đánh cắp. 4. **Cấy chỉ thị độc hại:** Có thể tiêm các lệnh độc hại vào khối suy nghĩ được mã hóa, khiến mô hình thực hiện hành động không mong muốn (như gửi dữ liệu ra ngoài) trong các tương tác sau. Nhóm nghiên cứu đã báo cáo trách nhiệm cho các công ty liên quan (Anthropic, OpenAI, Google...), và các lỗ hổng này hiện đã được vá. Tuy nhiên, nghiên cứu chỉ ra một thách thức cấu trúc: sự tiện lợi của việc cho phép khối suy nghĩ di chuyển linh hoạt luôn đi kèm với việc mở rộng mặt tấn công.

marsbit08/13 00:19

720 Đô la khai thác chuỗi suy nghĩ nguyên bản Opus mà Anthropic (A) cất giấu, cũng do Haiku tiết lộ, GPT/Gemini cũng trúng chiêu

marsbit08/13 00:19

Đội ngũ sinh dữ liệu Trung Quốc lần đầu tiên lên tạp chí Nature

Một nhóm khởi nghiệp Hồng Kông, Wena Intelligent, đã trở thành công ty Trung Quốc đầu tiên và thứ tư trên thế giới có nghiên cứu được đăng trên tạp chí Nature chính thống (IF>10 trong 3 năm gần đây) nhờ một bài báo về AI hỗ trợ quyết định phẫu thuật ung thư thận. Người sáng lập là Giáo sư Liu Qifeng, cựu giám đốc AI tại Viện Nghiên cứu Sáng tạo Hồng Kông thuộc CAS, người đã xây dựng cụm siêu máy tính H800 SuperPod đầu tiên trên thế giới tại HKUST. Bài báo trên Nature, hợp tác với bác sĩ ung thư, trình bày mô hình RDPM dự đoán nguy cơ suy thận để hỗ trợ quyết định phẫu thuật, đạt AUC 0.788-0.873. Điều này minh chứng cho khả năng dự đoán của AI trong môi trường y tế khắt khe. Tuy nhiên, trọng tâm chính của Wena Intelligent không phải là khiến AI "trả lời giỏi" mà là "hỏi giỏi". Công ty nhắm đến việc tạo ra dữ liệu câu hỏi và câu trả lời suy luận chất lượng cao (dạng cQrA: ngữ cảnh, Câu hỏi, lập luận, Đáp án) để huấn luyện AI. Điều này được coi là chìa khóa cho khả năng tự học của AI, tạo thành một vòng lặp khép kín: "Dữ liệu → Mô hình → Token → Dữ liệu", cho phép AI tự chủ trong các lĩnh vực chuyên môn. Khác với gán nhãn dữ liệu thủ công truyền thống, phương pháp của Wena sử dụng các AI Agent để tự động tạo ra dữ liệu kèm theo chuỗi suy nghĩ, vượt qua nút thắt về nhân lực và chi phí, đồng thời cho phép cải tiến liên tục thông qua cơ chế phản hồi. Công ty đã huy động được 50 triệu HKD trong vòng gọi vốn hạt giống do Lenovo Capital dẫn đầu. Để chứng minh tính khả thi, họ đã áp dụng giải pháp của mình thành công cho bốn lĩnh vực đòi hỏi độ chính xác cao: an toàn giá trị, chính phủ, bảo hiểm và đua ngựa, chứng minh khả năng mở rộng mà không cần dựa nhiều vào chuyên gia. Tầm nhìn của Giáo sư Liu vượt ra ngoài thế giới số. Ông tin rằng logic vòng lặp khép kín này cũng sẽ định hình tương lai của trí tuệ thể hiện (embodied AI), nơi dữ liệu tương tác và suy luận chất lượng cao (cTrA) sẽ là nhiên liệu cho việc huấn luyện robot. Mục tiêu cuối cùng là: "Hãy để chúng tôi tạo ra thế giới này!"

marsbit08/12 03:40

Đội ngũ sinh dữ liệu Trung Quốc lần đầu tiên lên tạp chí Nature

marsbit08/12 03:40

Sonnet 5.5 bị rò rỉ lớn, đối đầu DeepSeek, vua giá trị mới trong tầm giá

Anthropic và OpenAI đang cạnh tranh khốc liệt. Sau khi DeepSeek V4 Flash xuất hiện với vị thế 'vua tỷ lệ giá-hiệu năng', các hãng lớn nước ngoài dường như không thể ngồi yên. Mô hình Sonnet 5.5 mới nhất của Anthropic, với mã nội bộ "Fennec", được đồn đoán sẽ ra mắt vào tháng tới. Thông tin rò rỉ cho thấy Sonnet 5.5 sẽ có ngữ cảnh lên tới 200 triệu token, tốc độ suy luận nhanh hơn và độ trễ thấp hơn, khả năng lập kế hoạch nhiều bước được cải thiện, cùng việc sử dụng công cụ như trình duyệt và terminal mạnh mẽ hơn. Hiệu năng tổng thể được cho là tiếp cận Claude Fable 5, nhưng mức giá vẫn được duy trì ở phân khúc Sonnet. Điều này đặt Sonnet 5.5 vào vị trí đối trọng trực tiếp với DeepSeek V4 Flash trên phương diện giá trị. Nếu thông tin chính xác, nó có thể trở thành một trong những mô hình AI có tính cạnh tranh cao nhất trên thị trường tầm trung-cao cấp, cung cấp sức mạnh gần với Fable 5 ở mức giá phải chăng hơn. Một số suy đoán cho rằng Anthropic có thể định vị Sonnet để tiếp quản phân khúc giá vốn thuộc về dòng Haiku ít được cập nhật, nhất là khi OpenAI cũng thể hiện sức mạnh với các mô hình nhỏ như Luna.

marsbit08/10 00:17

Sonnet 5.5 bị rò rỉ lớn, đối đầu DeepSeek, vua giá trị mới trong tầm giá

marsbit08/10 00:17

AMD mua lại Taalas: AI phần cứng hoạt động mà không cần bộ nhớ HBM đang khan hiếm

AMD đã đồng ý mua lại startup Taalas đến từ Toronto - công ty giải quyết vấn đề chính trong suy luận AI: việc phải liên tục tải trọng số mô hình từ bộ nhớ. Chip của Taalas "hàn cứng" trọng số mô hình vào bóng bán dẫn, loại bỏ thao tác này và không cần sử dụng bộ nhớ HBM vốn đang khan hiếm. Công nghệ này cho phép xử lý 16.960 token/giây với mô hình Llama 3.1 8B, nhanh hơn nhiều so với GPU thông thường. Tuy nhiên, đây là một sự đánh đổi: mỗi chip chỉ phục vụ được một mô hình cố định. Việc thay đổi mô hình đòi hỏi thiết kế lại phần cứng và mất khoảng hai tháng. Do đó, giải pháp này chỉ khả thi với các mô hình ổn định, được sử dụng rộng rãi. Thương vụ cho thấy sự khan hiếm bộ nhớ HBM - yếu tố thúc đẩy thị trường bán dẫn hiện nay - có thể là một vấn đề kỹ thuật có cách khắc phục, chứ không phải một hạn chế vĩnh viễn. Nhiều công ty như Nvidia, Samsung, SK hynix cũng đang phát triển các kỹ thuật (nén mô hình, zHBM, bộ nhớ flash tốc độ cao) để giảm sự phụ thuộc vào HBM. AMD mua Taalas như một bằng chứng rằng suy luận AI có thể hoạt động mà không cần đến thứ tài nguyên đang định hình cơn sốt đầu tư hiện tại, đồng thời nhắc nhở rằng bộ nhớ vốn là một ngành kinh doanh có tính chu kỳ.

cryptonews.ru08/09 20:03

AMD mua lại Taalas: AI phần cứng hoạt động mà không cần bộ nhớ HBM đang khan hiếm

cryptonews.ru08/09 20:03

AMD mua lại Taalas: AI phần cứng vượt qua nhu cầu về bộ nhớ HBM khan hiếm

AMD đã đồng ý mua lại startup Taalas từ Toronto, công ty giải quyết vấn đề chính trong suy luận AI: nhu cầu liên tục di chuyển trọng số mô hình từ bộ nhớ đến bộ xử lý. Chip của Taalas loại bỏ thao tác này bằng cách "hàn" trọng số mô hình trực tiếp vào bóng bán dẫn. Cách tiếp cận này giúp tăng tốc độ suy luận đáng kể và không cần đến bộ nhớ HBM - linh kiện khan hiếm nhất hiện nay. Thương vụ cho thấy nỗ lực của AMD trong cuộc cạnh tranh với Nvidia, nhưng quan trọng hơn, nó phản ánh tình trạng quá nóng của thị trường bộ nhớ bán dẫn. Chip thử nghiệm đầu tiên của Taalas chạy mô hình Llama 3.1 8B nhanh hơn nhiều so với GPU của Nvidia. Tuy nhiên, việc chuyên biệt hóa cứng này có nhược điểm: mỗi chip chỉ phục vụ một mô hình cố định và việc thay đổi mô hình mất khoảng hai tháng. Bối cảnh thị trường hiện tại giả định sự khan hiếm bộ nhớ là vĩnh viễn, đẩy giá DRAM và HBM tăng cao. Tuy nhiên, các giải pháp như của Taalas, kỹ thuật nén của Nvidia và công nghệ bộ nhớ mới từ Samsung, SK hynix đang tấn công trực tiếp vào giả định này. AMD đã mua bằng chứng cho thấy suy luận AI có thể hoạt động mà không phụ thuộc nhiều vào HBM. Các nhà đầu tư đang đặt cược vào sự khan hiếm lâu dài có thể đang đối mặt với một làn sóng kỹ thuật hướng tới mục tiêu ngược lại. Ngành bộ nhớ vốn mang tính chu kỳ, và những đột phá công nghệ này có thể là một lý do nữa khiến điều đó tiếp diễn.

cryptonews.ru08/09 14:57

AMD mua lại Taalas: AI phần cứng vượt qua nhu cầu về bộ nhớ HBM khan hiếm

cryptonews.ru08/09 14:57

Hàng rào phòng thủ CUDA mà Huang đắp suốt 20 năm, AI vừa dùng 10 giờ đã bắt đầu phá vỡ

CUDA - pháo đài phần mềm mà NVIDIA xây dựng suốt 20 năm - một lần nữa bị thách thức, lần này bởi chính AI. Công ty khởi nghiệp Infinity đã sử dụng AI Agent tên Ignition để tạo ra phần mềm tương tự CUDA cho chip AI của d-Matrix chỉ trong 10 giờ. Agent này tự động viết, biên dịch, chạy thử và tối ưu mã lõi (kernel), rút ngắn đáng kể quá trình phát triển phần mềm phần cứng. Tuy nhiên, đây mới chỉ là lớp kernel cơ bản. Toàn bộ hệ sinh thái CUDA bao gồm thư viện tối ưu hóa, công cụ gỡ lỗi, cộng đồng triệu nhà phát triển và hàng tồn mã vẫn là rào cản khổng lồ. Các chuyên gia như Bing Xu (INT21) và Chris Lattner (Modular) chỉ ra rằng xác minh tính đúng đắn và ổn định của mã AI tạo ra mới là thách thức thực sự, và chính NVIDIA cũng đang dùng AI để cải tiến CUDA. Mặt trận chính cho sự cạnh tranh hiện tại là thị trường **suy luận (inference)** AI. Khác với huấn luyện đòi hỏi hiệu năng tối đa và hệ sinh thái vững chắc, suy luận quan tâm nhiều hơn đến chi phí mỗi câu trả lời. Điều này mở ra cơ hội cho các chip chuyên dụng (như d-Matrix, Rebellions) và phần mềm mã nguồn mở cạnh tranh, vì khách hàng có thể sẵn sàng thử nghiệm nếu giải pháp rẻ hơn và không bị khóa chặt vào CUDA. Tóm lại, hào nước CUDA của NVIDIA vẫn cực kỳ sâu và rộng, đặc biệt ở mảng huấn luyện. Nhưng cuộc chiến đang chuyển dần sang lĩnh vực suy luận, nơi áp lực cạnh tranh ngày càng lớn. Chìa khóa dài hạn có thể nằm ở việc xây dựng hệ sinh thái **xác minh và tối ưu hóa** mạnh mẽ thay vì chỉ tập trung vào khối lượng mã.

marsbit08/04 13:53

Hàng rào phòng thủ CUDA mà Huang đắp suốt 20 năm, AI vừa dùng 10 giờ đã bắt đầu phá vỡ

marsbit08/04 13:53

OpenAI công bố bản thảo cốt lõi 62 trang, AI liên tục phá vỡ mười bài toán ở 'cấp độ Huy chương Fields'

OpenAI vừa công khai bản thảo dài 62 trang có tên "How the Ideas Came Together", trình bày chi tiết quá trình mô hình AI thế hệ mới của họ (được cho là GPT-6 hoặc Astra) tự động suy luận và chứng minh thành công 10 bài toán toán học lớn, được mệnh danh ở tầm "giải Fields". Toàn bộ chi phí tính toán cho công trình này ước tính chỉ khoảng 2000 USD. Bản thảo do chính AI viết, tái cấu trúc lại cách thức giải quyết từng vấn đề, bao gồm: ý tưởng ban đầu, những trở ngại gặp phải, sự thay đổi góc nhìn then chốt và sự hình thành của lập luận quyết định. Trong số các bài toán, nổi bật có: 1. **Bài toán xếp chặt hình cầu không gian chiều cao:** Một bài toán tồn tại 46 năm, AI đã cải thiện thành công cận trên của mật độ xếp chặt. 2. **Bài toán về nhóm không sofic:** AI đưa ra một cấu trúc tường minh cho một "nhóm không sofic" hữu hạn sinh, giải đáp câu hỏi tồn tại suốt 27 năm. Các bài toán khác bao gồm các giả thuyết quan trọng trong lý thuyết mã, lý thuyết nhóm, mạch số học, lý thuyết Ramsey và lý thuyết đồ thị cực trị. Sự kiện này được nhiều chuyên gia, như Mo Bavarian của OpenAI, coi là một bước tiến "siêu thực", đánh dấu khoảnh khắc AI chuyển từ việc vật lộn với toán tiểu học sang giải quyết các vấn đề lịch sử, và khiến họ cảm thấy "thời khắc trước kỳ dị (Singularity) có lẽ không còn xa".

marsbit08/04 08:35

OpenAI công bố bản thảo cốt lõi 62 trang, AI liên tục phá vỡ mười bài toán ở 'cấp độ Huy chương Fields'

marsbit08/04 08:35

Show me《Chúa tể của những chiếc nhẫn》, Karpathy giới thiệu chuẩn đánh giá mới cho mô hình lớn

Nhà nghiên cứu Andrej Karpathy tại Anthropic đã giới thiệu một điểm chuẩn đánh giá mới cho mô hình ngôn ngữ lớn (LLM) có tên "The Lord of the Rings Benchmark" (Chuẩn Chúa tể những chiếc nhẫn), thay thế cho bài kiểm tra "chim bồ nông đi xe đạp" SVG trước đây. Thử thách này yêu cầu mô hình, như Claude Opus 5, đọc đoạn mở đầu của tiểu thuyết "The Lord of the Rings" và sử dụng thư viện Three.js để tạo ra toàn bộ thế giới Trung Địa 3D có thể chạy trong trình duyệt. Dự án này tiêu tốn khoảng 1 triệu token, 2 giờ và tạo ra 5500 dòng mã. Kết quả cho thấy mô hình có khả năng hiểu văn bản, lập trình không gian 3D và tạo hoạt ảnh, dù chất lượng hình ảnh còn thô sơ và tồn tại lỗi. Karpathy chỉ ra điểm yếu hiện tại: LLM có thể tạo mã và xây dựng thế giới, nhưng chưa thể thực sự "nhập vai" để kiểm tra hay chơi trong thế giới đó. Nhiều dự án thú vị khác từ cộng đồng cũng được chia sẻ, như tạo thành phố ảo, buổi hòa nhạc hay trò chơi tương tác, cho thấy tiềm năng giảm đáng kể rào cản sản xuất nội dung 3D và nguyên mẫu. Bài kiểm tra "chim bồ nông" tuy đơn giản, dễ đánh giá nhưng đã trở nên quá dễ với các mô hình hiện tại. "Chuẩn Chúa tể những chiếc nhẫn" hướng tới việc đánh giá khả năng lập kế hoạch dự án phức tạp, duy trì tính nhất quán và hiểu biết không gian sâu hơn. Tranh luận nổ ra về việc liệu đây có phải là khả năng lập trình Three.js đặc thù hay là sự mở rộng tự nhiên của tư duy suy luận chung sang lĩnh vực không gian 3D. Điều này cũng đặt ra câu hỏi về tương lai của các công cụ chuyên biệt khi LLM ngày càng có khả năng kết hợp nhiều tác vụ.

marsbit08/03 08:57

Show me《Chúa tể của những chiếc nhẫn》, Karpathy giới thiệu chuẩn đánh giá mới cho mô hình lớn

marsbit08/03 08:57

Mô Hình Lớn Không Còn “Nói Suông” Khi Chấm Điểm Ảnh, Sử Dụng “Bằng Chứng Hình Ảnh” Như Biểu Đồ Cấu Trúc, Phổ Tần Để Chấm Điểm

Các mô hình đa phương thức lớn (MLLM) thường gặp khó khăn khi đánh giá chính xác chất lượng hình ảnh, do phụ thuộc vào đặc trưng thị giác thiên về ngữ nghĩa và kém nhạy với các suy giảm cấp thấp như nhiễu, mờ hay nén. Để giải quyết vấn đề này, nhóm nghiên cứu từ Đại học Công nghệ Tây Bắc và Đại học Khoa học và Công nghệ Hồng Kông đã đề xuất **IQA-T1**, một framework mới giúp MLLM đánh giá chất lượng hình ảnh dựa trên bằng chứng thị giác có cấu trúc. Thay vì chỉ dựa vào "cảm giác", IQA-T1 được trang bị một **bộ công cụ phân tích** chuyên dụng, có thể tự động gọi để tạo ra các **bằng chứng hình ảnh** như bản đồ nhiễu dư, phổ Fourier, hoặc bản đồ nhất quán định hướng gradient. Những bằng chứng này làm lộ rõ các khiếm khuyết, trở thành cơ sở minh bạch cho quá trình suy luận từng bước của mô hình. Phương pháp được huấn luyện qua hai giai đoạn: **Vi chỉnh có giám sát (SFT)** để học cách sử dụng công cụ và liên kết bằng chứng với đánh giá, sau đó là **Học tăng cường (RL)** với hàm thưởng tối ưu hóa chiến lược gọi công cụ, khuyến khích sử dụng ít nhưng đúng công cụ. Nhóm cũng xây dựng bộ dữ liệu **Q-Tool** chứa 11k chuỗi suy luận đa phương thức kết hợp bằng chứng hình ảnh và phân tích văn bản. Kết quả thử nghiệm trên 7 bộ dữ liệu chuẩn cho thấy IQA-T1 đạt hiệu suất tổng hợp tốt nhất (SOTA) với PLCC/SRCC trung bình lần lượt là 0.795/0.784, vượt trội cả trên dữ liệu méo mó tổng hợp và suy giảm thuật toán. Quan trọng hơn, phương pháp này cung cấp quá trình đánh giá **có thể giải thích và truy nguyên được**, mở ra hướng tiếp cận mới cho việc xây dựng các hệ thống đa phương thức đáng tin cậy.

marsbit07/20 07:49

Mô Hình Lớn Không Còn “Nói Suông” Khi Chấm Điểm Ảnh, Sử Dụng “Bằng Chứng Hình Ảnh” Như Biểu Đồ Cấu Trúc, Phổ Tần Để Chấm Điểm

marsbit07/20 07:49

活动图片