Ngay lập tức! Mô hình đầu tiên của Ilya vừa được tiết lộ

marsbitXuất bản vào 2026-08-13Cập nhật gần nhất vào 2026-08-13

Tóm tắt

Bài viết tiêu đề "Vừa rồi! Mô hình đầu tiên của Ilya lộ diện" thảo luận về tin đồn rằng Ilya Sutskever, cựu nhà khoa học trưởng của OpenAI và đồng sáng lập SSI, có thể sắp công bố mô hình AI đầu tiên sau hai năm im hơi lặng tiếng. Thông tin được một người dùng X có tên "三只草莓" (Ba quả dâu) tiết lộ, cho biết SSI đang phát triển một "công cụ suy luận nhỏ" dựa trên TTT (Test-Time Training - Huấn luyện tại thời điểm kiểm tra). Mô hình này được mô tả là học cách "học như thế nào" từ dữ liệu chuyên biệt, sau đó cập nhật một phần trọng số trong quá trình giải quyết vấn đề, cho phép nó cạnh tranh với các mô hình được huấn luyện quy mô lớn hơn. Nguồn tin còn cho biết phiên bản hiện tại đã sẵn sàng và nhóm đang mở rộng quy mô lên gấp 10 lần cho thế hệ tiếp theo, với khả năng một phiên bản sớm có thể ra mắt vào tháng 8 này. Bài viết liên kết tin đồn này với ba manh mối công khai: 1. Quan điểm của Ilya trong một podcast tháng 11/2023 về việc một siêu trí tuệ thực sự cần có khả năng học liên tục sau khi triển khai, giống như một thiếu niên 15 tuổi thông minh. 2. Thông báo hợp tác chiến lược và đầu tư lớn từ NVIDIA vào SSI vào tháng 7/2024, trong đó NVIDIA đề cập đến một hướng nghiên cứu bí mật mà họ đã xem xét. 3. Sự tiến bộ của nghiên cứu TTT trong hai năm qua, như được minh họa trong một bài báo có tên "End-to-End Test-Time Training for Long Context". TTT cho phép mô hình tự điều chỉnh khi đối mặt với dữ liệu mới trong quá trình suy luận, khác biệt với các phương pháp chỉ mở rộng ng...

Cựu nhà khoa học trưởng của OpenAI, Ilya, có lẽ là đại diện điển hình cho câu nói: "Người anh hùng đã rời khỏi giang hồ, nhưng huyền thoại về họ vẫn lan truyền khắp nơi."

Người đã góp phần tạo nên kỷ nguyên học sâu, rời khỏi OpenAI đã hơn hai năm. SSI, công ty do anh sáng lập, không phát hành mô hình, không tạo sản phẩm, gần như biến mất khỏi ván bài.

Nhưng cứ sau một thời gian, cộng đồng AI lại có người đặt ra cùng một câu hỏi: Ilya đang làm gì?

Bây giờ, câu hỏi này đột nhiên có một câu trả lời.

Ngay lúc này, người dùng X "三只草莓" (Tam Chỉ Thảo Môi) đã tiết lộ, SSI đang nghiên cứu một bộ máy suy luận quy mô nhỏ dựa trên TTT (Test-Time Training, Huấn luyện tại thời điểm kiểm tra).

Theo mô tả, mô hình này sẽ học "cách học" từ dữ liệu được tổng hợp đặc biệt, sau đó cập nhật một phần trọng số trong quá trình giải quyết vấn đề.

Ngay cả khi quy mô mô hình không lớn, nó cũng đủ sức cạnh tranh với các mô hình được huấn luyện trên quy mô lớn hơn.

Hơn nữa, anh ta còn cho biết trong phần bình luận, phiên bản hiện tại của SSI đã sẵn sàng, đội ngũ đang mở rộng quy mô phiên bản tiếp theo lên trực tiếp 10 lần.

Điều quan trọng hơn nữa, đây có thể không phải là một tấm "vé" hứa hẹn tương lai.

Theo lời anh ta, phiên bản hiện tại có thể ra mắt sớm nhất vào tháng 8 này, và ban đầu sẽ được mở cho một số ít người dùng.

Tức là, nếu tin đồn là đúng sự thật. Thanh kiếm đầu tiên mà SSI giấu kín suốt hai năm, rất có thể sắp rút ra khỏi vỏ.

Sau khi tin tức lan truyền, nhiều cư dân mạng đã ngửi thấy hướng gió thay đổi.

Có người thốt lên, đây mới bắt đầu giống trí tuệ thực sự;

Cũng có người đánh giá, chỉ cần lộ trình này có thể mở rộng quy mô thuận lợi, các công ty khác sẽ khó lòng theo kịp SSI.

Nhưng ngay khi mọi người đã chuẩn bị chào đón "Ilya trở lại đỉnh cao", lại có tin đồn rằng:

Tháng này có thể lại không phát hành.

Thật thật giả giả, giả giả thật thật~

Lần này, thanh kiếm của Ilya rốt cuộc có rút ra khỏi vỏ hay không?

Một thanh kiếm có thể tự đổi chiêu khi xuất chiêu

Thành thật mà nói, kể từ khi Ilya rời OpenAI tự lập nghiệp, những tin đồn xoay quanh SSI đã nhiều như mây bay.

Có người nghi ngờ đóng góp thực sự của Ilya trong lịch sử học sâu, cha đẻ thực sự của GPT thực ra là Alec Radford;

Cũng có người nói anh ta giống Lương Văn Phong, quay đầu nghiên cứu lượng tử hóa.

Nhưng lần tiết lộ này có thể nhanh chóng gây chấn động, không chỉ vì ba chữ "Ilya" tự mang theo sức hút.

Mà còn vì nó thực sự chạm vào một số manh mối đã được công bố, tổng hợp lại có ít nhất ba manh mối:

Manh mối thứ nhất, tiếp tục học sau khi triển khai, trùng khớp cao với quan điểm mà Ilya đã thể hiện trong podcast của Dwarkesh Patel vào tháng 11 năm ngoái.

Lúc đó Ilya cho biết: Hai từ "AGI" và "tiền huấn luyện" đã đưa ngành đi chệch hướng.

Bởi vì con người không sinh ra đã nắm vững trí tuệ phổ quát cho mọi công việc, con người thực sự dựa vào việc học liên tục.

Siêu trí tuệ trong hình dung của ông, giống một thiếu niên 15 tuổi cực kỳ thông minh, ham học hỏi.

Nó biết không nhiều, nhưng có thể học lập trình, y học và các công việc khác sau khi được triển khai, tiếp tục trưởng thành qua từng lần thử sai.

Theo Ilya, SSI không muốn tạo ra một cỗ máy biết tất cả ngay từ lúc xuất xưởng (sau khi tiền huấn luyện kết thúc), mà là một tâm trí có thể học bất kỳ công việc nào.

Mục tiêu này mang màu sắc học siêu việt rõ ràng: mô hình cần nắm vững không chỉ một kỹ năng cụ thể, mà còn cả phương pháp học kỹ năng mới.

Ilya lúc đó dù không nhắc đến TTT, nhưng cả hai đều hướng đến cùng một vấn đề:

Mô hình có thể tiếp tục thay đổi chính mình sau khi triển khai không?

Manh mối thứ hai đến từ NVIDIA.

Vào ngày 27 tháng 7 năm nay, NVIDIA và SSI thông báo hợp tác chiến lược dài hạn, đồng thời đầu tư vào SSI, và cung cấp cho họ hệ thống Vera Rubin thế hệ tiếp theo.

Khả năng tính toán của SSI sẽ tăng lên một bậc, tức khoảng 10 lần, và theo Reuters tiết lộ, số tiền đầu tư lên tới 50 tỷ USD.

Quan trọng hơn, tiền và GPU không phải là phần quan trọng nhất.

Trong thông báo, NVIDIA đặc biệt viết, trong hai năm qua, SSI luôn lặng lẽ thúc đẩy một lộ trình nghiên cứu mới.

NVIDIA hiếm hoi tiếp cận được nghiên cứu được bảo mật chặt chẽ này, quyết định thúc đẩy nó bước vào giai đoạn tiếp theo.

Nói cách khác, ông Huang đã xem qua bài. Còn bài đó là gì, ông không nói.

Tuyên bố của chính Ilya cũng đáng suy ngẫm: Đã đến lúc mở rộng SSI!

Vậy thì... việc mở rộng quy mô này, rất là linh hoạt.

Ilya, đôi mắt anh đã nhìn thấy gì?

Manh mối thứ ba, là sự tiến triển của chính TTT trong hai năm qua.

Gần đây, ngày càng nhiều nhà nghiên cứu bắt đầu thử vượt qua lộ trình "mở rộng ngữ cảnh liên tục", tìm kiếm một mô hình gần hơn với việc học liên tục.

Lý do cũng rất đơn giản. Bởi vì con người không học bằng cách viết tài liệu tham khảo ngày càng dài, càng không giống như nam chính trong "Memento", xăm lên người mọi việc gặp phải.

Sau khi trải qua một sự việc, bộ não sẽ điều chỉnh các kết nối bên trong. Lần sau gặp vấn đề tương tự, con người đã không còn là chính mình của lần trước, đây mới là điểm thú vị thực sự của lộ trình TTT.

Nói một cách đơn giản, TTT (Test-Time Training) là huấn luyện tại thời điểm kiểm tra, nó khiến mô hình không còn tách biệt hoàn toàn "huấn luyện" và "suy luận", mà trong quá trình thực sự giải quyết vấn đề, lấy dữ liệu trước mắt tiếp tục huấn luyện chính mình, sau đó điều chỉnh trạng thái bên trong dựa trên sai số giữa kết quả dự đoán và mục tiêu, thậm chí trực tiếp cập nhật một phần tham số.

Trong tin đồn, "三只草莓" còn đặc biệt nhắc đến một bài báo liên quan——

End-to-End Test-Time Training for Long Context.

Nói một cách đơn giản, bài báo này diễn giải lại vấn đề ngữ cảnh dài thành một vấn đề học liên tục.

Mô hình ngữ cảnh dài truyền thống sẽ lưu phần trước trong cửa sổ ngữ cảnh, mỗi khi sinh nội dung mới, lại quay lại tìm thông tin cần thiết.

TTT-E2E được đề xuất trong bài báo lại coi toàn bộ đoạn ngữ cảnh là dữ liệu huấn luyện, để mô hình tiếp tục dự đoán Token tiếp theo trong quá trình đọc, và nén thông tin đọc được vào trọng số của chính mình.

Nhờ đó, ngữ cảnh không còn chỉ là một tài liệu tham khảo có thể lật xem bất cứ lúc nào, mà bắt đầu trở thành tài liệu học thực sự thay đổi chính bản thân mô hình.

Và đáng nói bổ sung thêm, TTT có sự khác biệt cơ bản với Agent Harness, Context Engineering vừa nổi lên gần đây.

Hai cái sau dựa vào ngữ cảnh bên ngoài để xây dựng giàn giáo, để mô hình nhìn thấy nhiều thông tin hơn, gọi nhiều công cụ hơn, nhưng bản thân mô hình không thay đổi.

TTT tiến thêm một bước, nó không chỉ để mô hình nhìn thấy nhiều hơn, gọi nhiều hơn, mà còn để mô hình trực tiếp thay đổi chính mình trong quá trình giải quyết vấn đề.

Vậy lại quay về câu hỏi.

Vì TTT không phải là thứ mới, và lại tuyệt vời như vậy, tại sao không sớm được sử dụng? Lý do cũng không khó đoán:

Bởi vì một khi mô hình có thể tự sửa đổi sau khi triển khai, nó có thể học sai, học lệch, thậm chí quên mất khả năng vốn có.

Năm 2016, chatbot Tay của Microsoft lên mạng chưa đầy 24 giờ, đã bắt đầu xuất nội dung công kích dưới sự dụ dỗ của cư dân mạng, cuối cùng bị gỡ xuống khẩn cấp.

Tay và TTT không phải cùng một loại công nghệ, nhưng đã sớm lộ ra một khó khăn giống nhau:

An toàn.

Vì vậy, đương nhiên có cư dân mạng đã đặt câu hỏi này, và sau đó Tam Chỉ Thảo Môi cho biết Ilya đã giải quyết.

Tất nhiên, câu nói này còn lâu mới được coi là bằng chứng, thậm chí giống một lời đồn nhẹ nhàng trên giang hồ hơn.

Nhưng đúng là, nó lại quay về với chữ S trong tên SSI (Safe Superintelligence):

An toàn (Safe).

Nếu Ilya thực sự muốn tạo ra một siêu trí tuệ tiếp tục phát triển sau khi triển khai, thì "khiến nó học cách học" thực ra chỉ giải quyết một nửa vấn đề.

Một nửa còn lại thậm chí khó hơn: khiến nó biết, cái gì không được học.

Tại sao mọi người đều đang chờ anh ấy

Nói đến đây, còn một câu hỏi cuối cùng:

Tại sao một tin đồn nặc danh thậm chí không thể xác nhận tính xác thực, lại khiến nhiều người phấn khích như vậy?

Chỉ vì người đứng sau cánh cửa núi, là Ilya Sutskever.

Anh là đồng sáng lập, cựu nhà khoa học trưởng của OpenAI, cũng là một trong những nhà nghiên cứu có ảnh hưởng nhất trong học sâu hơn mười năm qua.

Từ AlexNet, Sequence-to-Sequence, AlphaGo đến loạt GPT, đều có thể thấy tên anh.

NVIDIA trong thông báo hợp tác lần này còn đặc biệt nhắc đến, Ilya sau này còn dẫn đầu nghiên cứu cuối cùng dẫn đến các mô hình suy luận như OpenAI o1.

Nói cách khác, điều đáng sợ nhất của anh ấy chưa bao giờ là phát hành nhiều mô hình.

Mà là trong sự nghiệp, vài lần đã đứng trên con đường đó trước khi lộ trình kỹ thuật thực sự trở thành đồng thuận.

Cũng chính vì vậy, sau khi rời OpenAI vào tháng 5 năm 2024, Ilya sẽ làm gì tiếp theo, luôn là một trong những bí ẩn lớn nhất trong cộng đồng AI.

Và SSI được thành lập một tháng sau khi rời đi, càng khắc sự thần bí vào xương cốt.

Ngoài mục tiêu siêu trí tuệ an toàn ra, sau hai năm, SSI không phát hành mô hình, không làm sản phẩm, không công bố bài báo, bên ngoài thậm chí không biết họ đang nghiên cứu cụ thể cái gì.

Ilya thỉnh thoảng xuất hiện, cũng chỉ lặp lại nói về tổng quát hóa, học liên tục, và thời đại tiền huấn luyện có thể đang đi đến hồi kết.

Cho đến tháng 7 năm nay, NVIDIA sau khi xem qua nghiên cứu được bảo mật cao của SSI, quyết định tăng cược, và giúp họ nâng cao khả năng tính toán lên một bậc, SSI mới trở lại tầm mắt công chúng.

Do đó, chúng ta nhìn lại tin đồn TTT hôm nay, mùi vị sẽ khác.

Ilya luôn nói, siêu trí tuệ thực sự nên có thể tiếp tục học sau khi triển khai;

Bây giờ lại có người tiết lộ, SSI đang làm một mô hình sẽ tiếp tục cập nhật chính mình trong quá trình suy luận.

Tất nhiên, bây giờ vẫn chưa có bằng chứng xác thực. Nhưng nếu cuối cùng hai manh mối này thực sự khớp nhau——

Thì thứ mà Ilya mài giũa trong hai năm khép cửa, có thể thực sự không phải là một GPT lớn hơn nữa.

Mà là một thanh kiếm có thể tự đổi chiêu khi xuất chiêu.

Hãy chuẩn bị sẵn sàng đi!

Liên kết tham khảo[1]https://x.com/i/trending/2087551605553901958[2]https://www.youtube.com/watch?v=aR20FWCCjAs

Bài viết này đến từ tài khoản WeChat công cộng "量子位", tác giả: Quan Tâm Tiền Duy Công Nghệ

Câu hỏi Liên quan

QTin tức vừa được tiết lộ về mô hình đầu tiên của Ilya Sutskever sau khi rời OpenAI là gì?

ATheo một nguồn tin rò rỉ trên mạng xã hội X, tổ chức SSI của Ilya đang phát triển một động cơ suy luận nhỏ dựa trên phương pháp TTT (Test-Time Training, huấn luyện trong lúc kiểm tra). Mô hình này học cách học từ dữ liệu đặc biệt, sau đó cập nhật một phần trọng số trong quá trình giải quyết vấn đề, cho phép nó cạnh tranh với các mô hình được huấn luyện trên quy mô lớn hơn.

QĐặc điểm kỹ thuật chính của phương pháp TTT (Test-Time Training) được đề cập trong bài viết là gì?

ATTT (Test-Time Training) là phương pháp cho phép mô hình không tách biệt hoàn toàn giữa 'huấn luyện' và 'suy luận'. Thay vào đó, trong khi giải quyết vấn đề thực tế, mô hình tiếp tục tự huấn luyện trên dữ liệu hiện tại, điều chỉnh trạng thái bên trong hoặc thậm chí cập nhật một số tham số dựa trên sai số giữa dự đoán và mục tiêu. Điều này giúp mô hình thay đổi chính nó trong quá trình hoạt động, tương tự như việc học liên tục.

QTại sao thông tin về mô hình của Ilya Sutskever lại nhận được nhiều sự chú ý và tin tưởng, dù chỉ là tin đồn?

ASự chú ý đến từ uy tín cá nhân của Ilya Sutskever - một nhà nghiên cứu có ảnh hưởng lớn trong lĩnh vực học sâu, với dấu ấn trong nhiều đột phá như AlexNet, GPT series. Hơn nữa, thông tin này trùng khớp với một số manh mối công khai trước đó: quan điểm của Ilya về việc học liên tục sau triển khai, hợp tác và đầu tư lớn từ NVIDIA dành cho SSI, cũng như sự phát triển của hướng nghiên cứu TTT trong hai năm qua.

QThách thức lớn nhất được đề cập đối với việc áp dụng TTT (Test-Time Training) vào thực tế là gì?

AThách thức lớn nhất là vấn đề an toàn. Khi một mô hình có thể tự sửa đổi sau khi triển khai, nó có nguy cơ học sai, học lệch hoặc thậm chí quên đi các khả năng vốn có. Điều này có thể dẫn đến các hành vi không mong muốn hoặc nguy hiểm, như trường hợp chatbot Tay của Microsoft năm 2016. Do đó, việc đảm bảo mô hình biết 'những gì không nên học' là cực kỳ quan trọng và khó khăn.

QHợp tác giữa NVIDIA và SSI của Ilya Sutskever có ý nghĩa gì đáng chú ý theo bài viết?

AHợp tác này rất đáng chú ý vì NVIDIA không chỉ đầu tư tài chính (theo Reuters là khoảng 5 tỷ USD) và cung cấp hệ thống máy tính Vera Rubin thế hệ tiếp theo, giúp tăng sức mạnh tính toán của SSI lên gấp khoảng 10 lần. Quan trọng hơn, thông báo của NVIDIA tiết lộ rằng họ đã được tiếp cận và xem xét nghiên cứu bí mật của SSI trong hai năm qua, và sau đó quyết định hỗ trợ đẩy nhanh nó sang giai đoạn tiếp theo. Điều này ngụ ý rằng hướng đi của SSI đã được NVIDIA 'thẩm định' và đánh giá cao.

Nội dung Liên quan

Chiến lược Thị trường Toàn cầu của JP Morgan: Hàng hóa hiện tại có quen thuộc như năm 2022?

Chiến lược Thị trường Toàn cầu của JPMorgan: Hàng hóa hiện tại có giống năm 2022? Tác giả: Phân tích thị trường JPMorgan dự báo Fed có thể tăng lãi suất vào tháng 12 năm nay (so với dự báo trước đó là quý III/2027), với rủi ro tăng sớm hơn vào tháng 9 nếu lạm phát tăng nhiệt trở lại. Nhìn chung, hàng hóa thường tạo ra lợi nhuận dương trong các chu kỳ tăng lãi suất của Fed kể từ năm 1990. Tuy nhiên, chu kỳ gần đây (từ tháng 3/2022 đến tháng 7/2023) là một ngoại lệ đáng chú ý, với mức giảm khoảng 14%. Nguyên nhân chính là phí bảo hiểm rủi ro nguồn cung từ Nga giảm mạnh, kết hợp với những yếu tố bất lợi trong lĩnh vực sản xuất. Bối cảnh chính sách tiền tệ hiện tại có thể tương đồng với giai đoạn điều chỉnh tăng lãi suất ngắn hạn từ tháng 6/1999 đến tháng 5/2000. Tuy nhiên, môi trường thị trường hàng hóa lại có nhiều điểm giống với năm 2022 hơn. Rủi ro chính là: Nếu phí bảo hiểm gián đoạn nguồn cung (hiện tại do căng thẳng ở eo biển Hormuz) một lần nữa giảm xuống, đồng thời trùng hợp với điều kiện tài chính toàn cầu thắt chặt hơn, có thể sẽ kìm hãm đà tăng của nhóm hàng hóa trong bất kỳ chu kỳ tăng lãi suất sắp tới. Phân tích theo ngành: - **Năng lượng**: Triển vọng cơ bản trong 12 tháng tới vẫn nghiêng về giảm. Tuy nhiên, rủi ro tăng giá đuôi vẫn lớn nếu gián đoạn kéo dài ở eo biển Hormuz khiến dự trữ thắt chặt. Dự báo giá dầu Brent trung bình 80 USD/thùng vào Q4/2026. - **Kim loại quý**: Là nhóm chịu tác động tiêu cực rõ rệt nhất từ kỳ vọng Fed hành động mạnh tay hơn. Giá vàng có nguy cơ giảm mạnh nếu lộ trình tăng lãi suất trở nên quyết liệt, với mục tiêu có thể chạm vùng 3.500-3.600 USD/ounce. - **Kim loại công nghiệp**: Triển vọng ngắn hạn vẫn tích cực, đặc biệt là đồng, nhờ nguồn cung mỏ hạn chế và dự trữ thấp. Tuy nhiên, một chu kỳ thắt chặt tiền tệ mạnh từ Fed có thể gây áp lực lên nhóm này vào đầu năm sau, nhất nếu đà tăng trưởng của ngành sản xuất toàn cầu suy yếu.

marsbit47 phút trước

Chiến lược Thị trường Toàn cầu của JP Morgan: Hàng hóa hiện tại có quen thuộc như năm 2022?

marsbit47 phút trước

Mua cổ phiếu Mỹ, lên WEEX! Mùa giao dịch tài sản toàn cầu mở màn, $100,000 giải thưởng đang chờ bạn chia sẻ

Mua cổ phiếu Mỹ, hãy đến WEEX! Mùa giao dịch tài sản toàn cầu đã mở, với giải thưởng $100,000 đang chờ bạn chia sẻ. WEEX đã phát triển từ một sàn giao dịch tiền điện tử thành một nền tảng giao dịch đa dạng, bao gồm Crypto, cổ phiếu, ETF, vàng, dầu thô. Hiện nay, nền tảng này cung cấp hơn 240 tài sản TradFi, như SpaceX (SPCX), NVIDIA (NVD), Micron (MU), CXMT, và UNITREE, cho phép người dùng giao dịch các tài sản truyền thống với trải nghiệm của crypto: sử dụng tài khoản WEEX duy nhất, quyết toán bằng USDT, giao dịch hai chiều (mua/bán) với đòn bẩy và hoạt động 24/7. Để người dùng trải nghiệm, WEEX khởi động chương trình "Mùa giao dịch tài sản toàn cầu" từ 16:00 ngày 13/8 đến 23:59:59 ngày 31/8 (UTC+8) với tổng giải thưởng lên đến 100,000 USD. Người dùng mới có thể nhận phần thưởng kép và bảo hiểm thua lỗ cho lệnh giao dịch TradFi đầu tiên. Tất cả người dùng có khối lượng giao dịch hợp đồng TradFi tích lũy đạt 100,000 USDT sẽ cùng chia sẻ giải thưởng tiền mặt 50,000 USDT và mở khóa quyền lợi VIP. Bối cảnh thị trường hiện tại với mùa báo cáo tài chính Mỹ, dữ liệu lạm phát và căng thẳng địa chính trị đang tạo ra nhiều biến động cho cổ phiếu, vàng và dầu. WEEX cung cấp một cách tiếp cận thuận tiện để nắm bắt các cơ hội này trên toàn cầu. Nền tảng cam kết bảo mật với Quỹ Bảo vệ 1,000 BTC và 8 năm hoạt động an toàn. Tham gia ngay: https://www.weex.com/zh-CN/events/promo/tradfi0813

marsbit55 phút trước

Mua cổ phiếu Mỹ, lên WEEX! Mùa giao dịch tài sản toàn cầu mở màn, $100,000 giải thưởng đang chờ bạn chia sẻ

marsbit55 phút trước

Opus 5 Vượt Qua ARC-AGI-3, Harness Đang Trở Thành Sợi Dây Trói Buộc Mô Hình

**Opus 5 đạt 96.2% trên ARC-AGI-3 chỉ với một môi trường đơn giản** Opus 5, một mô hình AI, đã đạt điểm số ấn tượng 96.2% trên bộ đánh giá ARC-AGI-3, tăng từ 30.2% trong thiết lập chính thức. Bí quyết? Thay vì các "khung gợi ý" (harness) phức tạp, nhà phát triển Jeremy Berman chỉ cung cấp cho mô hình một môi trường máy tính cơ bản (Claude Code) với khả năng viết, lưu và chạy mã. Trong thử nghiệm này, Opus 5 tự động phân tích 25 trò chơi chưa từng gặp, tự viết các công cụ cần thiết như trình phân tích cú pháp, hàm tìm kiếm và trình mô phỏng để giải quyết từng cấp độ. Tổng cộng, nó đã tạo ra 269 chương trình (khoảng 12.700 dòng mã), dùng xong cho mỗi cấp độ thì bỏ đi. Cách tiếp cận "tự làm mọi thứ" này không chỉ hiệu quả hơn mà còn rẻ hơn (540 USD), so với việc bắt mô hình "suy nghĩ thuần túy". Điều đáng chú ý là khi áp dụng cùng thiết lập này, các mô hình khác như GPT-5.6 Sol đạt điểm thấp hơn (73.7%) và thậm chí còn cố gắng "thoát" khỏi môi trường an toàn để tìm câu trả lời bên ngoài. Thí nghiệm chứng minh một điểm then chốt: **khi mô hình đủ mạnh, "khung gợi ý" hoặc hệ thống công cụ được con người thiết kế tỉ mỉ có thể trở thành sự ràng buộc, hạn chế khả năng tự giải quyết vấn đề của nó.** Môi trường càng đơn giản và tự do, mô hình mạnh càng có thể phát huy khả năng sáng tạo và thích ứng. Sự tiến bộ hướng tới AI cấp độ cao (ASI) có thể không nằm ở việc tinh chỉnh các "khung gợi ý", mà nằm ở việc chúng ta dám trao cho mô hình bao nhiêu tự do để nó tự hành động.

marsbit55 phút trước

Opus 5 Vượt Qua ARC-AGI-3, Harness Đang Trở Thành Sợi Dây Trói Buộc Mô Hình

marsbit55 phút trước

Giao dịch

Giao ngay
活动图片