10 bài toán toán học nan giải, 24 giờ lật kèo.
Cuối tuần này, hai đại gia AI là OpenAI và Anthropic, đã đối đầu trực diện tại tuyến đầu của toán học.
Đầu tiên là vào ngày 1 tháng 8, nhà nghiên cứu OpenAI Sébastien Bubeck tuyên bố rằng mô hình chủ lực thế hệ tiếp theo chưa được công bố của họ, Astra, đã một mạch chứng minh được 10 thành tựu toán học tiên phong, đồng thời tung ra 10 chứng chỉ Lean, 10 bản tường thuật tư duy chi tiết từng bài.

Đừng coi thường 10 vấn đề này.
Kết luận chính của chúng ít nhất 10 năm chưa ai thúc đẩy được, nhiều vấn đề bị bỏ ngỏ hàng chục năm, là những bài toán mở đích thực.

Mặc dù không được coi là những bí ẩn chưa giải được sâu sắc nhất trong toán học, nhưng mỗi bài đều là một khúc xương khó nhằn.
Elliot Glazer, người đứng đầu FrontierMath của Epoch AI, thẳng thắn nói: Chỉ riêng bài về nhóm phi Sophie Germain, chắc chắn sẽ được đăng trên tạp chí hàng đầu được toán học thế giới công nhận - Annals of Mathematics.
10 bài toán khó này vừa được tung ra, cộng đồng AI lập tức nổ tung, có người lập tức hô to "điểm kỳ dị toán học đã đến".
Bên phía Anthropic nhanh chóng đáp trả.
Chưa đầy 24 giờ, nhà nghiên cứu Levent Alpöge đã trả lời dưới bài đăng của Bubeck: "Tôi đã hoàn thành một nửa với Fable."

Sau đó anh ấy bổ sung thêm, những bài anh ấy làm được là các hạng mục 4, 5, 6, 7, 8 trong danh sách của OpenAI, tổng cộng 5 hạng mục.
Về điều kiện thí nghiệm, Levent nói rất sạch sẽ: hoàn toàn tự chủ, gợi ý chung, không có mạng trong suốt quá trình, để phòng ngừa giải pháp của OpenAI rò rỉ vào ngữ cảnh, còn đặc biệt thêm một lớp bảo vệ.

Tất nhiên, hiện tại Levent vẫn chưa công bố chi tiết chứng minh đầy đủ của Fable, anh ấy cho biết sẽ tải lên.
Nhưng nếu được xác nhận, trọng lượng của sự việc này sẽ thay đổi:
Cơ hội phát hành đầu tiên mà OpenAI giành được bằng mô hình chưa phát hành Astra, chỉ duy trì được 24 giờ. Và Fable đuổi theo, là mô hình mà Anthropic đã công bố từ lâu, ai cũng có thể gọi sử dụng.
Một 'lần đầu toán học', thời hạn tươi chỉ còn 24 giờ
Người dùng mạng Chubby chia sẻ bài viết: "Fable có sẵn công khai, đã tái hiện được một nửa thành quả của Astra."

Phần bình luận có người trêu đùa: Nhìn vậy, có phải OpenAI chỉ giành được một lần phát hành đầu tiên?
Trước đây, cuộc tranh giành quyền ưu tiên cho một thành tựu toán học, thường tính bằng năm.
Ai nghĩ ra trước, ai chứng minh ra trước, ai công bố trước, giữa đó là quá trình nộp bài, thẩm định, sửa chữa dài đằng đẵng.
Mà bây giờ, Astra còn chưa chính thức phát hành, thành quả mà nó công bố, chỉ 24 giờ, đã bị một mô hình công khai bắt kịp một nửa.
Giá trị của lần phát hành đầu tiên vẫn còn, nhưng thời hạn bảo quản lại bị rút ngắn đáng kể.
Nhiều người dùng mạng đã hô to "điểm kỳ dị toán học", hai đại gia AI cũng cắn chặt nhau.
Đằng sau 2000 đô la Mỹ, còn có món hóa đơn đắt hơn
OpenAI còn tung ra một con số: chi phí tìm ra 10 giải pháp này, chưa đến 2000 đô la Mỹ.
Theo cách nói của nhà nghiên cứu Noam Brown, nó tương ứng với số token cần thiết để tìm kiếm những giải pháp này, sau đó quy đổi theo giá Sol API.

Nói cách khác, đây chỉ là chi phí suy luận biên tại thời điểm chạy ra được 10 giải pháp thành công.
Ngoài ra, còn có quá trình đào tạo và phát triển bản thân Astra, những vấn đề đã thử nhưng không thành công, thời gian công sức của con người sắp xếp lập luận thành luận văn 249 trang, chi phí hình thức hóa mỗi chứng minh thành Lean, và cuối cùng là chi phí thẩm định của các nhà toán học bên ngoài.
Bản thân Noam cũng thừa nhận, họ còn thử qua các vấn đề trọng đại khác, nhưng đều không thành công, không giải được bất kỳ bài toán khó nào trong số các bài toán thiên niên kỷ.
Dù vậy, 2000 đô la Mỹ vẫn đẩy chi phí biên để AI giải một bài toán tiên phong, xuống mức sàn.
Thậm chí có người trêu đùa, liệu ngày mai OpenAI có công bố thêm 10 đột phá toán học nữa, hay đợi đến tuần sau tung ra 100 hạng mục một lần.

Từ 'tương tác bảng xếp hạng' đến 'tương tác kiểm hàng'
Việc Fable làm lại cùng một loạt bài của Astra, thú vị hơn nhiều so với việc lên bảng xếp hạng thông thường.
Lên bảng xếp hạng đo lường câu trả lời đã biết: đề bài và đáp án chuẩn đều đặt sẵn đó, xem ai điểm cao hơn.
Còn hai mô hình trong điều kiện không có mạng, phòng ngừa rò rỉ, độc lập đạt đến cùng một kết luận tiên phong, đo lường một thứ hoàn toàn khác: kết quả này rốt cuộc có đáng tin không, có thể được tái hiện độc lập không.
Điều này giống đánh giá đồng nghiệp hơn.
Hiện tại Levent chỉ mới "đưa ra tuyên bố" trên X, chưa tung ra PDF, gợi ý, nhật ký chạy đầy đủ, chi phí token hay chứng chỉ Lean của 5 chứng minh đó.
Người dùng mạng Haider nghi ngờ: cho dù là thật, tại sao lại dùng Fable để tái hiện Astra, thay vì trực tiếp dùng nó để giải các bài toán mở mới?

Thực tế, Fable không chỉ biết hưởng sức nóng của Astra, nó cũng sẽ giải bài mới.
Tháng 7, Levent đã dùng Fable đưa ra phản ví dụ ba chiều cho giả thuyết Jacobian, sau đó còn có người đặc biệt viết tài liệu đại số xác minh 7 trang, xác nhận ánh xạ hiện đó thực sự đã bác bỏ giả thuyết ở chiều ba và cao hơn.
Thành quả mà đại đa số không hiểu, ai sẽ nghiệm thu
10 thành quả này, rốt cuộc quan trọng đến mức nào, đại đa số mọi người khó có thể phán đoán.
Ethan Mollick nói thẳng: Đối với hầu hết mọi người trên trái đất, điều này không chỉ vượt quá khả năng, mà còn vượt quá phạm vi hiểu biết. Chúng ta chỉ có thể tin tưởng các nhà toán học chuyên nghiệp nói với chúng ta nó có tuyệt vời hay không.

Mã code, hình ảnh, trò chuyện, người bình thường còn có thể tự tay trải nghiệm AI mạnh ở điểm nào.
Còn sự tồn tại của nhóm phi Sophie Germain, phản ví dụ cho phỏng đoán tính cứng Connes, định lý lặp lại song song lượng tử, những thứ này chỉ có rất ít chuyên gia hiểu được.
Khả năng AI càng tiến về phía trước của khoa học, điều công chúng có thể dựa vào càng không phải là trải nghiệm cá nhân, mà là một chuỗi niềm tin dài. Trạng thái "thậm chí không biết ngạc nhiên từ đâu" này, đang xảy ra đồng thời ở ngày càng nhiều lĩnh vực.
Nhà toán học Thomas Bloom nhắc nhở, những thành quả này sử dụng lý thuyết toán học tích lũy hàng trăm năm, hệ thống hình thức do chính các nhà toán học xây dựng, việc mô tả đơn giản nó là "AI thay thế nhà toán học", không trung thực.
Tiêu chuẩn anh ấy đưa ra là: chứng minh này, có dạy cho chúng ta điều gì mới về vấn đề này không?
Vậy vấn đề thực sự đến rồi: Khi AI có thể sản xuất chứng minh toán học tiên phong với chi phí thấp, hàng loạt, rốt cuộc chúng ta nên lấy gì để đo lường thành quả của nó?
Câu trả lời có lẽ không nằm ở đầu sản xuất của nó, mà ở đầu nghiệm thu: một chứng minh có thể được đọc hiểu, kiểm tra, phán đoán trọng lượng hay không, mới cuối cùng quyết định giá trị thực của nó.
Năng lực khan hiếm nhất, đang chuyển từ "tạo ra chứng minh" sang "hiểu và nghiệm thu chứng minh".
Khi AI một đêm có thể chứng minh mười bài toán khó, thử thách thực sự mới bắt đầu: chứng minh được tạo ra ngày càng nhanh, việc xác minh của chúng ta, còn theo kịp không?
Tài liệu tham khảo:
https://x.com/haider1/status/2083908869915611554
https://x.com/polynoamial/status/2083470822258467194
https://x.com/kimmonismus/status/2083950641978679363 https://x.com/Dr_Singularity/status/2083653287463571742
Bài viết từ tài khoản WeChat công chúng "新智元" (Trí tuệ mới), tác giả: ASI启示录





