AGI có lẽ đã xuất hiện từ năm tháng trước, chỉ là không ai để ý.
Thứ Ba tuần trước, ngày 14 tháng 7, CEO Google DeepMind, người đoạt giải Nobel Demis Hassabis đã đăng một bài viết dài, có tiêu đề "Khuôn khổ cho AI Tiên phong và Bình minh của Kỷ nguyên Mới" (A Framework for Frontier AI and the Dawning of a New Age).
Trong bài viết, ông ấy viết rằng loài người "về cơ bản đã tìm ra cách khiến cát suy nghĩ", chúng ta đang đứng dưới "chân núi của Điểm Kỳ dị", và AGI "chỉ còn cách đó vài năm nữa".

Hassabis tại hội nghị Google I/O
Ở đây, Hassabis nói rằng vẫn còn vài năm, nhưng một đại gia khác của Thung lũng Silicon hai tháng trước đã tuyên bố: Chúng ta đã âm thầm vượt qua ranh giới đó từ lâu.
Tập 2501 của The Joe Rogan Experience phát sóng ngày 19 tháng 5, Marc Andreessen, đồng sáng lập a16z, cha đẻ của trình duyệt Netscape, khi nói về AGI, đã buông một câu:
Chúng ta có lẽ đã vượt qua nó từ khoảng ba tháng trước.
"Ba tháng trước" mà ông ấy nói, rơi vào khoảng tháng 2 năm 2026.

Tiêu chuẩn đánh giá mà Andreessen đưa ra rất đơn giản: Mô hình có đạt được hoặc vượt qua khả năng nhận thức phổ quát của một người thông minh hay không.
Trong phần lớn các chủ đề mà ông ấy tham khảo ý kiến từ AI, câu trả lời từ mô hình tốt hơn hầu hết các chuyên gia hàng đầu thế giới mà ông có thể liên hệ.
Ông ấy đã điểm tên những mô hình mới nhất thời điểm đó: GPT-5.5, Claude 4.6, Gemini 3.0, Grok 4.3.
Thú vị là, hai tháng trôi qua, ngoại trừ Gemini 3.0 vẫn chưa có động tĩnh, loạt mô hình mà ông ấy điểm tên đã được làm mới hoàn toàn một vòng:
Ngày 28 tháng 5, Claude Opus 4.8 đứng đầu chỉ số thông minh Artificial Analysis; ngày 9 tháng 6, Claude Fable 5 cấp Mythos ra mắt; ngày 30 tháng 6, Sonnet 5 ra mắt; ngày 8 tháng 7, xAI phát hành Grok 4.5, người kế nhiệm của Grok 4.3; ngay sau đó, GPT-5.6 Sol được mở cửa.
Nghĩa là, loạt mô hình mà Andreessen dùng để định nghĩa "AGI đã đến" đã trở thành thế hệ trước sau hai tháng.
Theo cách nói của ông, lĩnh vực này chạy quá nhanh, nhanh đến mức các cột mốc còn chưa kịp được công nhận thì đã bị phiên bản phát hành tiếp theo che lấp.
Thử nghiệm Turing là một ví dụ.
Được đề xuất năm 1950, trong hơn bảy mươi năm sau đó, nó luôn là tiêu chuẩn vàng để đánh giá trí thông minh máy móc. Đầu năm 2023, ChatGPT ra đời, ranh giới này bị vượt qua quá nhanh, nhanh đến mức hầu hết mọi người không nhận ra nó đã không còn tồn tại.
Đợi đến khi có người nhớ ra để làm thí nghiệm, đã là hơn hai năm sau.
Tháng 3 năm 2025, Jones và Bergen từ UC San Diego đã thực hiện hai vòng thử nghiệm ba bên được đăng ký trước, GPT-4.5 được thêm gợi ý về tính cách bị đánh giá là con người với tỷ lệ 73%, cao hơn cả tỷ lệ người thật được chọn. Tiêu đề bài báo cũng rất rõ ràng: "Mô hình lớn đã vượt qua Thử nghiệm Turing".
Khi vượt qua ranh giới, không ai hay biết, xác nhận đã là hai năm sau.
"Ma cà rồng AI"
AI càng mạnh, con người càng khó ngủ
Điều thực sự khiến Thung lũng Silicon sôi sục bàn tán mà Andreessen đưa ra, là quan sát của ông về các kỹ sư phần mềm.
Theo lý thuyết suy luận thông thường, khi hiệu suất lập trình tăng lên, các kỹ sư nên sống thoải mái hơn một chút, nhưng thực tế lại ngược lại hoàn toàn.
Những người sử dụng nặng mà ông ấy quen biết, hầu như không có ngoại lệ nào đang làm việc nhiều giờ hơn trước đây.

Andreessen nói rằng, những lập trình viên sử dụng AI trong các công ty công nghệ hàng đầu hiện nay, sản lượng mỗi giờ cao hơn trước đây 20 lần: năng suất thực sự đã tăng lên, nhưng thời gian tiết kiệm được không còn lại một phút nào.
Thung lũng Silicon đặt cho nhóm người này một cái tên: Ma cà rồng AI (AI vampires), ý nói con người đã bị AI biến thành sinh vật không ngủ.
Một ngày của họ diễn ra như thế này:
Giao nhiệm vụ cho một tác nhân thông minh mã hóa, nó chạy khoảng 10 phút rồi quay lại nộp bài, bạn đánh giá, trả lại, rồi giao tiếp. 9 phút còn lại thì làm gì? Mở cửa sổ thứ hai, thứ ba, thứ tư. Tình trạng ở Thung lũng Silicon hiện nay là chạy đồng thời khoảng 20 tác nhân thông minh, cứ 10 phút thu hoạch một lô, rồi tiếp tục phân phối.
Giấc ngủ, sức khỏe và hai giờ ăn cơm với gia đình, tất cả đều bị đổi lấy sản lượng.
20 tác nhân thông minh dừng ở đó chờ nghiệm thu, bạn nhắm mắt lại, hai mươi dây chuyền đều dừng: chi phí cơ hội của việc ngủ đã cao đến mức chính họ không thể chấp nhận được.
Andreessen nói, trong số những người bạn này có những người khá nổi tiếng, giờ gặp nhau thì "sắc mặt kém, quầng thâm nặng, rõ ràng là không chăm sóc bản thân", nhưng ai cũng phấn khích.
Theo đánh giá của ông, đây mới chỉ là trạng thái hiện tại. Bước tiếp theo là tác nhân thông minh tự mang theo tác nhân thông minh: một tác nhân thông minh phía dưới treo 10 đến 20 tác nhân con, rồi phía dưới nữa, lại treo một lớp nữa.
Một năm sau, một người sẽ phải đối mặt với một sơ đồ tổ chức của các tác nhân thông minh, bản thân ngồi trong ô trên cùng.
Đằng sau "năng suất tăng 20 lần", có mang lại mức lương tăng vọt không?
Andreessen tuyên bố, thu nhập hàng năm của các lập trình viên AI hàng đầu liên quan đã đạt 50 triệu đô la.
Đây là mô tả bằng lời trong podcast của ông, cách hiểu gần với thực tế hơn là: tổng thu nhập, cổ phần và khuyến khích ký kết của một số ít nhà nghiên cứu cốt lõi hoặc người phụ trách kỹ thuật có thể đạt đến mức này.
Công cụ tăng năng suất không đổi lấy được nhiều thời gian nghỉ ngơi hơn.
Nó đã đẩy chi phí cho mỗi đơn vị sản lượng xuống, và khiến tham vọng phình to lên để lấp đầy tất cả thời gian tiết kiệm được.
Bốn thủ pháp hỏi AI
Người dùng hàng đầu Thung lũng Silicon sử dụng như thế này
Andreessen cũng tiết lộ bốn thủ pháp mà ông ấy tự hỏi AI.
Thứ nhất, giải thích phân tầng. Khi nhận được một câu trả lời phức tạp không hiểu, ông ấy yêu cầu mô hình giải thích cho đứa trẻ 10 tuổi nghe; nếu vẫn rối rắm, thì yêu cầu nó giải thích cho đứa trẻ 5 tuổi nghe; vẫn không được, giải thích cho đứa trẻ 2 tuổi nghe.
Thứ hai, cần phiên bản mạnh nhất của cả hai phía. Ông ấy hầu như không bao giờ trực tiếp hỏi mô hình "con đường nào trong hai con đường này là đúng", như vậy chỉ nhận được một câu trả lời xu nịnh khen ngợi cả hai bên.
Cách hỏi của ông là: hãy đưa cho tôi phiên bản mạnh nhất của cả hai phía này. Mô hình sau đó viết ra hai phần: một phần đẩy lý do của A đến cực điểm, một phần đẩy lý do của B đến cực điểm, sau đó ông tự mình đưa ra phán đoán đó.
Thứ ba, hội thảo chuyên gia. Yêu cầu mô hình trực tiếp tạo ra một nhóm tính cách: nhà xã hội học, nhà tâm lý học, học giả chính trị, bác sĩ, luật sư, chuyên gia hiến pháp, sau đó để họ tranh luận một vòng về cùng một chủ đề.
Thứ tư, hỏi AI trước. Gặp phải vấn đề không biết bắt đầu từ đâu, hãy mở AI trước, thay vì tự mình suy nghĩ cứng nhắc trước.
Ngưỡng cửa thực sự nằm ở đây.
Cái gọi là "khả năng gợi ý từ khóa", đang dần trở thành một khả năng đặt câu hỏi: biết nên hỏi gì, biết cách tách một vấn đề ra, biết cách để các mô hình "đánh" nhau: cuối cùng, phán đoán đó vẫn phải do chính bạn đưa ra.
Bác sĩ quay lưng lại mở ChatGPT
Vậy còn cần bác sĩ làm gì
Andreessen kể về một trải nghiệm của mình.
Một kỳ nghỉ nào đó, ông ấy bị ngộ độc thực phẩm, nằm liệt năm ngày, đành giao toàn bộ sự việc cho "Bác sĩ GPT": cứ hai mươi phút báo cáo tình trạng cơ thể một lần, tỉnh dậy lúc bốn giờ sáng khó chịu không chịu nổi, trực tiếp gõ vào đó.
Mô tả của ông là: giống như có một bác sĩ giỏi nhất thế giới, đến bốn giờ sáng vẫn sẵn lòng nắm tay bạn, đồng hành cùng bạn vượt qua đêm đó.
Ông còn đề cập đến một cảnh tượng bạn bè gặp phải khi đi khám bệnh: bác sĩ trong phòng khám quay lưng lại trước mặt, gõ tình trạng bệnh vào ChatGPT trước máy tính.
Vậy, còn cần bác sĩ làm gì?
Tiền đề để câu hỏi này thành lập, là AI trong y tế đủ ổn định. Và một nhóm thử nghiệm vài tháng trước đã đưa ra câu trả lời ngược lại.
Ngày 23 tháng 2 năm 2026, đánh giá độc lập của Trường Y Icahn tại Sinai được công bố trên Nature Medicine, kiểm tra ChatGPT Health vừa phát hành tháng 1 năm nay, với khoảng 40 triệu người dùng hoạt động hàng ngày. 60 tình huống lâm sàng do bác sĩ thiết kế, bao phủ 21 chuyên khoa, tổng cộng 960 lần tương tác.

Càng đến hai cực, nó càng dễ đánh giá sai. Tỷ lệ đánh giá nhẹ cho các trường hợp cấp cứu thực sự là 51.6%, tỷ lệ đánh giá nặng cho các trường hợp cấp độ ở nhà là 64.8%. (Nguồn: Ramaswamy et al., Nature Medicine, 2026)
Kết quả là: trong số những trường hợp mà bác sĩ nhất trí đánh giá "phải đến phòng cấp cứu ngay lập tức", hơn một nửa, hệ thống đưa ra đề nghị là không cần đi: hãy quan sát ở nhà trước, hoặc vài ngày nữa đăng ký khám ngoại trú.
Đây cũng không phải là lỗi riêng biệt của AI.
Chính trong tháng này, METR và system card của chính OpenAI đều đánh dấu hành vi mưu đồ bất thường ("scheming") của GPT-5.6 Sol - trong một bài kiểm tra kỹ thuật phần mềm, tỷ lệ nó lách luật là cao nhất từ trước đến nay mà METR ghi nhận. Đây cũng là một trong những lý do khiến lần phát hành này bị chặn kiểm tra.
Mô hình mạnh hơn, đồng thời cũng biết cách qua mặt bạn hơn.
Nó cũng thực sự mạnh hơn.
Tháng 5 năm nay, OpenAI công bố một kết quả: một mô hình suy luận phổ quát của họ đã tự mình lật đổ một giả thuyết bắt nguồn từ Erdős, treo gần 80 năm, người đoạt giải Fields Tim Gowers trong bài báo đi kèm gọi đó là một cột mốc quan trọng của AI trong toán học.
Cùng một loạt mô hình, một bên lật đổ giả thuyết toán học 80 năm, một bên không vượt qua được cửa phân loại cấp cứu.
Thứ ngăn cách ở giữa không phải là trí thông minh, mà là sự ổn định.
Trải nghiệm tốt của Andreessen khi bị ngộ độc thực phẩm, và sự an toàn của một người lạ trong phân loại cấp cứu, phải được xem xét cùng nhau mới đầy đủ.
Có lẽ, sự xuất hiện của AGI vốn dĩ đã xảy ra một cách lặng lẽ, không có khoảnh khắc chính thức tuyên bố nào.
Chính Andreessen cũng thừa nhận, AGI trong đầu mọi người là một tình huống điện ảnh: một buổi họp báo, một khoảnh khắc mà tất cả mọi người đồng loạt gật đầu.
Thực tế là, nó kẹt giữa vài lần cập nhật phiên bản mà truyền thông coi là nâng cấp thông thường, và cứ thế xảy ra.
Thậm chí, không ai xác nhận.
Tài liệu tham khảo:
https://x.com/cyrilXBT/status/2078308274399834157
https://x.com/i/article/2077510484664971264
https://www.youtube.com/watch?v=PHQvb10vKyk
Bài viết này đến từ tài khoản WeChat công khai "Tân Trí Nguyên" (新智元), tác giả: ASI Khải Thị Lục, biên tập: Nguyên Vũ





