Giám đốc điều hành OpenAI, Sam Altman, một lần nữa gây chấn động giới công nghệ.
Trong cuộc trò chuyện gần đây với các thực tập sinh tại Thung lũng Silicon, ông thẳng thắn cho rằng "trợ lý AI tối thượng" chỉ còn cách chúng ta "một lần lặp mô hình / 6 tháng".
Trong 6 tháng tới, chúng ta sắp chứng kiến một thế giới như thế này: thế hệ sau của ChatGPT có thể xem màn hình của bạn, ghi lại mọi cuộc họp và cuộc gọi, và nắm bắt hoàn hảo toàn bộ bối cảnh cuộc sống của bạn.
Chúng ta chỉ còn cách chức năng này trở nên cực kỳ hữu ích đúng một lần lặp mô hình.
Lưu ý, ông ấy không nói về "trí nhớ mạnh hơn" hay "ngữ cảnh lớn hơn", mà là việc liên tục xem màn hình của bạn, ghi lại mọi cuộc họp và cuộc gọi, nắm bắt ngữ cảnh hoàn hảo cho toàn bộ cuộc đời bạn.
Đây sẽ là một bước nhảy vọt về chất trong mối quan hệ giữa người và máy: từ đối thoại sang cộng sinh. Nhưng lần này, liệu dự đoán của Altman có đáng tin?
Altman: Để AI ghi nhớ toàn bộ cuộc sống của bạn
Hai năm qua, Altman đã nhiều lần mơ ước về một tầm nhìn: hy vọng có một mô hình suy luận cực nhỏ, nhưng sở hữu ngữ cảnh hàng nghìn tỷ token, có thể ghi nhớ toàn bộ cuộc sống của bạn, và sau đó liên tục bổ sung.

Tháng Năm năm ngoái tại hội nghị Sequoia AI Ascent, Altman đưa ra một quan sát rất thuyết phục.
Ông đã đưa ra một sự phân chia tuy sơ lược nhưng rõ ràng:
Người lớn tuổi coi ChatGPT như một sự thay thế cho Google;
Người từ 20 đến 30 tuổi coi nó như một cố vấn cuộc sống;
Sinh viên đại học thì coi nó thẳng là hệ điều hành.
Xu hướng tiến xa hơn là, giới trẻ "việc lớn trong đời, hỏi ChatGPT trước".

Đây đều là những tín hiệu cho hình thái mới của AI trong tương lai. Nhưng lần này, ông không chỉ nói về "trí nhớ", mà trực tiếp đề cập đến việc cảm nhận màn hình và ghi chép toàn bộ cuộc họp.
Altman tuyên bố: Trong vòng 6 tháng tới, thế hệ AI tiếp theo sẽ hoàn toàn hiểu bạn.
Đây sẽ là một bước nhảy thực sự, từ "sử dụng đôi khi" thành "hiện diện liên tục", từ "nhiệm vụ đơn lẻ" thành "tích lũy ngữ cảnh ở cấp độ toàn bộ cuộc đời". Bạn càng đầu tư nhiều cuộc sống vào AI này, chi phí để rời bỏ nó càng lớn.
Trí nhớ: Từ lưu trữ thụ động đến tổng hợp chủ động
Hình mẫu thực ra đã bắt đầu xuất hiện: phiên bản desktop của ChatGPT ở chế độ giọng nói đã có thể lấy được ngữ cảnh màn hình, và phiên bản doanh nghiệp từ lâu đã có chức năng ghi chép và tóm tắt cuộc họp.
Ngày 21 tháng 4 năm nay, OpenAI đã ra mắt một phiên bản nghiên cứu xem trước có tên là Chronicle trong sản phẩm lập trình Codex.
Nó thông qua việc chụp ảnh màn hình ngắt quãng ở chế độ nền + OCR, tạo ra ký ức về "bạn đang làm gì gần đây", lưu thành tệp Markdown mã hóa cục bộ, giúp Codex hiểu "cái này", "cái kia" hay dự án hai tuần trước mà không cần người dùng lặp lại.
Trải nghiệm thực tế sau đó, Chủ tịch OpenAI Greg Brockman đã nói hai từ: "surprisingly magical" (kỳ diệu một cách đáng ngạc nhiên).

Mã nội bộ của nó là "telepathy" (thần giao cách cảm). Bản thân Altman thẳng thắn: "Đúng như tên gọi, chính là cảm giác đó."

Nhưng Chronicle ≠ "Ngữ cảnh cuộc đời" toàn diện. Nó chủ yếu phục vụ quy trình làm việc lập trình của Codex, nắm bắt nội dung màn hình gần đây để bổ sung ngữ cảnh, thay vì liên tục ghi âm cuộc họp/cuộc gọi hay xây dựng hồ sơ cá nhân hoàn chỉnh. Người dùng có thể tạm dừng bất cứ lúc nào.
Và rủi ro khá lớn, tài liệu chính thức cảnh báo rõ về việc tiêm prompt, lưu trữ cục bộ chưa mã hóa, cần sự cho phép của người dùng.
Một động thái khác của OpenAI là Dreaming V3 được triển khai trên ChatGPT vào tháng 6 năm nay.

Dreaming V3 là kiến trúc mới nhất của hệ thống trí nhớ ChatGPT: nền tự động tổng hợp trạng thái trí nhớ từ lịch sử hội thoại, có khả năng nhận thức thời gian, giảm thông tin lỗi thời, nâng cao khả năng nhớ lại sự thật và tuân theo sở thích.
Người dùng có thể xem/chỉnh sửa thông qua trang tóm tắt trí nhớ.
Điều thú vị nhất là nó có khả năng tự động tiến hóa. Nếu bạn từng nói "tháng Bảy sẽ đi Singapore", khi thời gian qua đi, hệ thống sẽ tự động đổi ký ức thành "bạn đã đi Singapore vào tháng Bảy". Ký ức không còn tĩnh, mà đi theo thời gian.
Trong đánh giá nội bộ của OpenAI, lần cập nhật này cải thiện hiệu suất rõ rệt:
Tỷ lệ nhớ lại sự thật tăng từ 67.9% năm 2025 lên 82.8%;
Việc tuân theo sở thích tăng từ 55.3% lên 71.3%;
Độ chính xác nhạy cảm thời gian tăng từ 52.2% lên 75.1%.

Và hiệu quả tính toán đã được cải thiện khoảng 5 lần, đây cũng là lý do nó có thể triển khai đến tầng người dùng miễn phí.
Dreaming V3 và Chronicle là những tiến triển song song nhưng thuộc dòng sản phẩm khác nhau - một tập trung vào ngữ cảnh màn hình (kịch bản lập trình Codex), một tập trung vào tổng hợp hội thoại (chung cho ChatGPT).
Kết hợp lại, chúng gần hơn với hướng "luôn trực tuyến, cá nhân hóa sâu" mà Altman mô tả, nhưng vẫn đang ở giai đoạn nghiên cứu xem trước/đẩy theo từng giai đoạn.
Trí nhớ, đang trở thành hào sâu mới
Tầm nhìn này của Altman không phải là đơn độc. Kéo rộng ống kính ra một chút sẽ thấy, vài tháng qua, gần như toàn bộ ngành AI cùng đặt cược vào một hướng trong cùng một thời điểm.
Bên phía Google đi theo con đường doanh nghiệp.
Memory Bank đã được triển khai trên nền tảng Agent cấp doanh nghiệp của Gemini. Nhà phát triển có thể kết nối AI agent họ tạo ra với một bể nhớ có khả năng ghi nhớ xuyên phiên, tự động tinh luyện sở thích người dùng, điểm mốc quan trọng, chỉ dẫn rõ ràng từ cuộc hội thoại.
Luồng này hiện tại nghiêng về cơ sở hạ tầng dành cho nhà phát triển hơn, chưa trải rộng đến hộp thoại Gemini của người dùng phổ thông, nhưng hướng đi thì nhất quán với OpenAI.
Anthropic cũng không ngồi yên.
Tháng 3 năm nay, trí nhớ bền vững đã được trao trực tiếp cho tất cả người dùng Claude, cả bản miễn phí và trả phí, nền tự động tổng kết dữ liệu của bạn dựa trên hội thoại.
Tháng 4, lại thêm phiên bản công khai thử nghiệm tính năng trí nhớ bền vững vào Managed Agents dành cho bên nhà phát triển, các khách hàng doanh nghiệp như Netflix đã mang đi chạy môi trường sản xuất, lỗi của người dùng doanh nghiệp đã giảm 97%.
Bên thứ ba cũng đang nhảy vào, nhưng cách đánh lại hoàn toàn trái ngược.
Các dự án tầng nhớ như Mem0 muốn làm, là trở thành một tầng trung gian nhớ đa nền tảng, đồng thời kết nối với OpenAI, Anthropic, các mô hình mã nguồn mở, để nhà phát triển không bị khóa chết vào một nhà cung cấp nào.
Điều này cho thấy ngành đã nhận ra vấn đề - nếu mỗi gã khổng lồ đều xây dựng hòn đảo trí nhớ riêng biệt, cuối cùng chịu khổ sẽ là người dùng và nhà phát triển bị mắc kẹt bên trong.

Giờ đây, hầu hết tất cả các gã khổng lồ đều đang lao về hướng này.
Nhưng điều thực sự không ai muốn đưa ra mặt bàn là, ký ức AI của bạn hiện đang bị khóa trên nền tảng bạn dùng nhiều nhất. Chuyển từ ChatGPT sang Claude, ký ức trống rỗng, mọi thứ bắt đầu từ đầu. Dùng ba công cụ cùng lúc, bạn đồng thời nuôi dưỡng ba "bạn" không tương thích với nhau, có quỹ đạo phát triển hoàn toàn khác biệt.
Đây mới là hào sâu ngầm hơn cả hiệu suất mô hình.
Sức mạnh của mô hình có thể thay đổi thứ hạng trong ba tháng, nhưng thứ trí nhớ này càng tích càng dày, càng tích lâu, chi phí rời đi càng cao. Ai tích lũy ký ức của người dùng đủ dày trước, người đó sẽ hàn người dùng vào nền tảng của mình trước.
Hiểu được tầng này, có thể thấy câu nói của Altman không chỉ là tầm nhìn sản phẩm, mà còn là dự đoán thương mại.
Tài liệu tham khảo:
https://x.com/OpenAIDevs/status/2046288243768082699
https://x.com/haider1/status/2087219995466224120
https://x.com/cory/status/2087060650870907170
https://www.youtube.com/watch?v=gXsutRiJbZI
https://inferencebysequoia.substack.com/p/openais-sam-altman-on-building-the?utm_source=publication-search
Bài viết từ tài khoản công chúng WeChat "Tân Trí Nguyên", tác giả: ASI Khải Thị Lục





