Trong một cuộc phỏng vấn mới đây, Sam Altman đã đưa ra một đánh giá hiếm có:
「Ông ấy có lẽ là nhà nghiên cứu quan trọng nhất, nhưng lại ít được biết đến trong lịch sử AI.」
Người đó chính là Alec Radford, người cha thực sự của GPT.

Bạn có thể chưa từng nghe tên ông ấy, nhưng bạn chắc chắn đã từng dùng những thứ do ông phát minh.
GPT-1, GPT-2, CLIP, Whisper, ông đều là tác giả đầu tiên của các bài báo.
Ngoài ra, ông còn tham gia vào một loạt công việc then chốt như GPT-3, DALL·E, Scaling Law, GPT-4 và GPT-4o.
Kỳ lạ là, một người có hồ sơ thành tích gần như trải dài qua mỗi bước ngoặt quan trọng của mô hình lớn như vậy, lại không có bằng tiến sĩ, và cũng hiếm khi nhận phỏng vấn.
Khi ChatGPT nổi tiếng khắp toàn cầu, ánh đèn sân khấu hầu như không thấy bóng dáng ông.

Nhưng nếu lật lại các bài báo AI trong mười năm qua, sẽ thấy một hiện tượng kỳ lạ hơn:
Mỗi khi mô hình bắt đầu có được một khả năng phổ quát mà trước đó chưa từng có, tên của Alec Radford, thường đã xuất hiện sẵn trong mục tác giả từ trước.
OpenAI thực sự cất cánh, bắt đầu từ việc tuyển dụng Alec
Trong chương trình mới nhất "Invest Like The Best", người dẫn chương trình hỏi Sam Altman:
"Trên con đường phát triển của công ty, người đóng góp thầm lặng nào mà anh ngưỡng mộ nhất?"
Altman buột miệng nói, đó là Alec Radford.
Công việc mà Alec đã thực hiện, sau này thực sự đã phát triển thành dòng GPT.
Ngoài ra, ông còn không ngừng truyền cảm hứng, dẫn dắt những người xung quanh, đẩy nghiên cứu đến những hướng sau này được chứng minh là cực kỳ quan trọng.
"Wired" cũng từng đưa ra một nhận định có sức nặng:
Con đường trỗi dậy của OpenAI, thực sự bắt đầu từ việc họ tuyển dụng Alec Radford khi đó còn chưa nổi tiếng.
Năm 2016, Alec gia nhập OpenAI. Năm đó ông chỉ mới 23 tuổi.
Khi đó, ông vẫn là một chàng trai trẻ ăn pizza dứa hành tây lúc nửa đêm, cùng bạn học thi đấu trên Kaggle, thành lập một công ty AI nhỏ trong ký túc xá ở Boston: Indico.

Sau khi nhận lời mời gia nhập OpenAI, Alec cũng không cảm thấy quan trọng lắm, ngược lại còn cảm thấy công việc này "hơi giống như học cao học".
Không có nhiều áp lực ngắn hạn, cũng không có sản phẩm nhất định phải làm ngay. Ông có thể tự do tìm kiếm một câu hỏi mà khi đó chưa ai biết đáp án: Mô hình ngôn ngữ cuối cùng có thể làm gì?
Thử nghiệm đầu tiên của ông là dùng 2 tỷ bình luận Reddit để huấn luyện mô hình ngôn ngữ. Quy mô dữ liệu không nhỏ, nhưng kết quả lại không có tác dụng gì.
Thử nghiệm này cũng như nhiều khám phá ban đầu của OpenAI, đã thất bại.
Nhưng OpenAI để ông tiếp tục làm, Greg Brockman, CTO khi đó, nhớ lại:
"Chúng tôi khi đó đã nghĩ, Alec rất giỏi, cứ để anh ấy làm điều anh ấy muốn đi."
Vì vậy, chàng trai trẻ này được tiếp tục thử nghiệm. Nhưng chẳng bao lâu sau, ông bị giới hạn bởi khả năng tính toán không đủ của OpenAI.
Vì không thể chạy thử nghiệm lớn hơn, Alec thu hẹp phạm vi, lấy khoảng 100 triệu đánh giá sản phẩm trên Amazon, để mô hình làm một việc đơn giản đến mức gần như nhàm chán: Dựa trên văn bản phía trước, dự đoán ký tự tiếp theo.
Trong quá trình này, một điều bất ngờ đã xuất hiện.
Mặc dù không ai dạy mô hình thế nào là đánh giá tốt, thế nào là đánh giá xấu, nhưng bên trong mô hình có một neuron, bắt đầu chủ động phân biệt cảm xúc tích cực tiêu cực của bình luận.
Điều chỉnh nó về một hướng, mô hình dễ tạo ra đánh giá tốt hơn; điều chỉnh về hướng khác, nó bắt đầu chỉ trích sản phẩm.

OpenAI sau đó gọi nó là "Neuron cảm xúc không giám sát".
Thử nghiệm này lần đầu tiên đưa ra đáp án mà Alec thực sự muốn tìm:
Khi mô hình được yêu cầu hoàn thành nhiệm vụ dự đoán trên dữ liệu đủ nhiều, nó có thể tự học được một số khả năng mà mục tiêu huấn luyện chưa từng ghi rõ.
Ilya Sutskever còn khuyến khích ông thoát khỏi đánh giá Amazon, để mô hình học văn bản có quy mô lớn hơn, nội dung đa dạng hơn, thậm chí là toàn bộ internet.
Vấn đề là, với kiến trúc mạng neural thời đó, xử lý lượng dữ liệu khổng lồ như vậy có thể mất vài năm.
Nhưng chẳng bao lâu sau, OpenAI đón nhận vận may. Bởi vì năm 2017, bài báo của Google đã viết lại tiến trình AI "Attention Is All You Need", ra đời.

Ilya ngay lập tức nhìn trúng kiến trúc Transformer. Phản ứng đầu tiên của ông là: "Đây chính là thứ chúng ta đang chờ đợi!"
Alec ngay lập tức kết nối Transformer vào đường hướng thử nghiệm trước đó. Ông lấy bộ dữ liệu BooksCorpus, bao gồm hơn 7000 cuốn sách tiếng Anh chưa chính thức xuất bản, thể loại trải dài từ tình yêu, phiêu lưu đến kỳ ảo.
So với nhiều bộ dữ liệu khác mà câu bị đảo lộn, sách giữ lại được cốt truyện dài liên tục, phù hợp hơn để mô hình học mối quan hệ xa giữa các văn bản trước sau.
Ông không dùng Transformer để dịch máy như Google, mà để nó dự đoán từ tiếp theo có khả năng xuất hiện nhất.
Máy móc đã phản ứng: một từ, rồi một từ, rồi một từ nữa — mỗi từ mới đều được suy luận từ các mô hình ẩn trong bảy nghìn cuốn sách đó.
Với Alec, "Tiến bộ đạt được trong hai tuần này, nhiều hơn tổng tiến bộ của hai năm trước cộng lại". Bộ thử nghiệm này cuối cùng trở thành nền tảng tiền huấn luyện cho GPT-1.
Ông và đồng nghiệp bắt đầu bàn về một hướng gọi là "Big Transformer": Đừng thiết kế thêm quy tắc tinh xảo cho mô hình, hãy trực tiếp mở rộng quy mô mô hình, dữ liệu và tính toán, xem nó còn học được gì nữa.
Năm 2018, hướng đi này có tên chính thức:
Generative Pre-trained Transformer (Mô hình Transformer Tiền huấn luyện Sinh), viết tắt là GPT.
Bài báo GPT đầu tiên có bốn tác giả, đứng đầu chính là Alec Radford.

GPT-1 không ngay lập tức gây chấn động thế giới, nhưng nó mang lại cho OpenAI một thứ quan trọng hơn: Phương hướng.
Sau khi Alec đột phá, ban lãnh đạo OpenAI đã đưa ra một loạt quyết định then chốt. Họ bắt đầu thu hẹp tài nguyên nghiên cứu từ các dự án phân tán như robot, tập trung vào mô hình ngôn ngữ.
So với việc tiếp tục thiết kế cấu trúc mới phức tạp, nhóm sẵn sàng thu thập nhiều dữ liệu hơn, đầu tư nhiều khả năng tính toán hơn, tiếp tục phóng đại phương pháp đã cho thấy tiềm năng.
Một năm sau, GPT-2 ra mắt.
Số tham số của nó tăng từ 117 triệu của GPT-1 lên 1,5 tỷ, dữ liệu huấn luyện cũng mở rộng từ hơn 7000 cuốn sách lên khoảng 8 triệu trang web.
Bài báo GPT-2 có 6 tác giả, Alec vẫn đứng đầu, và cùng với Jeffrey Wu là đồng tác giả chính.

Lần này, mô hình không cần phải huấn luyện lại cho từng nhiệm vụ. Chỉ bằng cách dự đoán từ tiếp theo, nó đã có thể thử dịch, hỏi đáp và tóm tắt, thậm chí đạt kết quả không tệ trong nhiều bài kiểm tra zero-shot.
Đầu năm 2020, OpenAI viết mối quan hệ này vào bài báo "Luật mở rộng của Mô hình Ngôn ngữ Neural".
Alec cũng nằm trong số 10 tác giả. Những phán đoán trước đó dựa vào tích lũy từ lần thử nghiệm này đến lần khác, bắt đầu được mô tả thành quy luật toán học có thể dự đoán.

Tháng 5 cùng năm, OpenAI mở rộng mô hình lên 175 tỷ tham số, tạo ra GPT-3.
Lúc này, số tác giả bài báo đã tăng từ 4 người của GPT-1 lên 31 người.
Tác giả chính trở thành Tom Brown, Alec xếp thứ 29, chỉ đứng trước Ilya Sutskever và Dario Amodei.

Sự thay đổi vị trí ký tên cũng ám chỉ sự thay đổi tính chất của dự án GPT.
Nó không còn là thử nghiệm của một vài người do Alec dẫn dắt, mà là dự án lớn do OpenAI huy động nghiên cứu, kỹ thuật và khả năng tính toán cùng hoàn thành.
Hướng đi mà Alec thúc đẩy sớm nhất, đã trở thành chiến lược công nghệ quan trọng nhất của công ty này.
Nhưng ngay khi GPT bắt đầu được thế giới bên ngoài biết đến, sắp tạo ra ảnh hưởng to lớn, thì Alec lại đã hướng ánh mắt sang nơi khác.
Ngoài ngôn ngữ, ông lại liên tiếp đặt cược vào hình ảnh và giọng nói
Sau khi GPT-3 ra mắt, Alec trở lại với chuyên môn cũ của mình: Hình ảnh.
Ngay từ trước khi gia nhập OpenAI, tác phẩm có ảnh hưởng nhất của ông chính là DCGAN.

Ông cùng Luke Metz, Soumith Chintala đưa mạng tích chập vào GAN, giải quyết vấn đề loại mô hình này khó huấn luyện ổn định.
Họ còn phát hiện, khi mô hình học tạo ảnh phòng ngủ, nó sẽ tự hình thành biểu diễn thị giác về giường, cửa sổ và cấu trúc cảnh.
Trực giác xuất hiện lặp đi lặp lại trong nghiên cứu của Alec sau này, lúc này đã lộ dạng:
Chỉ cần tìm được một nhiệm vụ huấn luyện đủ phổ quát, mô hình có thể trong quá trình hoàn thành nhiệm vụ, tự học ra nhiều khả năng hơn.
Thực ra, giữa chừng còn có một tin đồn.
Năm 2016, Jensen Huang tại hội nghị của Nvidia trưng bày hình ảnh do DCGAN tạo ra, nhưng lại quy phần lớn công lao cho phòng thí nghiệm Facebook do Yann LeCun lãnh đạo khi đó.

Alec và vài người bạn ngồi trong văn phòng Boston xem trực tiếp, rất tổn thương.
Không lâu sau, Alec rời Boston, gia nhập OpenAI.
Bạn của ông Victoroff thậm chí cho rằng, việc bị bỏ qua lần này là một nguyên nhân quan trọng khiến Alec quyết định đến OpenAI.
Vài năm sau, ông mang GPT trở lại với hình ảnh.

Năm 2020, OpenAI ra mắt Image GPT: Biến hình ảnh thành một chuỗi pixel, rồi giống như dự đoán từ tiếp theo, dự đoán pixel tiếp theo.
Alec xếp thứ hai trong danh sách tác giả bài báo.
Nó chứng minh, GPT không tự nhiên thuộc về ngôn ngữ. Chỉ cần dữ liệu có thể được biểu diễn thành chuỗi, cùng một bộ phương pháp cũng có thể dùng để học hình ảnh.
Chỉ việc tạo ra từng pixel một thực sự quá chậm. Nửa năm sau, DALL·E nén ảnh thành Token thị giác, sau đó đặt văn bản và hình ảnh vào cùng một chuỗi Transformer.

"Ghế bành hình quả bơ", "Em bé củ cải dắt chó đi dạo", những tổ hợp chưa từng tồn tại này lần đầu tiên được mô hình vẽ ra.
Cùng ngày ra mắt với DALL·E, còn có CLIP.
Lần này, Alec lại trở về vị trí đồng tác giả chính.
OpenAI lấy 400 triệu cặp văn bản-hình ảnh thu thập từ internet, để mô hình chỉ làm một câu hỏi trắc nghiệm: Đoạn văn bản nào và bức ảnh nào là một cặp?

Không có danh mục cố định, cũng không huấn luyện chuyên biệt cho từng nhiệm vụ.
Cuối cùng, CLIP trong khi không sử dụng tập huấn luyện ImageNet, độ chính xác nhận dạng zero-shot đã tương đương với ResNet-50 được huấn luyện có giám sát thời kỳ đầu.
Ngoài hình ảnh, ông cũng thử nghiệm âm thanh.
Jukebox năm 2020 nén âm thanh thành mã hóa rời rạc, rồi để Transformer tạo nhạc giống như tạo văn bản.
Hai năm sau, cùng một hướng đi dẫn đến Whisper thiết thực hơn.
Alec lại xếp đầu danh sách tác giả bài báo.

OpenAI thu thập 680 nghìn giờ âm thanh và văn bản tương ứng từ internet, dữ liệu không hoàn hảo, nhưng bao gồm ngôn ngữ, giọng điệu, tiếng ồn và ngữ cảnh sử dụng khác nhau.
Whisper không được tối ưu hóa cho một bảng xếp hạng cụ thể nào, nhưng khi kiểm tra zero-shot trên nhiều bộ dữ liệu khác nhau, nó lại thể hiện ổn định hơn, đối phó tốt hơn với giọng điệu, tiếng ồn nền và từ vựng chuyên ngành trong thế giới thực.
Những công việc này bề mặt trải dài qua hình ảnh, ngôn ngữ, đa phương thức và giọng nói, nhưng đằng sau lại bắt nguồn từ cùng một phán đoán của Alec:
Quy định ít quy tắc hơn, cung cấp nhiều dữ liệu và khả năng tính toán hơn, khả năng phổ quát có thể tự xuất hiện.
Ông dường như luôn có thể sớm hơn sự đồng thuận ngành một bước, tìm ra nhiệm vụ đơn giản tiếp theo đáng để mở rộng.
Người đàn ông bí ẩn nhất OpenAI
Quá khứ huy hoàng của các đại gia, không thể kể hết, phần giới thiệu đến đây là kết thúc.
Quay lại với bản thân ông, hầu như có thể nói là "từng là" người đàn ông bí ẩn nhất OpenAI.
So với ảnh hưởng của các bài báo, Alec hầu như không xây dựng thương hiệu cá nhân.
Mặc dù có tài khoản X, sở hữu 70 nghìn người theo dõi, nhưng ông ít khi đăng về bản thân, chủ yếu là chuyển tiếp.

Bài đã ghim trên đầu, đến nay vẫn là tin nhắn khi phát hành GPT-1 năm 2018.
"Đây là việc tôi đã làm trong suốt một năm qua."

Ông liệt kê ba nguồn cảm hứng CoVe, ELMo và ULMFiT, sau đó dùng một câu khá mộc mạc giới thiệu thành quả:
"Một mô hình ngôn ngữ Transformer, chỉ cần điều chỉnh một chút, có thể được chuyển sang các nhiệm vụ xử lý ngôn ngữ tự nhiên khác nhau."
Ai có thể ngờ, công việc này báo trước một kỷ nguyên hoàn toàn mới?
Về các cuộc phỏng vấn dài công khai của Alec, rất ít ỏi; còn trang web cá nhân của ông, cũng đơn giản đến mức gần như trống rỗng.

Chỉ có tên, "Latest Posts" và nút phân trang, hầu như không có nội dung khác.
(Ngay cả ảnh cũng dùng mãi một tấm, đại gia quá khiêm tốn)
Điều này tạo nên một sự tương phản kỳ lạ với vị thế ngành của ông.
Công chúng nói về OpenAI và GPT, nghĩ đến đầu tiên là Sam Altman và Ilya Sutskever; nhưng các nhà nghiên cứu nói về các bài báo then chốt trong mười năm qua, lại khó mà bỏ qua Alec Radford.
Sam Altman trong cuộc phỏng vấn mới nhất miêu tả, nếu hỏi những người từng làm việc với Alec, tất nhiên họ sẽ nói trước:
Đây là một "thiên tài mấy chục năm có một", nhà tư duy cực kỳ sáng tạo, có hiểu biết cực sâu về nghiên cứu của mình.

Nhưng trước khi nói xong, mỗi người đều sẽ bổ sung thêm một câu khác:
Ông ấy cũng là một trong những người tốt bụng nhất, tuyệt vời nhất mà họ từng hợp tác.
One More Thing
Tuy nhiên, người cha GPT này được đánh giá siêu cao, trong nghiên cứu khoa học thực sự khá khác thường...
Tháng 12 năm 2024, Alec rời khỏi OpenAI sau gần chín năm làm việc, theo đuổi nghiên cứu độc lập.
Nhưng khi tất cả mọi người đều mong đợi ông tạo ra GPT tiếp theo thì —
Alec chạy đi làm một "AI ông cụ".

Tháng 4 năm nay, ông cùng Nick Levine, David Duvenaud ra mắt Talkie.
Đây là một "mô hình ngôn ngữ cổ" có 13 tỷ tham số, mô hình cơ bản được huấn luyện với 260 tỷ Token.
Ngữ liệu tiền huấn luyện của nó có một quy tắc cứng:
Tài liệu tiếng Anh xuất bản sau ngày 1 tháng 1 năm 1931, nhất loạt không! được! vào!
Vì vậy, nó đã đọc về động cơ hơi nước, máy bay và Thế chiến thứ nhất, nhưng không biết tivi, internet và những gì xảy ra sau Thế chiến thứ hai.
Càng không thể biết Python.

Nhưng chỉ với một cổ vật như vậy, các nhà nghiên cứu cho nó xem vài ví dụ chương trình Python, rồi để nó giải bài lập trình HumanEval.
Nó thực sự viết được vài đoạn mã đơn giản.
Thử nghiệm này thực sự kiểm tra: Một mô hình ngôn ngữ chưa từng tiếp xúc với máy tính hiện đại, sau khi nhận được một lượng nhỏ ví dụ mới và huấn luyện hậu kỳ, có thể hấp thụ một kỹ năng hoàn toàn xa lạ với tốc độ nhanh thế nào?
Cái gì? Ý bạn là nói khi cả mạng internet vẫn đang Scaling dữ trữ, tìm cách để mô hình đọc nhiều hơn...
Người cha GPT lại phản tay "cắt mạng" nó gần một trăm năm??
Nếu mô hình chưa thấy đáp án, vẫn có thể học ngay dùng ngay, vậy nó dựa vào trí nhớ, hay là học?
Cũng không biết đại gia lần này, rốt cuộc lại đặt cược trước vào thứ gì...
Nhưng theo thông lệ của ông, khi thế giới bên ngoài cuối cùng đã hiểu câu hỏi này, bản thân ông có lẽ đã chạy đi làm câu tiếp theo rồi~

Liên kết tham khảo:
[1]https://x.com/InvestLikeBest/status/2086849947119333878?s=20
[2]https://www.wired.com/story/what-openai-really-wants/
[3]https://www.bostonglobe.com/2023/06/10/business/how-couple-olin-college-students-helped-spark-ai-chatbot-revolution/
[4]https://www.newyorker.com/books/under-review/can-sam-altman-be-trusted-with-the-future
Bài viết này đến từ tài khoản công chúng WeChat "量子位", tác giả: 关注前沿科技






