Nhà nghiên cứu OpenAI: Chúng tôi đều không đọc bài báo nghiên cứu nữa

marsbitXuất bản vào 2026-08-09Cập nhật gần nhất vào 2026-08-09

Tóm tắt

Một nghiên cứu viên của OpenAI nhận xét rằng các nhà nghiên cứu tại các phòng thí nghiệm tiên phong gần như không đọc bài báo khoa học nữa, chỉ trích ba hội nghị hàng đầu chứa quá nhiều sự cường điệu và gian lận. Một đánh giá quy mô lớn từ SAI (Science Audit Institute) trên 168 bài báo trình bày trực tiếp (Oral) tại ICML 2026 cho thấy kết quả đáng báo động: chỉ 104 bài có mã nguồn mở và 105 bài được tái hiện đầy đủ. Trong số đó, chỉ 34 bài tái hiện được hơn 40% luận điểm chính, và chỉ 8 bài đạt tỷ lệ tái hiện trên 80%. Các vấn đề phổ biến bao gồm mã không chạy được, thiếu file, hướng dẫn không đầy đủ, kết quả không khớp với bài báo, và một số mô hình phụ thuộc đã ngừng hoạt động. Chi phí để tái chạy thí nghiệm cho một bài báo Oral trung bình là 8.900 USD, với 17 bài vượt quá 100.000 USD và bài đắt nhất lên tới gần 2,2 triệu USD. Điều này khiến việc kiểm chứng độc lập trở nên cực kỳ khó khăn, tạo ra một môi trường mà "nghiên cứu kém chất lượng có lợi nhuận cao nhưng rủi ro thấp", vì các bài báo có vấn đề vẫn dễ dàng được chấp nhận, trích dẫn và trở thành công cụ xin việc. Mặc dù các chuyên gia trong ngành có thể ít dựa vào bài báo, nhưng chính những bài báo này vẫn là thước đo quan trọng để sinh viên và nhà nghiên cứu trẻ chứng minh năng lực, xin học bổng tiến sĩ, vị trí giảng dạy hay việc làm tại các phòng thí nghiệm lớn. Điều này tạo ra nghịch lý: giá trị truyền tải tri thức của bài báo bị nghi ngờ, nhưng giá trị trong cạnh tranh nghề nghiệp thì vẫn nguyên vẹn.

Người trong phòng thí nghiệm tiên phong hầu như không đọc bài báo nữa?

Một nhà nghiên cứu của OpenAI đã "bắn tổng" ba hội nghị hàng đầu bằng một câu nói:Quá nhiều sự thổi phồng và gian lận!

Nguyên nhân sự việc, là một bài báo ICLR có hiệu quả tốt đến mức khó tin, sau khi cư dân mạng nghiên cứu kỹ mới phát hiện ra "bí quyết" trong đó.

Đăng bài ở hội nghị hàng đầu đã "tiến hóa" thành như vậy sao?

Thứ nhất xem mã nguồn có mở không, thứ hai xem trong phương pháp thí nghiệm có giấu "mánh khóe" gì không, thứ ba mới xem kết quả chạy ra có đủ sức hỗ trợ luận điểm chính không—— sau từng tầng chất vấn như vậy, rốt cuộc có bao nhiêu bài báo hội nghị hàng đầu chịu được kiểm tra?

Thực sự có người đã làm như vậy.

Trong 105 bài, chỉ có 8 bài "đạt tiêu chuẩn"

Tháng 7 năm nay, SAI do phó giáo sư khoa học máy tính và khoa học dữ liệu Tan Chenhao của Đại học Chicago đồng sáng lập, đã công bố một lần "thẩm định bằng thí nghiệm" quy mô lớn.

Họ chọn ra, là tất cả 168 bài báo Oral của ICML 2026.

Năm nay ICML tổng cộng nhận được 23918 bài nộp, cuối cùng chỉ có 168 bài đạt tiêu chuẩn Oral, chiếm khoảng 0.7%.

Nói cách khác, những gì SAI kiểm tra đã là tầng cao nhất được sàng lọc từ hơn hai vạn bài nộp.

Ngoài việc đọc phương pháp, thiết kế thí nghiệm và kết quả của bài báo giống như người thẩm định truyền thống, SAI Review còn tải mã nguồn, mô hình và dữ liệu, cấu hình môi trường và chạy thí nghiệm, cuối cùng đối chiếu kết quả chạy với bài báo gốc từng hạng mục.

SAI đã thẩm tra tất cả 168 bài Oral, trong đó chỉ có 104 bài báo mở mã nguồn, cuối cùng hoàn thành việc phục hiện đầy đủ 105 bài.

Trong đó,chỉ có 34 bài phục hiện được trên 40% tuyên bố; tỷ lệ phục hiện vượt 80%, chỉ còn lại 8 bài.

Dù mỗi bài báo ít nhất chứa 1, 3 hay 5 tuyên bố có thể kiểm chứng, trung vị điểm phục hiện luôn ở mức 28%—30%, phân bố tổng thể thay đổi không lớn.

Loại trừ thí nghiệm chưa chạy, dừng sớm hoặc vượt quá khả năng phần cứng, trung vị điểm phục hiện vẫn chỉ có 42%—50%; khi mỗi bài báo ít nhất chứa 3 tuyên bố có thể kiểm chứng, trung vị ổn định ở mức 42%.

Các vấn đề thường gặp nhất trong phục hiện đều gặp phải: mã nguồn không thể chạy, thiếu tệp, hướng dẫn không đầy đủ, phụ thuộc bị hỏng, hoặc kết quả chạy từ mã nguồn không khớp với bài báo.

Còn có 4 bài báo phụ thuộc vào mô hình đã ngừng hoạt động. Nhà nghiên cứu sau này dù sẵn lòng tốn tiền, tốn thời gian, cũng không thể thu được kết quả giống nhau.

SAI còn liệt kê hai ví dụ cụ thể hơn.

Một bài báo lấy "chỉ huấn luyện 0.77% tham số của mô hình cơ bản" làm điểm bán hàng chính, nhưng checkpoint thực tế công bố lại huấn luyện 6.31% tham số, khoảng 8 lần con số tuyên bố.

Một bài báo khác trình bày bảng độ tin cậy do mô hình trọng tài chấm điểm,nhưng trong mã nguồn mở lại không tìm thấy mô hình trọng tài này, cũng không có script nào có thể tính ra con số trong bảng.

Bài báo chất lượng kém, lợi nhuận cao rủi ro thấp

Kết quả phục hiện của SAI có thể nói là khá tồi tệ.

Tồi tệ hơn là, vấn đề phát hiện ở đây chỉ là vấn đề "có điều kiện mới phát hiện được".

Những bài báo không có mã nguồn, trực tiếp trở thành "bất khả xâm phạm".

Mà ngay cả khi mã nguồn công khai hoàn toàn, muốn xác minh một bài báo, thời gian, tinh lực và tiền bạc bỏ ra đều là khổng lồ, kết quả cuối cùng còn không như ý, không biết sẽ sụp đổ đến mức nào.

Theo ước tính của SAI dựa trên giá công khai theo yêu cầu của Google Cloud, chi phí trung vị để chạy lại hoàn toàn một bài báo Oral ICML vào khoảng 8900 USD. Trong 105 bài báo, 17 bài vượt quá 100 nghìn USD, bài đắt nhất gần 2.2 triệu USD.

Bài báo càng phụ thuộc vào tính toán quy mô lớn, việc phục hiện độc lập càng khó khăn.

Không có mã nguồn, người khác không có cách kiểm tra; có mã nguồn, cũng chưa chắc có người chi trả nổi chi phí này.

Do đó, một bài báo có vấn đề hoàn toàn có thể thuận lợi vượt qua thẩm định, nhận được trích dẫn, rồi được viết vào CV, đổi lấy cơ hội nhập học, chức vụ giảng dạy hoặc công việc ở phòng thí nghiệm lớn.

Ngẫu nhiên có người phát hiện kết quả không khớp, hội nghị cũng hiếm khi xem xét lại, bài báo cũng chưa chắc bị rút.

Đây chính là điều bình luận gọi là "nghiên cứu tồi có lợi nhuận, nhưng hầu như không có hậu quả".

Không đọc bài báo, nhưng tuyển dụng thì xem bài báo

Trong lĩnh vực mô hình lớn, thực sự có nhiều tiến bộ thực sự quan trọng không còn xuất hiện dưới dạng bài báo.

Là kỹ sư của OpenAI, đứng ở tuyến đầu ngành công nghiệp, có cảm nhận như vậy không khó hiểu. Xét cho cùng có năng lực tính toán dồi dào hơn, phản hồi thí nghiệm nhanh hơn và nhiều kết quả nội bộ không công khai, có "tư thế không đọc bài báo".

Nhưng nói ra như vậy, có phần hơi tinh tế.

Một bình luận châm biếm người trong công ty công nghệ làm vậy là "lên bờ rồi rút thang": từ trường đại học tuyển nhà nghiên cứu, xây dựng trên thành quả tích lũy công khai của giới học thuật, dùng giá cao hơn cướp nhân tài và GPU, bản thân ngày càng ít chấp nhận đánh giá đồng nghiệp, cuối cùng lại quay đầu tuyên bố nghiên cứu học thuật "chủ yếu là trò lừa đảo"

Hơi chua chát, nhưng thực sự có lý.

Người trong những phòng thí nghiệm tiên phong này có thể "không đọc bài báo", nhưng người muốn vào thì vẫn phải đăng bài trước.

Đối với sinh viên và nhà nghiên cứu trẻ thiếu kinh nghiệm ngành công nghiệp, bài báo hội nghị hàng đầu vẫn là chứng chỉ trực tiếp nhất chứng minh năng lực nghiên cứu.

Xin học tiến sĩ, tìm chức vụ giảng dạy, vào phòng thí nghiệm tiên phong như OpenAI, đều phải dựa vào bài báo để có được sự chú ý.

Người trong giới công nghiệp sau khi vào phòng thí nghiệm lớn xem nhẹ bài báo, nhưng vẫn dùng số lượng bài báo, cấp độ hội nghị và thành tích trích dẫn để sàng lọc người đứng ngoài cửa.

Bài báo do đó rơi vào vị trí khó xử: Độ tin cậy của nó trong truyền bá tri thức bị nghi ngờ, nhưng giá trị trong cạnh tranh nhân tài lại không hề biến mất.

Vì vậy, "phòng thí nghiệm lớn đã không đọc bài báo nữa" nghe có vẻ hơi thanh cao và kiêu ngạo. Bởi vì người thực sự có tư cách không đọc bài báo, thường đã dựa vào bài báo vượt qua ngưỡng cửa đó.

Tất nhiên, không phải tất cả sinh viên đều là phản diện học thuật thiết kế cẩn thận để lừa đảo.

Một nhà nghiên cứu trường đại học nói đùa rằng, ông hy vọng sinh viên của mình đã có khả năng viết ra một bài báo thổi phồng thậm chí gian lận.

Có người đang "tranh nhau làm kẻ lừa đảo học thuật", mà có người còn đang vật lộn với LaTeX.

Tài liệu tham khảo:

https://x.com/MathewShen42/status/2084465434506768867

https://x.com/kellerjordan0/status/2084721463089902074

https://sai.science/blog/how-much-science-is-verifiable

https://x.com/mengyer/status/2085134204786921886

Bài viết từ tài khoản công chúng WeChat "Trái tim máy móc" (ID:almosthuman2014), tác giả: Trái tim máy móc

Câu hỏi Liên quan

QBài nghiên cứu nào đã tiến hành một cuộc 'đánh giá thực nghiệm' quy mô lớn về các bài báo hội nghị ICML 2026?

ATổ chức SAI (Scientific AI), do Phó giáo sư Chenhao Tan của Đại học Chicago đồng sáng lập, đã tiến hành một cuộc 'đánh giá thực nghiệm' quy mô lớn, kiểm tra 168 bài báo Oral của ICML 2026.

QTheo đánh giá của SAI, trong số 105 bài báo ICML Oral được kiểm tra đầy đủ, có bao nhiêu bài đạt tỷ lệ tái hiện trên 80%?

ATheo đánh giá của SAI, chỉ có 8 trong số 105 bài báo ICML Oral được kiểm tra đầy đủ đạt tỷ lệ tái hiện trên 80%.

QMột nhà nghiên cứu OpenAI đã đưa ra nhận xét gì về các hội nghị đỉnh cao (top conference) và tình trạng nghiên cứu?

AMột nhà nghiên cứu OpenAI đã chỉ trích các hội nghị đỉnh cao, cho rằng có quá nhiều sự phóng đại và gian lận trong các bài báo, và thừa nhận rằng những người trong các phòng thí nghiệm tiên phong như của họ hầu như không đọc bài báo nữa.

QBài viết chỉ ra những vấn đề phổ biến nào gặp phải khi cố gắng tái hiện thí nghiệm từ các bài báo hội nghị?

ACác vấn đề phổ biến khi tái hiện bao gồm: mã nguồn không chạy được, tệp tin bị thiếu, hướng dẫn không đầy đủ, các phụ thuộc bị hỏng, hoặc kết quả chạy mã không khớp với kết quả trong bài báo. Một số bài thậm chí phụ thuộc vào mô hình đã ngừng hoạt động.

QBài viết phân tích mâu thuẫn gì trong vai trò của bài báo khoa học đối với cộng đồng nghiên cứu AI hiện nay?

ABài viết chỉ ra một mâu thuẫn: Mặc dù độ tin cậy của bài báo trong việc truyền bá kiến thức bị nghi ngờ (do khó tái hiện, phóng đại, gian lận), nhưng giá trị của chúng trong cuộc cạnh tranh nhân tài (như xin học bổng, vị trí giáo sư, việc làm tại các lab lớn) vẫn không hề suy giảm. Các lab công nghiệp hàng đầu có thể 'không đọc bài báo', nhưng lại dựa vào số lượng và chất lượng bài báo để tuyển dụng người mới.

Nội dung Liên quan

TIN TỨC MỚI NHẤT! Dữ liệu quan trọng nhất về lạm phát tại Mỹ đã được công bố! Đây là phản ứng đầu tiên của Bitcoin (BTC)!

Tin tức mới nhất! Dữ liệu lạm phát quan trọng của Mỹ đã được công bố. Đây là phản ứng đầu tiên của Bitcoin (BTC). Thị trường tài chính toàn cầu hiện đang tập trung vào chỉ số giá tiêu dùng (CPI) của Mỹ, một chỉ báo kinh tế vĩ mô quan trọng có ảnh hưởng đến Bitcoin và tâm lý chấp nhận rủi ro. Điểm then chốt đối với Bitcoin không chỉ là việc dữ liệu cao hay thấp hơn dự kiến, mà còn là tác động của nó đến kỳ vọng về chính sách lãi suất của Cục Dự trữ Liên bang (Fed). Nếu lạm phát cốt lõi thấp hơn dự báo, thị trường có thể kỳ vọng chính sách nới lỏng từ Fed, có khả năng dẫn đến việc mua vào các tài sản rủi ro như Bitcoin. Ngược lại, dữ liệu lạm phát cao hơn có thể khiến Fed thận trọng hơn trong việc cắt giảm lãi suất, có khả năng gây áp lực bán ngắn hạn lên Bitcoin. Dữ liệu CPI của Mỹ cho tháng 7 đã được công bố như sau (so với kỳ vọng và kỳ trước): - CPI hàng năm: 3.4% (dự kiến: 3.4%, trước: 3.5%) - CPI hàng tháng: 0.1% (dự kiến: 0.1%, trước: -0.4%) - CPI cốt lõi hàng năm: 2.5% (dự kiến: 2.5%, trước: 2.6%) - CPI cốt lõi hàng tháng: 0.2% (dự kiến: 0.2%, trước: 0.0%) Bài viết cũng chia sẻ hình ảnh về phản ứng giá đầu tiên của Bitcoin ngay sau khi dữ liệu được công bố. *Đây không phải là lời khuyên đầu tư.

cryptonews.ru21 phút trước

TIN TỨC MỚI NHẤT! Dữ liệu quan trọng nhất về lạm phát tại Mỹ đã được công bố! Đây là phản ứng đầu tiên của Bitcoin (BTC)!

cryptonews.ru21 phút trước

SEC và CFTC cùng ngày kiện Goliath: Lộ diện kẻ lừa đảo tiền mã hóa 400 triệu USD theo mô hình Ponzi, không còn kẽ hở cho các nền tảng dùng lãi cao để kéo người mới

Tác giả: Claude, Shenchao TechFlow Hai cơ quan quản lý Mỹ SEC và CFTC cùng trong ngày 9/7 đã khởi kiện dân sự chống lại Goliath Ventures cùng nhà sáng lập Christopher Delgado, liên quan đến một kế hoạch lừa đảo Ponzi tiền mã hóa trị giá khoảng 400 triệu USD. Theo cáo trạng, Goliath đã huy động ít nhất 397 triệu USD từ khoảng 1600 nhà đầu tư cá nhân với lời hứa lợi nhuận hàng tháng từ 3-10% từ việc cung cấp thanh khoản cho các pool giao dịch tiền mã hóa và đảm bảo hoàn vốn. Tuy nhiên, SEC và CFTC xác định công ty không đầu tư tiền thật vào bất kỳ pool thanh khoản hay giao dịch nào. Thay vào đó, họ sử dụng tiền của nhà đầu tư mới để trả lợi nhuận cho người cũ, đồng thời làm giả số dư tài khoản và báo cáo hiệu suất. Nhà sáng lập Delgado bị cáo buộc chiếm đoạt ít nhất 51 triệu USD cho mục đích cá nhân như mua nhà siêu sang, xe hơi đắt tiền và đồ xa xỉ. Đến tháng 11/2025, mô hình này sụp đổ khi không thể huy động đủ tiền mới để duy trì thanh toán. Đáng chú ý, Delgado đã nhận tội vào ngày 30/6 trước Bộ Tư pháp Mỹ về các tội danh âm mưu gian lận viễn thông, gian lận viễn thông và rửa tiền. Anh ta thừa nhận gây thiệt hại ít nhất 250 triệu USD cho nhà đầu tư và đồng ý bị tịch thu tài sản. Tuy nhiên, khả năng các nhà đầu tư thu hồi được khoản lỗ là rất thấp. Vụ việc này cho thấy sự phối hợp chặt chẽ chưa từng có giữa SEC và CFTC, nhằm loại bỏ khoảng trống quy định mà các nền tảng tiền mã hóa có thể lợi dụng khi tự hỏi sản phẩm của họ là chứng khoán hay hàng hóa. Hành động đồng thời của hai cơ quan gửi đi tín hiệu rõ ràng: các nền tảng dựa vào lãi suất cao, đảm bảo hoàn vốn và mô hình giới thiệu người mới để phát triển đang trở thành mục tiêu chính của giám sát.

marsbit36 phút trước

SEC và CFTC cùng ngày kiện Goliath: Lộ diện kẻ lừa đảo tiền mã hóa 400 triệu USD theo mô hình Ponzi, không còn kẽ hở cho các nền tảng dùng lãi cao để kéo người mới

marsbit36 phút trước

Phố Wall Bắt Đầu Nghi Ngờ Câu Chuyện AI Của Các Gã Khổng Lồ Công Nghệ

Phố Wall đang nghi ngờ câu chuyện AI của các gã khổng lồ công nghệ, chuyển trọng tâm từ câu chuyện tăng trưởng dài hạn sang phân tích kỹ lưỡng khả năng sinh lời và dòng tiền trong ngắn hạn. Sự kiện NVIDIA công bố kế hoạch huy động 5000 tỷ USD cho cơ sở hạ tầng AI cùng phản ứng thận trọng của thị trường cho thấy mối lo ngại về chi phí đầu tư khổng lồ. Báo cáo quý II/2026 của Alphabet (Google) và Microsoft làm nổi bật sự thay đổi này. Dù doanh thu tăng trưởng mạnh, Alphabet ghi nhận dòng tiền tự do (FCF) âm lần đầu tiên do chi tiêu vốn khổng lồ, khiến cổ phiếu giảm. Ngược lại, Microsoft có FCF dương mạnh mẽ cùng tốc độ tăng trưởng doanh thu Azure vững chắc, được thị trường đón nhận tích cực. Điều này cho thấy nhà đầu tư không còn chỉ xem xét nhu cầu hay doanh thu AI, mà đang đánh giá sâu hơn: tốc độ chuyển đổi nhu cầu thành doanh thu, lợi nhuận và tiền mặt có theo kịp tốc độ đầu tư vốn hay không. Áp lực dòng tiền đang trở thành thước đo quan trọng. Một trung tâm dữ liệu xây hôm nay có thể mất hơn một thập kỷ để thu hồi vốn, trong khi chip bên trong có thể bị lỗi thời sau vài năm. Wall Street giờ đây đặt câu hỏi về lợi tức đầu tư vốn (ROIC) trong kỷ nguyên AI, bắt đầu bằng việc sàng lọc thông qua thấu kính dòng tiền tự do.

marsbit39 phút trước

Phố Wall Bắt Đầu Nghi Ngờ Câu Chuyện AI Của Các Gã Khổng Lồ Công Nghệ

marsbit39 phút trước

Vitalik Buterin Đưa Vấn Đề Quyền Riêng Tư Và An Toàn Lượng Tử Lên Vị Trí Cao Hơn Trong Lộ Trình Phát Triển Của Ethereum

Đồng sáng lập Ethereum, Vitalik Buterin, đã chia sẻ một bản so sánh giữa lộ trình cũ của Ethereum và một "Bản phác thảo L1" mới, trong đó nhấn mạnh quyền riêng tư và khả năng chống lại máy tính lượng tử là các lĩnh vực nghiên cứu được ưu tiên cao hơn. Bài đăng chỉ ra một số thay đổi đáng chú ý, bao gồm tập trung nhiều hơn vào các yêu cầu về quyền riêng tư gốc, nonce có khóa, bể giao dịch được bảo vệ, an toàn lượng tử và việc chuyển hướng khỏi cây Verkle sang cây nhị phân Poseidon. Điều quan trọng cần lưu ý là bản phác thảo này là một công cụ nghiên cứu và lập kế hoạch, không phải một cam kết hard fork hay quyết định quản trị cuối cùng. Lộ trình của Ethereum phát triển thông qua nghiên cứu, triển khai và tranh luận cộng đồng. Việc nâng cao mức độ ưu tiên cho quyền riêng tư phản ánh nhu cầu thực tế từ người dùng thông thường, những người không muốn lịch sử tài chính đầy đủ của họ bị công khai. Trong khi đó, việc đẩy mạnh nghiên cứu về an toàn lượng tử cho thấy mạng lưới đang lên kế hoạch dài hạn để bảo vệ chống lại các mối đe dọa mật mã trong tương lai, dù mối đe dọa này hiện chưa cấp bách. Sự thay đổi kỹ thuật từ cây Verkle sang cây nhị phân Poseidon liên quan đến các lựa chọn cấu trúc dữ liệu ảnh hưởng đến khả năng mở rộng và tương thích lâu dài. Điều này cho thấy cộng đồng nghiên cứu đang tinh chỉnh các giả định kỹ thuật, một quá trình bình thường trong sự phát triển của Ethereum. Tóm lại, so sánh này cung cấp một cái nhìn về sự trưởng thành trong các ưu tiên dài hạn của Ethereum, hướng tới mục tiêu trở thành một cơ sở hạ tầng bền vững với quyền riêng tư mạnh mẽ hơn và khả năng chống lại các thách thức tương lai.

bitcoinist56 phút trước

Vitalik Buterin Đưa Vấn Đề Quyền Riêng Tư Và An Toàn Lượng Tử Lên Vị Trí Cao Hơn Trong Lộ Trình Phát Triển Của Ethereum

bitcoinist56 phút trước

Giao dịch

Giao ngay
活动图片