Một nền tảng crowdsourcing chạy việc vặt, từng chào bán mỗi tác vụ với giá vài xu, nhưng lại từng đỡ lưng toàn bộ thời đại học sâu.
Giờ đây, nó sắp đóng cửa.
Amazon vừa thông báo, nền tảng crowdsourcing Mechanical Turk của họ sẽ chính thức ngừng dịch vụ vào ngày 30 tháng 9 năm nay.

Vào thời điểm đỉnh cao, hơn 500,000 người trên nền tảng làm các việc lặt vặt trực tuyến, xem hình ảnh, phân loại, gán nhãn, hoàn thành thủ công từng tác vụ nhỏ mà máy tính lúc đó chưa thể tự học được.
Sau này, thứ "sức mạnh tính toán bằng xương thịt" khổng lồ này đã trực tiếp tham gia và nâng đỡ bộ dữ liệu ImageNet——
Không có MTurk, việc gán nhãn thủ công cho hàng chục triệu hình ảnh trên ImageNet, hầu như là không thể hoàn thành.
Không có ImageNet, Lý Phi Phi có lẽ đã không trở nên nổi tiếng chỉ sau một đêm.
Hinton cùng các học trò của ông đã không trở thành huyền thoại sau một trận chiến, và có lẽ học sâu cũng sẽ không bất ngờ hồi sinh vào năm 2012.
21 năm sau, AI thực thụ ngày càng biết cách tự làm những bài tập này.
Còn những người từng giúp AI giả vờ thông minh ngày đó, cùng với nền tảng này, đã nhận được Thông báo xuống tuyến.
500,000 người làm việc bán thời gian trực tuyến, MTurk tìm người thật “làm thay”
Mechanical Turk (MTurk) ra mắt vào năm 2005.
Thực ra lúc đầu, Amazon chẳng hề nghĩ rằng thứ này sẽ viết lại lịch sử AI gì cả.
MTurk lúc đó giải quyết một vấn đề rất thực tế và kịch tính: có những nhiệm vụ, cực kỳ khó với máy tính, nhưng lại đơn giản vô cùng đối với con người...
Thế là Amazon nghĩ ra một cách rất trực diện: Vì chương trình máy tính không làm được, vậy thì chia nhỏ vấn đề và giao cho người thật làm thôi~
Thế là, những nhiệm vụ nhỏ bị tách ra này được gọi là HIT, tức là Human Intelligence Task (Nhiệm vụ trí tuệ con người).
Ví dụ, một công ty có 10,000 hình ảnh cần phân loại, cách chơi của MTurk là chia trực tiếp thành 10,000 nhiệm vụ độc lập, rồi đồng thời tung lên nền tảng.
100 người có thể cùng làm, 1000 người cũng được, nếu vài chục nghìn người cùng lên mạng, thì càng nhanh hơn.
Nói cách khác, MTurk không phải là khiến một cá nhân làm nhanh hơn, mà là biến một công việc chân tay vốn chỉ có thể làm tuần tự, thành một công việc có thể "chạy song song toàn cầu".
Đúng là phiên bản dữ liệu "vô lăng bay" bằng xương thịt rồi...

Và cái tên Mechanical Turk, bản thân nó cũng khớp với cách "chơi" này.
Vào thế kỷ 18, từng có một cỗ máy người Thổ Nhĩ Kỳ nổi tiếng ở châu Âu, nhìn từ bên ngoài, đó là một cỗ máy có thể tự chơi cờ vua quốc tế, thậm chí còn đấu với Napoleon.
Sau này mọi người mới phát hiện, bên trong cỗ máy luôn ẩn chứa một kỳ thủ người thật!? (Tôi đã quá chủ quan...)
Amazon đem điển tích này lên mạng Internet, gần như khớp hoàn hảo, chương trình bề ngoài có vẻ như đang xử lý tự động, nhưng người thực sự làm việc, lại là những con người phía sau màn hình.
Bezos năm đó đã đặt cho nó một cách nói có thể gọi là ứng nghiệm:
Trí tuệ nhân tạo nhân tạo (artificial artificial intelligence).
Ý tưởng này một khi chạy thông, MTurk nhanh chóng từ một công cụ nội bộ của Amazon, phát triển thành một thị trường crowdsourcing toàn cầu.
Đến năm 2011, MTurk đã tập hợp hơn 500,000 Worker, trải rộng 190 quốc gia.
Người nhiều lên, những việc có thể nhận cũng bắt đầu bùng nổ nhanh chóng: sàng lọc hình ảnh, chuyển giọng nói thành văn bản, phân loại văn bản, làm sạch dữ liệu, đánh giá cảm xúc, kiểm duyệt nội dung.
Miễn là những nhiệm vụ kiểu "máy móc dễ gặp khó, con người chỉ cần vài giây là phán đoán được", đều có thể ném vào đây.
Cứ ném thế, đã 21 năm.
Không có MTurk, sẽ không có ImageNet ngày nay và cuộc cách mạng học sâu
Thời gian quay trở lại khoảng năm 2006.
Lý Phi Phi, vừa mới đến giảng dạy tại Princeton, quyết định làm một việc khá ngược dòng lúc bấy giờ——
Tạo ra một bộ bách khoa toàn thư thị giác đủ lớn cho máy móc.
Lúc đó, các bộ dữ liệu thị giác máy tính chính thường chỉ có vài nghìn đến vài chục nghìn hình ảnh, dữ liệu quá ít, mô hình rất dễ học thành kẻ chỉ biết luyện thi, có thể nhớ các khuôn mẫu trong tập huấn luyện, nhưng lại rất khó thực sự hiểu các vật thể kỳ lạ muôn hình vạn trạng trong thế giới thực.
Thế là nhóm của Lý Phi Phi muốn làm một việc điên rồ lúc bấy giờ: tạo ra một "thế giới thị giác đủ lớn" cho máy móc.
Bộ dữ liệu ImageNet, từ đó ra đời.

ImageNet lấy WordNet làm khung xương, chia thế giới thực thành từng khái niệm, rồi nhét vào dưới mỗi khái niệm hàng trăm, hàng nghìn hình ảnh thực tế.
Chó, xe hơi, táo, ghế, chim, cá... Những thứ có thể định nghĩa được, cố gắng cho vào hết.
Nhưng nhanh chóng, một vấn đề thực tế hơn đập thẳng vào mặt——
Hình ảnh không khó tìm, Google, Yahoo, Flickr đều có thể tìm kiếm được, nhưng cái phiền phức thực sự là những hình tìm về chưa chắc đã đúng, thậm chí là những thứ hoàn toàn không liên quan!!!
Vì vậy, sau khi công cụ tìm kiếm chịu trách nhiệm lôi hình về, vẫn cần con người làm bước cuối cùng: xác nhận từng hình một.
Nói một con số kinh khủng, quy mô hình ảnh ứng viên mà ImageNet sau này cần xử lý, vượt quá 160 triệu hình!!! Lúc này, vấn đề nhân lực hoàn toàn trở thành một nút thắt chết...

Đúng lúc ImageNet sắp bị kéo lại bởi khối lượng công việc sàng lọc hình ảnh khổng lồ, nhóm của Lý Phi Phi đã chuyển hướng sang Amazon Mechanical Turk vừa mới ra mắt.
Nhóm ImageNet bắt đầu chia nhỏ công việc sàng lọc hình ảnh khổng lồ thành các tác vụ vi mô, rồi phân phối cho các Worker toàn cầu trên nền tảng MTurk.
Một cơ sở hạ tầng AI hoành tráng, như vậy đã bị chia thành vô số lần "nhấp chuột" bình thường nhất.
Trong bài báo ImageNet công bố năm 2009 có mô tả, lúc đó bộ dữ liệu đã thu thập 5247 khái niệm, 3.2 triệu hình ảnh đã được chỉnh sửa.
Con số mà nhóm ImageNet đưa ra khi nhìn lại toàn bộ dự án sau này là: 49,000 công nhân MTurk, đến từ 167 quốc gia.
Nói cách khác, đằng sau ImageNet, thứ thực sự chống đỡ công cuộc sàng lọc hình ảnh này, là một đội quân gán nhãn tạm thời trải rộng khắp toàn cầu.
Đây cũng là lý do tại sao không có MTurk, ImageNet năm đó có lẽ thực sự không làm ra được...

Sau khi ImageNet được xây dựng xong, câu chuyện phía sau mới thực sự bắt đầu tăng tốc.
Năm 2010, Cuộc thi ImageNet khai mạc, các mô hình trên toàn thế giới bắt đầu được huấn luyện trên cùng một bộ dữ liệu, rồi thi đấu PK trên cùng một bảng xếp hạng.
Hai năm sau, bộ ba sau này được viết đi viết lại vào lịch sử AI đã xuất hiện——
Geoffrey Hinton của Đại học Toronto, cùng hai học trò của ông là Alex Krizhevsky và Ilya Sutskever.
Ba người đã sử dụng một mạng nơ-ron tích chập sâu để tham gia Cuộc thi Nhận dạng Thị giác Quy mô lớn ImageNet.
Đã đẩy tỷ lệ lỗi Top-5 của Cuộc thi ImageNet năm 2012 xuống còn khoảng 15%, vượt xa các phương pháp truyền thống một đoạn dài.
Điều này cũng khiến toàn bộ cộng đồng thị giác máy tính lần đầu tiên nhìn thấy một cách trực quan như vậy, khi dữ liệu khổng lồ, sức mạnh tính toán GPU và mạng nơ-ron sâu kết hợp với nhau, hiệu quả có thể vượt lên một bậc.

Từ trái sang phải: llya Sutskever, Geoffrey Hinton và Alex Krizhevsky
Từ đó, tên của Alex Krizhevsky được hàn chặt vào AlexNet.
Ilya sau này đến Google Brain, tham gia sáng lập OpenAI và giữ chức vụ Chief Scientist, rời đi sau đó lại sáng lập SSI.
Hinton sau này giành giải Turing, cũng trở thành một trong những giáo phụ được công nhận của học sâu.
Lý Phi Phi thì trở về Stanford giảng dạy, đồng lãnh đạo HAI, và dựa vào ImageNet đã định vị vị trí của mình trong lịch sử thị giác máy tính hiện đại.
Sau này nữa, VGG xuất hiện, GoogLeNet xuất hiện, ResNet xuất hiện.
Bảng xếp hạng ImageNet năm này qua năm khác bị đẩy xuống, học sâu từ thị giác xông thẳng vào giọng nói, rồi tiến vào xử lý ngôn ngữ tự nhiên, cuối cùng đi đến thời đại mô hình lớn ngày nay.
Thế giới này thực sự rất thần kỳ——
Nhóm của Lý Phi Phi mượn MTurk tạo ra ImageNet; ImageNet khiến Lý Phi Phi nổi tiếng; Hinton và các học trò mượn ImageNet trở thành huyền thoại sau một trận chiến; Học sâu lại mượn chiến thắng này tiến tới phục hưng.
Gần 50,000 người bình thường đến từ 167 quốc gia, ngồi trước máy tính, đã từng chút từng chút "nhấp" hàng trăm triệu hình ảnh ứng viên thành ImageNet.
AI cuối cùng cũng biết làm việc, nhưng MTurk lại xuống tuyến trước
Cũng chính vì vậy, việc Mechanical Turk đóng cửa hôm nay, lại càng giống như một vòng khép kín của thời đại.
Cách nói chính thức của Amazon rất kiềm chế, chỉ cho biết liên tục đánh giá các sản phẩm và dịch vụ của mình, do đó quyết định dừng MTurk.
CNBC trước đó dẫn lời Krista Pawloski từ tổ chức bảo vệ quyền lợi công nhân dữ liệu Turkopticon cho biết, MTurk những năm nay liên tục suy thoái, Amazon đầu tư ngày càng ít, các nền tảng gán nhãn dữ liệu thế hệ mới cũng không ngừng chia sẻ công nhân và khách hàng.
Nhưng nguyên nhân trực tiếp hơn, nói thẳng ra thì vẫn là những việc từng có giá trị nhất của nó ngày xưa, giờ AI tự nó ngày càng biết làm...
Năm 2005, bạn bảo máy móc phán đoán trong một bức ảnh có chó hay không vẫn là một bài toán khó chính thống, nhưng giờ đây thực ra đã trở thành nhiệm vụ cơ bản mà mô hình đa phương thức có thể hoàn thành một cách thuận tay.
Đồng thời, nhu cầu của ngành AI đối với "con người" cũng đã thay đổi.
Các mô hình tiên phong cần nhiều hơn các chuyên gia như lập trình viên, bác sĩ, luật sư... để đánh giá mã nguồn, xem xét câu trả lời, kiểm tra suy luận và an toàn.
Vì vậy, các nền tảng mới như Scale AI, Mercor, Prolific... trỗi dậy, bắt đầu sàng lọc và quản lý chuyên gia, cung cấp dữ liệu huấn luyện và đánh giá chuyên nghiệp hơn.
So sánh với mô hình crowdsourcing "ai cũng có thể nhận, mỗi tác vụ vài xu" như MTurk, ngày càng không theo kịp thời đại...

Kỳ ảo hơn nữa, ngay cả chính những công nhân MTurk cũng bắt đầu dùng AI!!!
Một nghiên cứu của học giả Thụy Sĩ năm 2023 phát hiện, trong số các công nhân MTurk được khảo sát, tỷ lệ sử dụng mô hình AI để hoàn thành nhiệm vụ văn bản có thể lên tới 46%.
Vốn dĩ khách hàng trả tiền mua là sự phán đoán của người thật, kết quả có một số công nhân sau khi nhận tác vụ, có thể giao câu hỏi cho mô hình như ChatGPT trả lời.
Chuyện này có chút hài hước đen rồi...
Số phận của MTurk, thực ra cũng là một bức tranh thu nhỏ của AI trong 20 năm qua.
Ban đầu con người ẩn mình sau máy móc, từng hình từng hình nhấp chuột, gom góp vất vả tạo ra ImageNet, cũng đẩy cánh cửa thời đại học sâu mở ra.
Sau này, AI dựa vào những dữ liệu này lớn lên, cuối cùng học được cách tự mình xem hình, nghe âm thanh, viết chữ.
21 năm sau, những người từng giúp AI giả vờ thông minh ngày đó rời sân khấu.
Cỗ máy người Thổ Nhĩ Kỳ "ẩn chứa kỳ thủ người thật" ngày đó, cuối cùng cũng có thể đóng cánh cửa tủ lại.
Tài liệu tham khảo:
[1]https://www.cnbc.com/2026/08/25/amazon-service-that-jeff-bezos-called-artificial-ai-is-shutting-down.html
Bài viết này đến từ tài khoản WeChat công chúng "Lượng Tử Vị" (量子位), tác giả: Mộng Dao





