# Bài viết Liên quan Transformer

Trung tâm Tin tức HTX cung cấp những bài viết mới nhất và phân tích chuyên sâu về "Transformer", bao gồm xu hướng thị trường, cập nhật dự án, phát triển công nghệ và chính sách quản lý trong ngành tiền kỹ thuật số.

10000 giờ dữ liệu con người, đào tạo ra mô hình hành động thế giới ẩn toàn thân di động đầu tiên trên thế giới

Trong hai năm qua, trọng tâm cạnh tranh trong lĩnh vực robot hình người đã chuyển từ phần cứng sang khả năng mô hình. Công ty trí tuệ thể hiện Zhizai Wujie đã ra mắt **Being-M0.7**, mô hình hành động thế giới ngầm (Latent World-Action Model) toàn thân đầu tiên trên thế giới dành cho thao tác di chuyển của robot hình người. Mô hình này được đào tạo trước trên hơn 10.000 giờ dữ liệu đa phương thức tập trung vào con người, sau đó được điều chỉnh với một lượng nhỏ dữ liệu trình diễn robot thực tế. Being-M0.7 giải quyết ba thách thức chính: chi phí thu thập dữ liệu robot cao, tính toán tốn kém của các mô hình dự đoán pixel và sự thiếu phối hợp giữa thao tác tay và di chuyển. Kiến trúc Vision-Motion Mixture of Transformers (MoT) cho phép mô hình sử dụng chung ba loại dữ liệu: dữ liệu ghép cặp video-chuyển động, video thuần túy và chuỗi chuyển động thuần túy. Nó cũng sử dụng một biểu diễn chuyển động thống nhất giữa người và robot, tập trung vào đầu, bàn tay và bàn chân để thu hẹp khoảng cách hình thái. Bốn bản demo robot thực tế cho thấy khả năng của Being-M0.7 trong các nhiệm vụ đầy thách thức: vớt cá trong bể (tương tác chất lỏng), lấy vật qua gương (suy luận không gian), di chuyển và sắp xếp đồ vật (nhiệm vụ dài), và mang hộp tránh chướng ngại vật (né tránh có tải). Các thử nghiệm so sánh cho thấy hiệu suất vượt trội so với các mô hình cạnh tranh trong một số nhiệm vụ. Phương pháp này tách biệt lập kế hoạch thế giới tần số thấp với điều khiển hành động tần số cao, cho phép robot tạo ra và điều chỉnh hành động phối hợp toàn thân dựa trên quan sát, phản hồi thời gian thực và dự đoán tương lai. Con đường công nghệ từ Being-H (thao tác khéo léo) đến Being-M (di chuyển & thao tác) nhấn mạnh việc học từ dữ liệu hành vi con người quy mô lớn trước khi chuyển giao kiến thức sang robot, cung cấp một khuôn khổ có thể mở rộng để vượt qua vấn đề khan hiếm dữ liệu thể hiện và hướng tới trí tuệ thể hiện tổng quát hơn.

marsbit07/15 01:51

10000 giờ dữ liệu con người, đào tạo ra mô hình hành động thế giới ẩn toàn thân di động đầu tiên trên thế giới

marsbit07/15 01:51

Biến đổi Cấu trúc Transformer, LLM Trở Nên Thông Minh Hơn

Năm 2026, khi ngành công nghiệp mô hình lớn tập trung vào việc nhồi nhét nhiều tham số hơn, một nghiên cứu mới từ Mila, Đại học Cornell và Đại học Montréal đặt ra câu hỏi ngược lại: Điều gì xảy ra nếu chỉ di chuyển các tham số hiện có mà không thêm bất kỳ tham số nào? Bài báo có tên "Tapered Language Models" (TLM) chỉ ra rằng các lớp trong kiến trúc Transformer truyền thống không quan trọng như nhau. Các nghiên cứu về thoát sớm, cắt tỉa lớp và khả năng giải thích đã cho thấy các lớp đầu nắm bắt thông tin cơ bản (như ngữ pháp), trong khi các lớp sau xử lý thông tin cấp cao hơn (như ngữ nghĩa) và thường chỉ "nhấn mạnh lại" các phán đoán hiện có. Thay vì phân bổ tham số đồng đều cho tất cả các lớp, nhóm nghiên cứu đề xuất một thiết kế "hình nón": giảm dần đều chiều rộng của mạng chuyển tiếp (FFN) - thành phần lưu trữ và xử lý thông tin chính của mỗi lớp - từ đầu đến cuối mô hình, trong khi vẫn giữ nguyên tổng số tham số và lượng tính toán. Thử nghiệm trên mô hình Transformer 440M tham số cho thấy, với đường cong giảm dần dạng cosine (chiều rộng đầu gấp 1.5 lần cơ sở, chiều rộng cuối là 0.5 lần), điểm perplexity cải thiện tới 1.84 điểm so với mô hình cơ sở phân bổ đồng đều. Kết quả tích cực này được khẳng định lại trên ba kiến trúc khác (mô hình chú ý có cổng, Hope-attention, Titans) ở quy mô 760M và 1.3B tham số, trên nhiều nhiệm vụ đánh giá như suy luận thường thức và dự đoán ngôn ngữ, mà không làm giảm khả năng xử lý ngữ cảnh dài. Nghiên cứu chứng minh việc phân bổ dung lượng "não bộ" của mô hình một cách có chủ đích - tập trung nhiều hơn vào các lớp đầu nơi xử lý thông tin đa dạng - là một đòn bẩy hiệu quả gần như miễn phí. Phương pháp này mở ra hướng đi mới không chỉ cho mô hình ngôn ngữ mà còn cho các mô hình Thị giác Transformer, khuếch tán và đa phương thức vốn kế thừa thiết kế phân bổ đồng đều truyền thống.

marsbit06/29 12:55

Biến đổi Cấu trúc Transformer, LLM Trở Nên Thông Minh Hơn

marsbit06/29 12:55

Tám người cha đẻ của Transformer, hiện nay họ ở đâu?

Biên tập bởi Panda. Tám tác giả của bài báo nền tảng "Attention Is All You Need" (2017) - kiến trúc Transformer đã định hình AI hiện đại - giờ đây đều đã rời Google. Họ đang theo đuổi những con đường khác nhau: **Jakob Uszkoreit:** Đồng sáng lập Inceptive, tập trung vào thiết kế RNA và dược phẩm bằng AI. **Ashish Vaswani:** Đồng sáng lập Essential AI (mô hình Rnj-1), có thông tin đang được Nvidia tuyển dụng. **Noam Shazeer:** Đồng sáng lập Character.AI, trở lại Google rồi lại chuyển sang OpenAI. **Niki Parmar:** Từ Essential AI chuyển sang Anthropic, tham gia phát triển Claude. **Llion Jones:** Đồng sáng lập Sakana AI tại Tokyo, nghiên cứu mô hình hợp tác kiểu bầy đàn. **Aidan N. Gomez:** Đồng sáng lập Cohere, tập trung vào AI cho doanh nghiệp và chủ quyền số. **Łukasz Kaiser:** Ở lại môi trường nghiên cứu thuần túy tại OpenAI, đóng góp cho GPT-4 và mô hình suy luận. **Illia Polosukhin:** Đồng sáng lập giao thức blockchain NEAR, hướng tới nền kinh tế tác nhân AI. Dù phân tán, họ đều chia sẻ quan điểm rằng Transformer không phải là điểm kết thúc. Thách thức lớn tiếp theo là tìm ra một kiến trúc mới vượt trội hơn hẳn. Cuộc hành trình tìm kiếm câu trả lời tiếp theo cho tương lai AI vẫn tiếp diễn.

marsbit06/28 05:34

Tám người cha đẻ của Transformer, hiện nay họ ở đâu?

marsbit06/28 05:34

Sự ra đi liên tiếp của nhân tài AI tại Google: Áp lực thử nghiệm hay dự báo "tử chiến"?

Các tài năng AI hàng đầu của Google như Noam Shazeer (đồng tác giả Transformer), John Jumper (AlphaFold) và Daniel De Freitas (Character.AI) lần lượt rời đi để gia nhập OpenAI và Anthropic, gây ra những lo ngại về làn sóng chảy máu chất xám. Tuy nhiên, góc nhìn khác cho rằng đây là cuộc chiến tranh giành nhân tài điển hình trước thềm IPO của các đối thủ, và việc họ nhắm vào Google chứng tỏ đây vẫn là nguồn nhân lực AI dồi dào bậc nhất. Thay vì một "cáo phó", đây là bài kiểm tra áp lực dành cho Google. Công ty không chỉ cạnh tranh ở mặt mô hình (Gemini) mà còn có lợi thế toàn diện: cơ sở hạ tầng (TPU, Google Cloud), hệ sinh thái sản phẩm với hàng tỷ người dùng (Search, YouTube, Android), và nguồn thu ổn định. Đáng chú ý, Google còn là đối tác cung cấp hạ tầng đám mây cho chính các đối thủ như Anthropic và OpenAI, vừa cạnh tranh vừa hợp tác. Dù phải đối mặt với thách thức chuyển đổi từ kinh doanh tìm kiếm cốt lõi và sự nhanh nhẹn của các startup, Google với nguồn lực khổng lồ, khả năng tích hợp AI sâu rộng vào các sản phẩm hiện có và tham vọng dài hạn trong AI cho khoa học (như AlphaFold) vẫn được xem là một trong số ít công ty có khả năng vượt qua giai đoạn chuyển đổi này và định hình tương lai AI.

marsbit06/21 08:57

Sự ra đi liên tiếp của nhân tài AI tại Google: Áp lực thử nghiệm hay dự báo "tử chiến"?

marsbit06/21 08:57

Mất hai huyền thoại trong ba ngày: Con đập nhân tài AI của Google đang vỡ?

Chỉ trong ba ngày, Google đã chứng kiến hai huyền thoại AI rời đi: Noam Shazeer (đồng tác giả Transformer, lãnh đạo Gemini) gia nhập OpenAI, và John Jumper (người đoạt giải Nobel Hóa học 2024, lãnh đạo AlphaFold) chuyển sang Anthropic. Đây không phải là trường hợp cá biệt mà là một xu hướng rõ ràng, bổ sung cho việc cựu thành viên sáng lập OpenAI Andrej Karpathy gia nhập Anthropic trước đó. Các tài năng AI hàng đầu đang tập trung ngày càng nhiều vào OpenAI và Anthropic, khiến Google trở thành nguồn cung cấp chính trong cuộc tái cấu trúc nhân tài này. Sự dịch chuyển này bắt nguồn từ sự khác biệt cốt lõi về sứ mệnh. Google, với doanh thu chính phụ thuộc vào quảng cáo, thường đặt các dự án AI trong khuôn khổ phục vụ mục tiêu sản phẩm và lợi nhuận. Ngược lại, OpenAI (với sứ mệnh AGI) và Anthropic (tập trung vào AI an toàn) cho phép các nhà nghiên cứu tập trung hoàn toàn vào việc đẩy xa giới hạn năng lực mô hình. Ngoài ra, cơ hội thu lợi nhuận lớn từ cổ phiếu trước thềm IPO của hai công ty này là động lực hấp dẫn mà Google - một gã khổng lồ trưởng thành - khó có thể sánh được. Việc sáp nhập Google Brain và DeepMind vào năm 2023 cũng tạo ra những lực ly tâm mới, làm xói mòn văn hóa nghiên cứu dài hạn dưới áp lực phải phù hợp với lộ trình sản phẩm. Sự ra đi của các nhân vật then chốt như Jumper và Shazeer phản ánh điều này. Cuộc khủng hoảng nhân tài này mang tính cấu trúc. Google có thể sở hữu cơ sở hạ tầng máy tính khổng lồ và kho dữ liệu đồ sộ, nhưng việc thiếu những bộ óc xuất sắc nhất để khai thác chúng khiến lợi thế đó trở nên vô nghĩa. Trong khi OpenAI và Anthropic củng cố vị thế với đội ngũ tinh nhuệ ngày càng mạnh, Google đang mất dần hào quang là trung tâm hấp dẫn nhân tài AI toàn cầu. Trong cuộc đua mà mật độ tài năng quyết định năng lực mô hình và thị phần, đây là một thách thức tồn vong thầm lặng nhưng nghiêm trọng của Google.

marsbit06/20 04:05

Mất hai huyền thoại trong ba ngày: Con đập nhân tài AI của Google đang vỡ?

marsbit06/20 04:05

Cả mạng ca ngợi Noam gia nhập, nhưng hóa đơn thua lỗ của OpenAI lại dày thêm một trang

OpenAI công bố tuyển dụng Noam Shazeer - "cha đẻ Transformer" - làm người đứng đầu nghiên cứu kiến trúc, được cộng đồng mạng hoan nghênh. Tuy nhiên, dữ liệu tài chính được kiểm toán cho thấy một bức tranh ảm đạm: năm 2025, doanh thu đạt 13,07 tỷ USD nhưng lỗ hoạt động lên tới 20,92 tỷ USD, lỗ ròng gần 39 tỷ USD. Quý I/2026, họ đốt 3,7 tỷ USD tiền mặt, vượt quá một nửa doanh thu cùng kỳ. Bài viết chỉ ra rằng việc thuê Noam, người từng được Google trả 2,7 tỷ USD để quay lại, giống một "giao dịch lo lắng". OpenAI đang mất nhân tài nghiên cứu cốt lõi (như Karpathy, Ilya) và chuyển trọng tâm sang lặp lại sản phẩm. Hốt hoảng tài chính bắt nguồn từ chi phí khổng lồ: phí thuê điện toán từ Microsoft (10,59 tỷ USD năm 2025), chi phí suy luận và tiếp thị. Trong khi đó, 9 tỷ người dùng hoạt động hàng tuần chỉ có 50 triệu người trả tiền, biến người dùng miễn phí thành gánh nặng chi phí. Đối thủ Anthropic cho thấy lối đi khác: tập trung vào khách hàng doanh nghiệp (chiếm ~80% doanh thu), kiểm soát chi phí, và được báo cáo là đã có quý đầu tiên sinh lời. OpenAI, ngược lại, dường như đang sử dụng câu chuyện "thiên tài" về Noam để hỗ trợ định giá cao ngất cho đợt IPO sắp tới, chuyển rủi ro thua lỗ sang các nhà đầu tư thị trường thứ cấp. Câu hỏi then chốt là: liệu kiến trúc mới của Noam có thể cứu doanh nghiệp đang đốt tiền mặt với tốc độ chóng mặt này kịp thời không, hay nó chỉ là một chú thích trong câu chuyện định giá? Sổ sách kế toán không quan tâm đến thiên tài, mà chỉ quan tâm đến việc công ty còn bao nhiêu quý để chờ đợi.

marsbit06/19 02:29

Cả mạng ca ngợi Noam gia nhập, nhưng hóa đơn thua lỗ của OpenAI lại dày thêm một trang

marsbit06/19 02:29

Tin Nóng, Người Đồng Phụ Trách Gemini Của Google Bị OpenAI Tuyển Dụng

Ngày 19/6, nhà nghiên cứu Noam Shazeer của Google DeepMind, đồng lãnh đạo dự án Gemini, chính thức gia nhập OpenAI với vai trò Trưởng nhóm nghiên cứu kiến trúc. Ông sẽ phụ trách khám phá kiến trúc thế hệ AI mới và thúc đẩy sự phát triển tiếp theo của kiến trúc Transformer. Shazeer là một nhân vật huyền thoại, một trong những tác giả chính của bài báo năm 2017 "Attention Is All You Need", đặt nền móng cho kiến trúc Transformer - cốt lõi của các mô hình lớn hiện đại như GPT, Gemini, Claude. Trước đó, ông từng rời Google để đồng sáng lập Character.AI vào năm 2021. Năm 2024, Google đã ký một thỏa thuận trị giá khoảng 27 tỷ USD để đưa Shazeer và một phần đội ngũ trở lại DeepMind, nơi ông trở thành đồng lãnh đạo Gemini. Việc chuyển sang OpenAI của Shazeer được xem là một tổn thất lớn đối với Google và là một bước tăng cường quan trọng cho OpenAI trong cuộc cạnh tranh khốc liệt với Anthropic. Nhiệm vụ của ông tại OpenAI là nghiên cứu hướng đi mới cho kiến trúc AI sau thời đại Transformer. Sự kiện này phản ánh cuộc chiến tranh giành nhân tài cấp cao ngày càng gay gắt giữa các gã khổng lồ AI.

marsbit06/18 04:21

Tin Nóng, Người Đồng Phụ Trách Gemini Của Google Bị OpenAI Tuyển Dụng

marsbit06/18 04:21

Mất 10 năm, cuối cùng Sam Altman cũng có được người mà ông muốn

Sau 2 năm trở lại Google với thỏa thuận trị giá 2,7 tỷ USD, Noam Shazeer - một trong những tác giả của kiến trúc Transformer mang tính bước ngoặt - đã chính thức rời công ty để gia nhập OpenAI. Trong thông báo trên X, Shazeer bày tỏ lòng tự hào về những gì đã xây dựng tại Google nhưng cũng bày tỏ sự hào hứng khi được hợp tác với đội ngũ tại OpenAI. CEO Sam Altman của OpenAI tiết lộ rằng ông đã muốn làm việc cùng Shazeer từ khi thành lập công ty, và phải mất 10 năm mới có được cơ hội này. Shazeer sẽ đảm nhận vị trí Trưởng nhóm Nghiên cứu Kiến trúc tại OpenAI. Mark Chen, Trưởng bộ phận Nghiên cứu của OpenAI, nhấn mạnh những đóng góp to lớn của Shazeer trong các lĩnh vực như Transformer, mô hình hỗn hợp chuyên gia (MoE) và giải mã hiệu quả, đồng thời tin tưởng vào tầm nhìn của ông về phát triển AGI an toàn. Việc Shazeer, từng là đồng lãnh đạo kỹ thuật của dự án Gemini tại Google, chuyển sang đối thủ cạnh tranh trực tiếp được coi là một tổn thất nhân sự lớn đối với Google. Nhiều ý kiến trong cộng đồng cho rằng điều này có thể ảnh hưởng đến nỗ lực phát triển Gemini, trong khi một số khác coi đây là một "thỏa thuận mua lại" cực kỳ có lợi cho OpenAI. Sự kiện này làm nổi bật cuộc chiến tranh giành nhân tài khốc liệt trong ngành AI.

marsbit06/18 04:16

Mất 10 năm, cuối cùng Sam Altman cũng có được người mà ông muốn

marsbit06/18 04:16

Alumni TH Thanh Hoa U00 tuổi Vương Quan ra tác phẩm mới: Dùng 1/900 token, 1/432 sức tính toán, làm đảo lộn mô hình tiền huấn luyện Transformer

Cựu sinh viên Thanh Hoa 00 hậu Vương Quan và nhóm nghiên cứu công bố mô hình HRM-Text, một phương pháp huấn luyện tiền ngôn ngữ hiệu quả sử dụng Mô hình tuần hoàn phân tầng (HRM) thay thế Transformer tiêu chuẩn. Với chỉ 1B tham số và được huấn luyện trên 40B token duy nhất, chi phí ước tính khoảng 1500 USD, HRM-Text đạt hiệu suất tương đương các mô hình nguồn mở từ 2B đến 7B tham số trên các bài kiểm tra chuẩn như MMLU (60.7%) và GSM8K (84.5%). Phương pháp này tiết kiệm đáng kể tài nguyên: sử dụng ít hơn từ 100-900 lần token huấn luyện và 96-432 lần ước tính tính toán so với baseline tiêu chuẩn. Thiết kế chính bao gồm: kiến trúc HRM với module H (chậm) và L (nhanh) cho phép cập nhật đệ quy nhiều lượt trên cùng một token để tăng độ sâu tính toán; và mục tiêu huấn luyện tập trung vào các cặp chỉ dẫn-câu trả lời, chỉ tính toán mất mát trên phần trả lời với cơ chế che PrefixLM. Thử nghiệm cho thấy HRM vượt trội về hiệu quả kiến trúc và ổn định huấn luyện so với Transformer ở cùng quy mô FLOPs. Các hướng phát triển tương lai bao gồm tách biệt "kiến thức" và "suy luận", cơ chế thời gian tính toán thích ứng, xác thực khả năng mở rộng quy mô hơn nữa, và tối ưu hóa việc triển khai PrefixLM trong các framework suy luận thực tế.

marsbit05/26 03:18

Alumni TH Thanh Hoa U00 tuổi Vương Quan ra tác phẩm mới: Dùng 1/900 token, 1/432 sức tính toán, làm đảo lộn mô hình tiền huấn luyện Transformer

marsbit05/26 03:18

活动图片