# Bài viết Liên quan Đào tạo

Trung tâm Tin tức HTX cung cấp những bài viết mới nhất và phân tích chuyên sâu về "Đào tạo", bao gồm xu hướng thị trường, cập nhật dự án, phát triển công nghệ và chính sách quản lý trong ngành tiền kỹ thuật số.

Giáo sư Stanford phát trực tiếp quá trình huấn luyện mô hình lớn 535B, 'hộp đen' đằng sau quá trình huấn luyện mô hình đang được mở ra?

Giáo sư Stanford Percy Liang và nhóm của ông đang thực hiện huấn luyện công khai mô hình ngôn ngữ lớn Marin 535B-A23B với 535 tỷ tham số, và toàn bộ quá trình này được phát trực tiếp. Mô hình sử dụng 11 hệ thống GB200 NVL72 (khoảng 792 GPU), được huấn luyện trên 18,75 nghìn tỷ token trong khoảng 3 tháng. Nhóm đã thực hiện các thử nghiệm quy mô nhỏ trước đó để dự đoán và gỡ lỗi. Dự án này cho phép bất kỳ ai theo dõi trực tiếp các đường cong huấn luyện, cấu hình, dữ liệu và nhật ký thông qua các nền tảng như Weights & Biases và GitHub. Điều này được coi là một bước đột phá trong việc mở "hộp đen" của huấn luyện mô hình lớn, vốn thường được các phòng thí nghiệm AI hàng đầu giữ kín. Cộng đồng nhiệt liệt hưởng ứng vì tính minh bạch và giá trị giáo dục, coi đây là tinh thần mã nguồn mở thực thụ. Người dùng có thể học hỏi, thảo luận các chi tiết kỹ thuật (như biến động của router_bias trong MoE) ngay trong quá trình huấn luyện. Giáo sư Liang cũng giảng dạy khóa học "CS336: Language Models From Scratch", củng cố mục tiêu chia sẻ kiến thức xây dựng mô hình ngôn ngữ lớn cho tất cả mọi người.

marsbitHôm qua 13:12

Giáo sư Stanford phát trực tiếp quá trình huấn luyện mô hình lớn 535B, 'hộp đen' đằng sau quá trình huấn luyện mô hình đang được mở ra?

marsbitHôm qua 13:12

AI không thông minh hơn con người, mà là chịu thua, Nhà toán học đoạt giải Fields chỉ rõ 10 thành tựu của OpenAI

Trong bài viết, nhà toán học Timothy Gowers, người đoạt giải Fields, phân tích về mười thành tựu toán học gần đây của OpenAI, đặc biệt là việc mô hình AI Astra của họ đã đưa ra phản ví dụ cho "Giả thuyết khoảng cách đơn vị trên mặt phẳng Erdős" tồn tại 80 năm. Gowers chỉ ra rằng phản ứng ban đầu của giới toán học là sốc, nhưng sau khi xem xét kỹ lưỡng, nhiều chuyên gia nhận thấy phương pháp AI sử dụng không hoàn toàn mới; một chuyên gia phù hợp cũng có thể tìm ra nếu có gợi ý. Điều này dẫn đến luận điểm chính của ông: lợi thế của AI không nằm ở việc thông minh hơn con người, mà ở khả năng "chịu thua" – nó có thể thử nghiệm hàng trăm con đường một cách nhanh chóng và kiên trì với chi phí thất bại thấp, trong khi con người bị giới hạn bởi thời gian và nguồn lực. Bài viết phân biệt tám phương pháp tìm kiếm ví dụ hoặc phản ví dụ trong toán học. Gowers đánh giá AI hiện rất mạnh trong bốn phương pháp mang tính thử nghiệm, hệ thống hoặc dựa trên dữ liệu có sẵn. Tuy nhiên, AI vẫn gặp khó khăn với các vấn đề có "cây tìm kiếm" phức tạp, đòi hỏi khả năng "cắt tỉa" – tức là phán đoán trực giác về hướng nào đáng để theo đuổi và hướng nào nên từ bỏ sớm. Sự thiếu sót này xuất phát từ việc dữ liệu huấn luyện chỉ chứa các chứng minh "thành phẩm" đã được gọt giũa, thiếu mất thông tin về quá trình thử-sai và đấu tranh tư duy thực sự. Đồng quan điểm, nhà toán học Terence Tao chỉ ra rằng văn bản toán học do AI tạo ra thường thiếu "ma sát tự nhiên" – những điểm dừng, nhấn mạnh ở các bước khó – vốn là manh mối quan trọng giúp con người hiểu được cấu trúc sâu của vấn đề. Gowers kết luận rằng để AI thực sự vượt qua ngưỡng cửa sáng tạo trong toán học, nó không chỉ cần giải quyết các vấn đề riêng lẻ mà phải tạo ra những phương pháp mới mạnh mẽ, mở ra cả một hướng nghiên cứu mới cho cộng đồng, giống như bước đột phá trong bài toán "cap-set" năm 2016. Chìa khóa cho sự tiến bộ này có thể nằm ở việc thiết kế lại hàm thưởng trong huấn luyện, không chỉ khen thưởng kết quả cuối cùng mà còn phải trừng phạt việc tìm kiếm kém hiệu quả hoặc sao chép đơn giản, từ đó thúc đẩy quá trình tư duy thực sự.

marsbit08/17 13:09

AI không thông minh hơn con người, mà là chịu thua, Nhà toán học đoạt giải Fields chỉ rõ 10 thành tựu của OpenAI

marsbit08/17 13:09

Ngay lập tức! Mô hình đầu tiên của Ilya vừa được tiết lộ

Bài viết tiêu đề "Vừa rồi! Mô hình đầu tiên của Ilya lộ diện" thảo luận về tin đồn rằng Ilya Sutskever, cựu nhà khoa học trưởng của OpenAI và đồng sáng lập SSI, có thể sắp công bố mô hình AI đầu tiên sau hai năm im hơi lặng tiếng. Thông tin được một người dùng X có tên "三只草莓" (Ba quả dâu) tiết lộ, cho biết SSI đang phát triển một "công cụ suy luận nhỏ" dựa trên TTT (Test-Time Training - Huấn luyện tại thời điểm kiểm tra). Mô hình này được mô tả là học cách "học như thế nào" từ dữ liệu chuyên biệt, sau đó cập nhật một phần trọng số trong quá trình giải quyết vấn đề, cho phép nó cạnh tranh với các mô hình được huấn luyện quy mô lớn hơn. Nguồn tin còn cho biết phiên bản hiện tại đã sẵn sàng và nhóm đang mở rộng quy mô lên gấp 10 lần cho thế hệ tiếp theo, với khả năng một phiên bản sớm có thể ra mắt vào tháng 8 này. Bài viết liên kết tin đồn này với ba manh mối công khai: 1. Quan điểm của Ilya trong một podcast tháng 11/2023 về việc một siêu trí tuệ thực sự cần có khả năng học liên tục sau khi triển khai, giống như một thiếu niên 15 tuổi thông minh. 2. Thông báo hợp tác chiến lược và đầu tư lớn từ NVIDIA vào SSI vào tháng 7/2024, trong đó NVIDIA đề cập đến một hướng nghiên cứu bí mật mà họ đã xem xét. 3. Sự tiến bộ của nghiên cứu TTT trong hai năm qua, như được minh họa trong một bài báo có tên "End-to-End Test-Time Training for Long Context". TTT cho phép mô hình tự điều chỉnh khi đối mặt với dữ liệu mới trong quá trình suy luận, khác biệt với các phương pháp chỉ mở rộng ngữ cảnh hay sử dụng công cụ bên ngoài. Thách thức chính của TTT được chỉ ra là vấn đề an toàn - làm thế nào để ngăn mô hình học những thứ sai lệch hoặc quên đi khả năng cũ sau khi cập nhật. Người tiết lộ tuyên bố Ilya đã giải quyết vấn đề này, phù hợp với chữ "S" (Safe - An toàn) trong tên SSI. Bài viết kết luận bằng cách nhấn mạnh uy tín của Ilya như một nhà nghiên cứu tiên phong (đằng sau AlexNet, mô hình Sequence-to-Sequence, AlphaGo, GPT) và sự tò mò của cộng đồng AI về dự án bí ẩn của ông. Nếu tin đồn là thật, SSI có thể không chỉ tạo ra một mô hình ngôn ngữ lớn khác, mà là một hệ thống có thể tự thay đổi và học hỏi trong khi hoạt động.

marsbit08/13 08:30

Ngay lập tức! Mô hình đầu tiên của Ilya vừa được tiết lộ

marsbit08/13 08:30

Scaling Mới Trong Mô Hình Văn Bản-Tạo-Ảnh, Được Phát Hiện Bởi Đội Seed Của ByteDance

Nghiên cứu của ByteDance Seed Team phát hiện rằng việc mở rộng độ dài mô tả (caption) trong mô hình sinh ảnh từ văn bản không tự động mang lại nhiều thông tin hình ảnh hữu ích hơn. Thay vào đó, lượng thông tin hình ảnh thực sự được ràng buộc trong caption mới là yếu tố dự đoán chính xác hơn về hiệu suất huấn luyện của mô hình khuếch tán. Để giải quyết vấn đề này, nhóm đề xuất "Structured Prompt" (SP) - một định dạng JSON có cấu trúc tổ chức thông tin hình ảnh thành các lớp: toàn cục, phần tử và quan hệ. Điều này giúp giảm sự mơ hồ và cung cấp sự giám sát rõ ràng hơn cho mô hình, từ đó cải thiện khả năng "khả khuếch tán" (Diffusability). Ngoài ra, nhóm cũng tập trung vào "khả năng nhắc lệnh" (Promptability) bằng cách đào tạo LLM để chuyển đổi yêu cầu người dùng thành SP chất lượng cao. Hệ thống kết hợp SP-trained diffuser và LLM prompter được đào tạo cho thấy sự cải thiện đáng kể, đặc biệt trong các nhiệm vụ sinh ảnh phức tạp, có tính tổ hợp và đòi hỏi kiến thức thế giới, vượt trội so với các hệ thống chỉ sử dụng caption tự nhiên thông thường. Nghiên cứu nhấn mạnh rằng, song song với việc mở rộng quy mô mô hình, việc nâng cao chất lượng và cấu trúc của điều kiện văn bản đầu vào là một hướng đi quan trọng để cải thiện khả năng của mô hình sinh ảnh từ văn bản.

marsbit08/12 03:20

Scaling Mới Trong Mô Hình Văn Bản-Tạo-Ảnh, Được Phát Hiện Bởi Đội Seed Của ByteDance

marsbit08/12 03:20

Vị trí mới trong ngành robot: 'Bác sĩ chỉnh hình' thu nhập 6.000 tệ mỗi tháng, chuyên trị tay chân gãy hỏng

Vào lúc 9h20 tối, Triệu Tân xuất hiện trên livestream Douyin để dạy sửa chữa robot và chó máy. Lượt xem mỗi buổi phát sóng khoảng 1700 người. Số lượng robot hình người và chó máy đang bùng nổ. IDC dự báo năm 2025 toàn cầu xuất xưởng khoảng 18.000 robot hình người, trong khi một quan chức Bộ Công nghiệp Trung Quốc dự đoán sản lượng năm 2026 có thể vượt 100.000 chiếc. Thị trường sửa chữa và bảo dưỡng cũng theo đó mà mở rộng. Triệu Tân, xuất thân từ kỹ thuật xây dựng và dịch vụ, tự học sửa robot. Anh nhấn mạnh **kỹ thuật sửa chữa robot không cao**. Công việc chủ yếu là xác định lỗi qua mô tả và mã lỗi trên app, sau đó thay thế linh kiện hỏng. Độ phức tạp thấp hơn so với sửa drone hay robot hút bụi. Tuy nhiên, **khó khăn lớn nhất là linh kiện bị độc quyền bởi nhà sản xuất**, không có linh kiện phụ, thiếu sơ đồ mạch, khiến việc sửa chữa và chi phí thay thế trở nên đắt đỏ. **Sửa chữa bên thứ ba rẻ và nhanh hơn**. Sau khi hết bảo hành (thường 1 năm), chi phí sửa tại hãng cao, thời gian kéo dài trên một tháng. Các cửa hàng bên thứ ba có giá rẻ hơn 20-50%, thời gian chỉ khoảng một tuần. Khách hàng chủ yếu là các công ty cho thuê robot và blogger phục vụ biểu diễn giải trí. **Hiện tại, sửa chữa robot khó có thể là nghề chính** do số lượng robot hư hỏng cần sửa còn ít. Các cơ sở này thường có "nghề chính" khác như đào tạo, sửa drone, robot hút bụi, hoặc cho thuê robot. Nhiều cơ sở đã mở **khóa đào tạo sửa chữa robot** với thời gian từ 8 đến 40 ngày, học phí 5.000 - 30.000 tệ. Phần lớn học viên tốt nghiệp làm các vị trí bán hàng, vận hành, bảo trì cơ bản hơn là sửa chữa chuyên sâu. **Mức lương trong ngành**: Người mới khoảng 6.000 - 8.000 tệ/tháng, thợ lành nghề có thể trên 10.000 tệ/tháng, tùy khu vực. Các vị trí phát triển phần mềm thứ cấp (secondary development) yêu cầu cao hơn, thường cần bằng đại học. Các đại gia như JD.com cũng đang lên kế hoạch đào tạo số lượng lớn kỹ sư robot. Tuy nhiên, ngành sửa chữa robot vẫn là một thị trường cần thời gian để phát triển.

marsbit08/10 05:35

Vị trí mới trong ngành robot: 'Bác sĩ chỉnh hình' thu nhập 6.000 tệ mỗi tháng, chuyên trị tay chân gãy hỏng

marsbit08/10 05:35

Vừa Rồi, OpenAI Lộ Thông Tin GPT-6, Đồn Đoán 10 Nghìn Tỷ Tham Số, Ép Phát Hành Vào Tháng 8

Vừa qua, thông tin về GPT-6 (còn gọi là Astra) của OpenAI đã gây chấn động. Theo tiết lộ từ phóng viên AI nội bộ ChrisGPT, dù chịu áp lực kiểm duyệt, mô hình siêu khổng lồ này với thông số kỹ thuật được đồn đoán lên tới 10 nghìn tỷ tham số – gấp 5 lần GPT-4 – vẫn sẽ được ra mắt trong tháng 8/2026. Tuy nhiên, Astra mới chỉ là màn mở đầu. OpenAI được cho là đang ấp ủ "quái vật" thực sự có tên mã Doug, dự kiến ra mắt muộn nhất vào tháng 11. Doug được huấn luyện tiền kỹ trên cơ sở hạ tầng điện toán cực mạnh, có khả năng khiến Fable của Anthropic trở nên lỗi thời. Động thái này được xem là bước đột phá quan trọng, đánh dấu việc OpenAI cuối cùng cũng vượt qua "bức tường huấn luyện tiền kỹ" sau hơn 2 năm. Bối cảnh cạnh tranh trở nên nóng bỏng khi Anthropic cũng lên kế hoạch ra mắt Fable 5.1 trong tháng 8 để đối đầu trực tiếp với Astra. Trong khi đó, sự ra đi của các nhân vật chủ chốt tại Google DeepMind khiến cuộc đua AI tiên phong giờ đây chủ yếu là cuộc chiến song phương giữa OpenAI và Anthropic. Với hai lá bài Astra và Doug, OpenAI đang cố gắng khẳng định lại vị thế dẫn đầu tuyệt đối của mình.

marsbit08/10 00:23

Vừa Rồi, OpenAI Lộ Thông Tin GPT-6, Đồn Đoán 10 Nghìn Tỷ Tham Số, Ép Phát Hành Vào Tháng 8

marsbit08/10 00:23

Lương trăm nghìn đô la săn thợ điện, Meta vội vàng tự mở trường dạy nghề

Cuộc đua AI đang vấp phải nút thắt mới: thiếu hụt nghiêm trọng lao động lành nghề như thợ điện và công nhân xây dựng để xây dựng các trung tâm dữ liệu quy mô lớn. Tại Mỹ, dự báo cần thêm 130.000 thợ điện và 240.000 công nhân xây dựng từ 2023-2030 cho hạ tầng AI, trong khi mỗi năm có 80.000 vị trí thợ điện không thể lấp đầy. Các công ty AI sẵn sàng trả lương cao (thợ điện giỏi có thể kiếm 240.000-280.000 USD/năm), nhưng sự chậm trễ xây dựng vẫn gây thiệt hại hàng chục triệu USD. Độ phức tạp của các trung tâm dữ liệu AI, với công suất điện khổng lồ, hệ thống phân phối điện và làm mát phức tạp, đòi hỏi lao động có kỹ năng đặc biệt. Để giải quyết, các gã khổng lồ công nghệ như Meta và Google đang đầu tư hàng trăm triệu USD vào đào tạo. Meta mở trường dạy nghề miễn phí, cung cấp cả trợ cấp sinh hoạt, trong khi OpenAI hợp tác với công đoàn xây dựng. Chiến dịch tuyển dụng nhắm đến cả học sinh trung học, góp phần làm tăng mạnh tỷ lệ Gen Z theo học trường nghề. Tuy nhiên, nhu cầu điện cho AI tiếp tục bùng nổ, chiếm phần ngày càng lớn trong tổng tiêu thụ điện và đẩy giá điện lên cao. Một nghịch lý tồn tại: các dự án xây dựng cần hàng nghìn lao động cùng lúc, nhưng khi hoàn thành chỉ cần số ít vận hành, dẫn đến rủi ro dư thừa lao động lành nghề trong tương lai.

marsbit08/03 02:22

Lương trăm nghìn đô la săn thợ điện, Meta vội vàng tự mở trường dạy nghề

marsbit08/03 02:22

6.7 vạn vị trí thiếu hụt nhân tài bán dẫn phía sau: Cuộc chơi chính sách công nghiệp Mỹ và gợi ý cho Trung Quốc

Mỹ đang thúc đẩy sản xuất chất bán dẫn trở lại với hơn 7700 tỷ USD đầu tư, nhưng đối mặt với nguy cơ thiếu hụt khoảng 67.000 lao động kỹ thuật và kỹ sư vào năm 2030. Vấn đề không chỉ nằm ở kỹ sư thiết kế chip hàng đầu mà còn ở cả kỹ thuật viên vận hành nhà máy. Mặc dù mức lương trong ngành cao hơn trung bình, việc thu hút nhân tài vẫn khó do yếu tố địa điểm nhà máy, lịch làm việc và dịch vụ công đi kèm. Các trường cao đẳng cộng đồng đang đóng vai trò quan trọng trong việc đào tạo kỹ thuật viên tại địa phương, nhưng cần sự hợp tác chặt chẽ với doanh nghiệp về cơ sở vật chất và chương trình đào tạo. Trong khi đó, việc bổ sung kỹ sư trình độ cao gặp thách thức về thời gian đào tạo và sự cạnh tranh từ các ngành khác như AI. Các chính sách đề xuất bao gồm mở rộng giáo dục STEM, đào tạo nghề và cả cải cách nhập cư cho lao động có kỹ năng. Bài học cho Trung Quốc là cần coi nguồn cung nhân lực như một phần của cơ sở hạ tầng công nghiệp, cần phối hợp ngay từ giai đoạn lập dự án. Cần chú trọng đào tạo nghề cho vị trí kỹ thuật và xây dựng hệ sinh thái (nhà ở, giáo dục, y tế) xung quanh các cụm công nghiệp để giữ chân người lao động. Trọng tâm cuối cùng phải là xây dựng một hệ thống đào tạo và cung cấp nhân tài bền vững tại địa phương, thay vì chỉ dựa vào việc thu hút nhân tài từ bên ngoài.

marsbit07/29 00:54

6.7 vạn vị trí thiếu hụt nhân tài bán dẫn phía sau: Cuộc chơi chính sách công nghiệp Mỹ và gợi ý cho Trung Quốc

marsbit07/29 00:54

Định giá 10 tỷ USD, Nvidia rót vốn lớn! Prime Intellect đang gột rửa nhãn Web3?

Công ty cơ sở hạ tầng AI Prime Intellect, thành lập năm 2024, vừa công bố hoàn thành vòng gọi vốn Series A 130 triệu USD với định giá 1 tỷ USD. Vòng này do Radical Ventures dẫn đầu, với sự tham gia hiếm có của các quỹ đầu tư thuộc NVIDIA, Intel và Dell. Công ty tuyên bố doanh thu hàng năm hóa (ARR) đã vượt 100 triệu USD với hơn 6000 khách hàng doanh nghiệp. Ban đầu có liên hệ với Web3, Prime Intellect hiện tập trung vào AI thuần túy. Nền tảng của họ cung cấp giải pháp toàn diện để huấn luyện và tối ưu hóa mô hình AI, đặc biệt là mô hình tác tử (agentic), mà không yêu cầu doanh nghiệp tự xây dựng cụm GPU đắt đỏ. Hợp tác sâu với các gã khổng lồ phần cứng như NVIDIA thể hiện qua việc tích hợp kiến trúc phần mềm-phần cứng, sử dụng hệ thống NVIDIA Blackwell và khung suy luận NVIDIA Dynamo. Các cột mốc kỹ thuật bao gồm việc phát hành các mô hình INTELLECT được huấn luyện phân tán toàn cầu và ra mắt nền tảng Prime Intellect Lab. Một trường hợp điển hình là công ty fintech Ramp đã sử dụng Lab để huấn luyện mô hình con xử lý truy vấn FastAsk, cho kết quả chính xác và nhanh hơn trong tác vụ chuyên biệt. Mặc dù con số ARR ấn tượng cần lưu ý về cách tính dựa trên tốc độ doanh thu hiện tại hơn là doanh thu thực tế cả năm, nhưng Prime Intellect đã chứng minh được sự chuyển mình từ một dự án nghiên cứu sang một nền tảng cơ sở hạ tầng AI toàn ngăn xếp có khách hàng thực tế, hướng tới mục tiêu thương mại hóa rõ ràng.

Foresight News07/13 02:35

Định giá 10 tỷ USD, Nvidia rót vốn lớn! Prime Intellect đang gột rửa nhãn Web3?

Foresight News07/13 02:35

活动图片