# Bài viết Liên quan LLM

Trung tâm Tin tức HTX cung cấp những bài viết mới nhất và phân tích chuyên sâu về "LLM", bao gồm xu hướng thị trường, cập nhật dự án, phát triển công nghệ và chính sách quản lý trong ngành tiền kỹ thuật số.

Karpathy mới nhất lên tiếng chỉ trích: Một câu nói khiến cả hội trường các nhà phát triển Agent im bặt

Andrej Karpathy, nhà nghiên cứu cốt cán tại Anthropic, đã gây sốc trong cộng đồng phát triển AI Agent bằng một tuyên bố thẳng thắn: Sai lầm lớn nhất hiện nay là mọi người vội vàng bắt Agent làm việc mà chưa thực sự hiểu rõ các mô hình nền tảng cơ bản. Ông rút ra bài học từ dự án "World of Bits" thất bại năm 2016 tại OpenAI, nơi họ cố gắng tạo Agent điều khiển máy tính. Công cụ khi đó là học tăng cường quá yếu, và ông cho rằng lựa chọn đúng đắn lúc bấy giờ phải là tập trung vào mô hình ngôn ngữ. Karpathy đưa ra ba lời khuyên ngược với xu hướng: 1. Dừng việc ép Agent làm mọi thứ, hãy ưu tiên xây dựng mô hình nền tảng đúng đắn trước. Việc ông gia nhập nhóm tiền huấn luyện tại Anthropic chính là một phiếu bầu cho quan điểm này. 2. Tạo Demo thì dễ, nhưng để biến thành sản phẩm thực sự có thể mất cả thập kỷ, giống như hành trình của xe tự lái hay VR. 3. Agent không phải là sản phẩm; năng lực nền tảng mới là sản phẩm. Xây dựng nền móng vững chắc, và Agent sẽ tự nhiên xuất hiện. Ông cũng gợi ý nên tìm cảm hứng từ khoa học thần kinh, ví dụ như cấu trúc não bộ (hồi hải mã, hạch nền, đồi thị), để hiểu sâu hơn về bản chất của trí tuệ. Điểm đáng chú ý nhất, Karpathy khẳng định rằng tuyến đầu của khả năng Agent không nằm ở các gã khổng lồ như OpenAI hay DeepMind, mà chính là ở các nhà phát triển độc lập và startup. Lý do là trong lĩnh vực Agent, không công ty lớn nào có lợi thế dẫn trước hàng năm trời; mọi người đều ở cùng vạch xuất phát, nơi sự linh hoạt và tốc độ thử nghiệm là lợi thế cạnh tranh. Thông điệp cuối cùng của Karpathy không phải là ngăn cản việc phát triển Agent, mà là cảnh báo không được bỏ qua nền tảng. Ông kêu gọi sự kiên nhẫn đầu tư vào nghiên cứu cơ bản và sẵn sàng cho một cuộc chạy đua dài hạn.

marsbit07/06 02:35

Karpathy mới nhất lên tiếng chỉ trích: Một câu nói khiến cả hội trường các nhà phát triển Agent im bặt

marsbit07/06 02:35

Người nhận giải thưởng đặc biệt Đại học Thanh Hoa, Cố Dục Hiền, gia nhập DeepSeek

Gần đây, DeepSeek đang mở rộng tuyển dụng mạnh mẽ. Trong danh sách tác giả của bài báo nghiên cứu DeepSeek V4 (dự kiến ra mắt giữa tháng này) có sự xuất hiện của **Cố Dục Hiền (Yuxian Gu)**, nghiên cứu sinh tiến sĩ khóa 2021 tại Đại học Thanh Hoa và người nhận được Học bổng Đặc biệt cho Nghiên cứu sinh năm 2025. Được biết, anh đã chính thức gia nhập DeepSeek. Cố Dục Hiền, cựu nghiên cứu sinh tại Nhóm AI Đàm thoại (CoAI) thuộc Đại học Thanh Hoa dưới sự hướng dẫn của Giáo sư Hoàng Dân Liệt, từng nhận học bổng tiến sĩ Apple 2025 và học bổng Ant In-Tech. Nghiên cứu của anh tập trung vào nâng cao hiệu quả trong toàn bộ vòng đời của mô hình ngôn ngữ lớn (LLM), bao gồm ba hướng chính: Lọc dữ liệu tiền huấn luyện (với các công trình như PDS), Cất cánh kiến thức trong nén mô hình (đại diện là MiniLLM), và Kiến trúc mô hình hiệu quả (như Jet-Nemotron). Lượng trích dẫn bài báo khoa học của anh trên Google Scholar đã gần 5.000. Công trình nổi bật Jet-Nemotron của anh, một kiến trúc ngôn ngữ lai mới, đạt độ chính xác ngang bằng các mô hình chú ý đầy đủ tiên tiến nhất (SOTA) nhưng với hiệu suất vượt trội, tăng tốc tạo sinh lên tới 53.6 lần trên GPU H100 ở ngữ cảnh dài. Mô hình MiniLLM trước đó của anh về phương pháp cất cánh kiến thức cũng được áp dụng rộng rãi bởi Google, Alibaba, NVIDIA. Việc Cố Dục Hiền gia nhập DeepSeek được kỳ vọng sẽ mang lại nhiều thành tựu mới cho công ty.

marsbit07/06 02:09

Người nhận giải thưởng đặc biệt Đại học Thanh Hoa, Cố Dục Hiền, gia nhập DeepSeek

marsbit07/06 02:09

Thu nhập 100 triệu đô la mỗi năm, hai bạn cùng phòng Berkeley thế hệ 9x tạo ra mô hình kinh doanh AI sinh lời nhất

Công ty không tạo ra AI nào nhưng kiếm được 100 triệu USD mỗi năm! Đó là Arena, nền tảng bảng xếp hạng và đánh giá mô hình AI khổng lồ, bắt nguồn từ một dự án nghiên cứu mã nguồn mở có tên Chatbot Arena do một nhóm từ UC Berkeley khởi xướng vào năm 2023. Cốt lõi của Arena là một bảng xếp hạng được xây dựng dựa trên hàng chục triệu lượt bình chọn "mù" của người dùng thực. Người dùng nhập prompt, hai mô hình ẩn danh trả lời và họ chọn câu trả lời tốt hơn. Cơ chế "đấu trường" đơn giản này đã thu hút hơn 1000 triệu lượt đánh giá, trở thành điểm tham chiếu quan trọng. Tất cả các gã khổng lồ như OpenAI, Google, Anthropic, Meta đều đưa mô hình hàng đầu của họ lên đây để kiểm tra, thậm chí cả GPT-5 dưới bí danh. Bí quyết kiếm tiền của Arena nằm ở dịch vụ thương mại AI Evaluations, ra mắt tháng 9 năm ngoái. Các công ty phát triển mô hình và doanh nghiệp lớn trả phí để Arena huy động cộng đồng hàng triệu người dùng đánh giá chuyên sâu mô hình của họ, cung cấp phân tích hiệu suất trong thế giới thực mà các bài kiểm tra tiêu chuẩn không có được. Đây là mô hình kinh doanh "bán dụng cụ" trong cơn sốt AI: khi các công ty đua nhau cải thiện mô hình, nhu cầu cho dịch vụ đánh giá và tinh chỉnh sau khi triển khai càng lớn. Dự án này được đồng sáng lập bởi hai bạn cùng phòng tại Berkeley: CEO Anastasios Angelopoulos (chuyên gia học máy) và CTO Wei-Lin Chiang (người đứng sau chatbot mã nguồn mở Vicuna nổi tiếng). Dự án tách ra thành công ty vào mùa xuân 2025, nhanh chóng huy động được 100 triệu USD vốn hạt giống, định giá 6 tỷ USD. Đến tháng 1 năm nay, họ đã hoàn thành vòng gọi vốn Series A 150 triệu USD, định giá 1.7 tỷ USD. Arena không ngừng mở rộng, gần đây ra mắt Chế độ Tác nhân (Agent Mode) để đánh giá các AI thực hiện nhiệm vụ dài, phức tạp như viết mã, nghiên cứu. Arena đặt cược vào một tương lai nơi việc đánh giá khách quan, dựa trên dữ liệu thực tế về hiệu suất AI sẽ ngày càng quan trọng và có giá trị.

marsbit07/06 00:21

Thu nhập 100 triệu đô la mỗi năm, hai bạn cùng phòng Berkeley thế hệ 9x tạo ra mô hình kinh doanh AI sinh lời nhất

marsbit07/06 00:21

Hinton Ca ngợi, Diễn giả Đóng góp Cốt lõi Gemini: Sẽ có Hàng tỷ AI Siêu nhân Cấp Einstein

Adam Brown, nhà vật lý lý thuyết và lãnh đạo nhóm Blueshift tại DeepMind, đã có bài phát biểu tại Viện Vật lý Lý thuyết Perimeter về tương lai của Trí tuệ Nhân tạo Phổ quát (AGI) và vật lý. Ông mô tả sự tiến bộ phi mã của AI, từ trình độ "mẫu giáo" lên "tiến sĩ" chỉ trong vài năm, dựa trên Định luật Mở rộng (Scaling Law) – quy tắc cho thấy hiệu suất mô hình tăng đều đặn khi mở rộng quy mô dữ liệu, tham số và năng lực tính toán. Ông chỉ ra rằng các mô hình ngôn ngữ lớn (LLM) không được lập trình mà được "nuôi dưỡng" thông qua đào tạo trước và tinh chỉnh, cho phép chúng vượt qua hàng loạt bài kiểm tra chuẩn từ toán phổ thông (MATH) đến kỳ thi tiến sĩ (GPQA) và cả các kỳ thi chuyên sâu về thuyết tương đối rộng. Đặc biệt, AI đã đạt trình độ huy chương vàng trong Olympic Toán học Quốc tế (IMO) và gần đây đã tự mình đưa ra phản ví dụ cho một giả thuyết toán học tồn tại 80 năm (Giả thuyết khoảng cách đơn vị của Erdős), đánh dấu bước đột phá nghiên cứu thực sự. Brown so sánh lộ trình phát triển của AI với cờ vua: từ công cụ, đến cộng tác "nhân mã" (con người + AI), và cuối cùng là thời đại siêu nhân nơi AI vượt trội hoàn toàn. Ông dự đoán vật lý sẽ trải qua một kỷ nguyên vàng của sự cộng tác "nhân mã", nơi AI đóng vai trò trợ lý nghiên cứu, gia sư và công cụ lập trình mạnh mẽ. Về lâu dài, với chi phí sao chép gần như bằng không, nhân loại có thể sở hữu hàng tỷ "AI Einstein" siêu cấp hoạt động đồng thời, hứa hẹn giải đáp những câu hỏi cơ bản nhất của khoa học. Mặc dù AI hiện còn hạn chế về tính tự chủ và khả năng lập kế hoạch, Brown tin rằng sự tiến bộ sẽ tiếp tục và những năm tới sẽ là thời kỳ thú vị nhất trong lịch sử vật lý.

marsbit07/04 06:44

Hinton Ca ngợi, Diễn giả Đóng góp Cốt lõi Gemini: Sẽ có Hàng tỷ AI Siêu nhân Cấp Einstein

marsbit07/04 06:44

Karpathy Lại Lập Kỳ Tích, Lật Đổ RAG, Biến Ghi Chú Của Bạn Thành Bộ Não Thứ Hai

Karpathy đã đề xuất một phương pháp cách mạng thay thế RAG truyền thống: xem ghi chú cá nhân là "mã nguồn" và sử dụng LLM làm "trình biên dịch" để xây dựng một wiki kiến thức cấu trúc và tự động. Trong mô hình LLM-WIKI này, tri thức được "biên dịch" một lần và duy trì liên tục, thay vì tái tạo lại mỗi khi truy vấn. Hệ thống có ba lớp: Raw (nguyên liệu thô không thể chỉnh sửa), Schema (quy tắc cấu trúc) và Wiki (sản phẩm biên dịch tự động, được liên kết chéo và cập nhật). Quy trình chính bao gồm Ingest (nạp tài liệu mới, tự động cập nhật các trang liên quan), Query (truy vấn wiki với câu trả lời có trích dẫn) và Lint (kiểm tra lỗi logic và mâu thuẫn). Phương pháp này giải quyết vấn đề suy giảm hiệu quả của RAG và bản đồ tri thức thủ công, đồng thời hiện thực hóa tầm nhìn về máy Memex từ năm 1945 bằng cách tự động hóa công việc bảo trì "ghi sổ" tẻ nhạt. Bản chất là một sự chuyển dịch quan hệ sản xuất nhận thức: AI đảm nhận việc quản lý, tổ chức và kết nối tri thức, giải phóng sự chú ý của con người cho các nhiệm vụ sáng tạo và chiến lược như lựa chọn thông tin và suy ngẫm ý nghĩa.

marsbit07/01 09:56

Karpathy Lại Lập Kỳ Tích, Lật Đổ RAG, Biến Ghi Chú Của Bạn Thành Bộ Não Thứ Hai

marsbit07/01 09:56

Tin Nóng, Claude 5 Phiên Bản 'Kẻ Làm Thuê' Đã Xuất Hiện, Ai Cũng Có Thể Dùng

Ngay lập tức, Claude Sonnet 5 (biệt danh Fennec) đã chính thức ra mắt, trở thành mô hình mặc định mới cho tất cả người dùng miễn phí và Pro. Được Anthropic mô tả là phiên bản Sonnet mạnh mẽ nhất về khả năng Agent từ trước đến nay, Sonnet 5 có hiệu suất tiệm cận với flagship Opus 4.8. Mô hình này có thể lập kế hoạch tự động, sử dụng công cụ trình duyệt và terminal. So với Sonnet 4.6, nó cho thấy sự cải thiện vượt trội về lập luận, sử dụng công cụ, lập trình và các nhiệm vụ tri thức. **Điểm nổi bật về hiệu suất:** - SWE-bench Pro: 63.2%, vượt GPT-5.5 (58.6%) và gần bằng Opus 4.8 (69.2%). - Humanity's Last Exam: 57.4%, chỉ kém Opus 4.8 0.5 điểm. - Terminal-Bench 2.1: 80.4%, tăng 13 điểm so với thế hệ trước. - Trong nhiều bài kiểm tra, Sonnet 5 đạt 90-100% hiệu suất của Opus 4.8. **Giá cả hấp dẫn:** - Khuyến mãi giới hạn đến 31/8: Đầu vào 2 USD/triệu token, đầu ra 10 USD/triệu token. - Sau đó, giá tiêu chuẩn là 3 USD (vào) và 15 USD (ra), chỉ bằng 60% giá Opus 4.8. - Lưu ý: Tokenizer mới có thể khiến số token đầu vào tăng 1.0-1.35 lần. **Bảo mật vượt trội:** - Tỷ lệ thành công tấn công prompt injection chỉ 0.19%, ngang bằng Opus 4.8. - Phòng thủ browser injection: 0.93%, vượt trội so với Mythos 5 (29.7%) và Opus 4.8 (31.5%). - Tỷ lệ tấn công mã độc giảm từ 45.26% (Sonnet 4.6) xuống còn 0.29%. Tóm lại, Claude Sonnet 5 định vị chính xác ở phân khúc trung cấp, cung cấp hiệu suất gần bằng flagship với mức giá phải chăng hơn nhiều, trở thành lựa chọn "công cụ lao động" AI mạnh mẽ và kinh tế cho đa số nhà phát triển.

marsbit07/01 07:50

Tin Nóng, Claude 5 Phiên Bản 'Kẻ Làm Thuê' Đã Xuất Hiện, Ai Cũng Có Thể Dùng

marsbit07/01 07:50

Vừa rồi, Anthropic ra mắt Sonnet 5, hiệu năng gần bằng Opus 4.8, nhưng chưa chắc đã rẻ hơn

Vừa qua, Anthropic đã chính thức ra mắt mô hình mới Claude Sonnet 5, được mô tả là "mô hình Sonnet mang đầy đủ tính chất Agent nhất từ trước đến nay". Mô hình này có khả năng lập kế hoạch, sử dụng các công cụ như trình duyệt, terminal và vận hành tự chủ ở mức độ mà trước đây cần đến các mô hình lớn hơn, đắt tiền hơn. So với Sonnet 4.6, Sonnet 5 có cải thiện đáng kể về khả năng lập luận, sử dụng công cụ, lập trình và xử lý công việc tri thức, tiệm cận hiệu năng của Opus 4.8 nhưng với mức giá thấp hơn. Trong các đánh giá về tác nhân thông minh (Agent), Sonnet 5 cho thấy sự cải thiện rõ rệt so với thế hệ trước và cung cấp phạm vi lựa chọn cân bằng giữa chi phí và hiệu suất rộng hơn. Ở mức độ nỗ lực cao, hiệu suất của nó trong một số tác vụ có thể sánh ngang với Opus 4.8. Về mặt an toàn, Sonnet 5 được cải thiện so với Sonnet 4.6, với tỷ lệ hành vi không phù hợp, ảo giác và tâng bốc thấp hơn. Tuy nhiên, tỷ lệ này vẫn cao hơn một chút so với Opus 4.8 và Claude Mythos Preview. Mô hình được trang bị rào chắn bảo mật mạng mặc định, tương tự như Opus 4.7/4.8. Sonnet 5 sử dụng một bộ tokenizer mới, khiến cùng một nội dung đầu vào có thể tạo ra nhiều token hơn (khoảng 1.0-1.35 lần). Để chuyển đổi, Anthropic áp dụng mức giá ưu đãi: từ nay đến 31/8/2026, giá là 2 USD/triệu token đầu vào và 10 USD/triệu token đầu ra. Sau đó, giá tiêu chuẩn sẽ là 3 USD và 15 USD. Một số phân tích chỉ ra rằng chi phí chạy mỗi tác vụ của Sonnet 5 trên chỉ số Intelligence Index là 2.29 USD, cao hơn khoảng 15% so với Opus 4.8, chủ yếu do lượng token sử dụng tăng lên. Mô hình hiện đã có mặt trên tất cả các nền tảng và được đưa vào Chương trình Xác minh An ninh Mạng của Anthropic. Giới hạn tốc độ (rate limits) trên các nền tảng cũng được điều chỉnh tăng để phù hợp với mức tiêu thụ token lớn hơn ở chế độ nỗ lực cao.

marsbit07/01 00:38

Vừa rồi, Anthropic ra mắt Sonnet 5, hiệu năng gần bằng Opus 4.8, nhưng chưa chắc đã rẻ hơn

marsbit07/01 00:38

Trung Quốc xếp nhất, đuổi sát OpenAI, 'Tăng nhân quét đất' bí ẩn vọt lên top 7 toàn cầu

Một mô hình AI bí ẩn của Trung Quốc có tên MopMonk (tạm dịch: "Hòa thượng quét sân") đã đột ngột xuất hiện và xếp hạng 7 trên bảng xếp hạng toàn cầu CyberGym về đánh giá khả năng bảo mật của AI, với tỷ lệ thành công 73,1%, xếp ngay sau OpenAI và đạt điểm số cao nhất từ trước đến nay của một đội Trung Quốc. CyberGym, được phát triển bởi UC Berkeley, là tiêu chuẩn đánh giá uy tín với 1507 lỗ hổng thực tế, yêu cầu mô hình không chỉ nhận diện mà còn phải tạo được bằng chứng khai thác (PoC) để tái tạo lỗ hổng trong môi trường thực thi khép kín. Điều này biến nó thành "thánh địa" thử thách năng lực hành động thực tế (Agent) của các AI. MopMonk gây chú ý vì sự ẩn danh hoàn toàn, không có trang web hay thông tin nhóm phát triển. Manh mối chính cho thấy nó sử dụng mô hình nền tảng mã nguồn mở MiniMax M3 từ Thượng Hải - một mô hình mạnh về lập trình, ngữ cảnh dài và đa phương thức. Bí quyết thành công của MopMonk được cho là nằm ở bộ khung (Harness) Agent đa tác tử được thiết kế riêng cho khai thác lỗ hổng. Nó tập trung vào ba yếu tố chính: 1) Bộ nhớ cấu trúc hóa để lưu trữ thông tin lỗ hổng, ràng buộc và bằng chứng thất bại; 2) Quá trình khai thác dựa trên bộ nhớ này, giúp thu hẹp tìm kiếm và tránh thử sai lặp lại; 3) Nhiều Agent khám phá song song, chia sẻ bộ nhớ chung để tăng hiệu quả. Thành tích này cho thấy xu hướng cạnh tranh AI đang chuyển từ quy mô tham số sang hiệu quả thực thi của Agent. Giá trị lâu dài có thể nằm ở bộ khung Harness tinh vi - thứ có thể được tái sử dụng và cải tiến qua nhiều thế hệ mô hình nền tảng. Dù danh tính đội phát triển MopMonk vẫn là ẩn số, nhưng họ đã chứng minh một hướng đi hiệu quả: kết hợp mô hình nền tảng mạnh với kỹ thuật điều phối Agent chuyên sâu để giải quyết các nhiệm vụ phức tạp trong thế giới thực.

marsbit06/30 08:11

Trung Quốc xếp nhất, đuổi sát OpenAI, 'Tăng nhân quét đất' bí ẩn vọt lên top 7 toàn cầu

marsbit06/30 08:11

Biến đổi Cấu trúc Transformer, LLM Trở Nên Thông Minh Hơn

Năm 2026, khi ngành công nghiệp mô hình lớn tập trung vào việc nhồi nhét nhiều tham số hơn, một nghiên cứu mới từ Mila, Đại học Cornell và Đại học Montréal đặt ra câu hỏi ngược lại: Điều gì xảy ra nếu chỉ di chuyển các tham số hiện có mà không thêm bất kỳ tham số nào? Bài báo có tên "Tapered Language Models" (TLM) chỉ ra rằng các lớp trong kiến trúc Transformer truyền thống không quan trọng như nhau. Các nghiên cứu về thoát sớm, cắt tỉa lớp và khả năng giải thích đã cho thấy các lớp đầu nắm bắt thông tin cơ bản (như ngữ pháp), trong khi các lớp sau xử lý thông tin cấp cao hơn (như ngữ nghĩa) và thường chỉ "nhấn mạnh lại" các phán đoán hiện có. Thay vì phân bổ tham số đồng đều cho tất cả các lớp, nhóm nghiên cứu đề xuất một thiết kế "hình nón": giảm dần đều chiều rộng của mạng chuyển tiếp (FFN) - thành phần lưu trữ và xử lý thông tin chính của mỗi lớp - từ đầu đến cuối mô hình, trong khi vẫn giữ nguyên tổng số tham số và lượng tính toán. Thử nghiệm trên mô hình Transformer 440M tham số cho thấy, với đường cong giảm dần dạng cosine (chiều rộng đầu gấp 1.5 lần cơ sở, chiều rộng cuối là 0.5 lần), điểm perplexity cải thiện tới 1.84 điểm so với mô hình cơ sở phân bổ đồng đều. Kết quả tích cực này được khẳng định lại trên ba kiến trúc khác (mô hình chú ý có cổng, Hope-attention, Titans) ở quy mô 760M và 1.3B tham số, trên nhiều nhiệm vụ đánh giá như suy luận thường thức và dự đoán ngôn ngữ, mà không làm giảm khả năng xử lý ngữ cảnh dài. Nghiên cứu chứng minh việc phân bổ dung lượng "não bộ" của mô hình một cách có chủ đích - tập trung nhiều hơn vào các lớp đầu nơi xử lý thông tin đa dạng - là một đòn bẩy hiệu quả gần như miễn phí. Phương pháp này mở ra hướng đi mới không chỉ cho mô hình ngôn ngữ mà còn cho các mô hình Thị giác Transformer, khuếch tán và đa phương thức vốn kế thừa thiết kế phân bổ đồng đều truyền thống.

marsbit06/29 12:55

Biến đổi Cấu trúc Transformer, LLM Trở Nên Thông Minh Hơn

marsbit06/29 12:55

活动图片