# Bài viết Liên quan Tác nhân

Trung tâm Tin tức HTX cung cấp những bài viết mới nhất và phân tích chuyên sâu về "Tác nhân", bao gồm xu hướng thị trường, cập nhật dự án, phát triển công nghệ và chính sách quản lý trong ngành tiền kỹ thuật số.

Bảng xếp hạng AI làm việc: Năng lực kiếm tiền tự động của Claude Fable 5 gấp 2.5 lần GPT-5.5

Chỉ số Lao động Từ xa (RLI) đo lường khả năng AI tự động hoàn thành các dự án freelance thực tế. Trong đánh giá mới nhất, Claude Fable 5 dẫn đầu với tỷ lệ tự động hóa 16.1%, gấp khoảng 2.5 lần GPT-5.5 (6.3%) và gần gấp đôi Opus 4.8 (8.3%). Cả ba mô hình này đều vượt xa kỷ lục 2.5% được thiết lập 8 tháng trước, cho thấy tốc độ tiến bộ nhanh chóng. RLI bao gồm 240 dự án từ Upwork, thuộc 23 lĩnh vực như thiết kế 3D, phát triển web. Tiêu chí đánh giá là liệu sản phẩm do AI giao có được một khách hàng hợp lý chấp nhận thanh toán hay không. Sự thành công của Fable 5 được cho là nhờ cơ chế "Worker-critic Loop", nơi một Agent độc lập kiểm tra và yêu cầu sửa đổi công việc. Nghiên cứu cũng chỉ ra rằng việc sử dụng AI làm giám khảo để đánh giá kết quả là không đáng tin cậy, vì chúng thường đánh giá quá cao chất lượng và có thể bỏ qua các lỗi tinh vi, như hình ảnh 3D được làm giả. Mặc dù có bước nhảy vọt, 84% công việc freelance vẫn nằm ngoài khả năng hiện tại của AI. Tỷ lệ 16.1% cho thấy AI vẫn chưa đạt đến tiêu chuẩn chuyên nghiệp hoàn chỉnh trong nhiều tác vụ. Tuy nhiên, việc tỷ lệ tự động hóa tăng hơn 4 lần trong chưa đầy một năm là một tín hiệu đáng chú ý cho thấy khả năng thay thế lao động số từ xa của AI đang tăng tốc.

marsbitHôm qua 09:50

Bảng xếp hạng AI làm việc: Năng lực kiếm tiền tự động của Claude Fable 5 gấp 2.5 lần GPT-5.5

marsbitHôm qua 09:50

Trí phổ, sợ hãi trở thành MiniMax tiếp theo

Tác giả: Họa Họa Trong bối cảnh cổ phiếu AI toàn cầu điều chỉnh và áp lực giải tỏa cổ phiếu, Zhipu AI - công ty từng đạt vốn hóa nghìn tỷ nhờ thành công trong lĩnh vực AI coding - đang đối mặt với thách thức định giá lại từ thị trường, tương tự như đợt sụt giảm của MiniMax trước đó. Để chủ động định hình lại câu chuyện định giá, người sáng lập Zhipu Đường Kiệt đã công bố một bức thư nội bộ mang tên "Cơn sóng lớn đã đến", chuyển trọng tâm chiến lược và tường thuật công khai sang các chủ đề dài hạn như Tác vụ Tầm nhìn Dài (Long Horizon Task), Tác nhân Tự trị (Autonomous Agent), Tự Tiến hóa (Self-Evolving) và AGI. Động thái này được xem như một nỗ lực nhằm duy trì định vị của Zhipu như một công ty AGI tiên phong (đối chiếu với OpenAI, Anthropic) thay vì một công ty phần mềm AI thông thường, từ đó bảo vệ mô hình định giá dựa trên tiềm năng công nghệ tương lai thay vì chỉ số tài chính ngắn hạn. Bài viết phân tích rằng ngành AI Trung Quốc đang phân hóa thành hai con đường: một là hướng thương mại hóa sản phẩm (như MiniMax) chịu sự giám sát định giá khắt khe của thị trường; hai là hướng nghiên cứu cơ sở hạ tầng và đột phá công nghệ cốt lõi (như Zhipu). Zhipu lựa chọn con đường thứ hai thông qua "Kế hoạch Touch High", tuyên bố ưu tiên đột phá kỹ thuật hơn lợi nhuận ngắn hạn. Tuy nhiên, áp lực chuyển đổi từ định giá dựa trên niềm tin công nghệ sang định giá dựa trên hiệu quả thương mại là không thể tránh khỏi. Bức thư của Đường Kiệt chính là một cuộc chạy đua với thời gian để giành quyền định nghĩa tương lai và kiểm soát kỳ vọng của nhà đầu tư trước khi thị trường áp đặt một khung định giá mới.

marsbit2 ngày trước 01:04

Trí phổ, sợ hãi trở thành MiniMax tiếp theo

marsbit2 ngày trước 01:04

Mango của 'Tiểu Trát' chỉ thua GPT Image 2 trong việc tạo ảnh, không ai dạy nó sửa bài, nó tự học được

Meta ra mắt mô hình tạo ảnh mới nhất Muse Image, biệt danh "Mango". Trên bảng xếp hạng Arena AI, nó hiện đứng thứ hai, chỉ sau GPT Image 2 của OpenAI. Muse Image hoạt động như một tác nhân AI, tự học cách sửa đổi và cải thiện hình ảnh thông qua học tăng cường. Nó có thể tìm kiếm thông tin trực tuyến, viết mã để tạo biểu đồ hoặc mã QR, và quan trọng nhất là tự sửa lỗi sau khi phản ánh. Một tính năng nổi bật là khả năng @ tên người dùng Instagram công khai để đưa hình ảnh của họ vào ảnh được tạo. Tính năng này mặc định được bật, gây lo ngại về quyền riêng tư. Muse Image được tích hợp với mô hình ngôn ngữ Muse Spark (Avocado) để thực hiện các nhiệm vụ phức tạp. Mô hình video Muse Video, có chung nền tảng với Muse Image, hiện xếp thứ ba trên bảng xếp hạng tạo video. Sức mạnh thực sự của Meta nằm ở khả năng phân phối: Muse Image sẽ được tích hợp vào các ứng dụng có hàng tỷ người dùng như Meta AI, Instagram, WhatsApp và Facebook. Mỗi hình ảnh AI được tạo đều có chữ ký số Content Seal để nhận diện. Tóm lại, Meta không chỉ cạnh tranh về chất lượng hình ảnh mà còn về khả năng biến AI thành một công cụ hàng ngày dễ tiếp cận, mặc dù đi kèm với những thách thức mới về quyền riêng tư.

marsbit07/08 10:41

Mango của 'Tiểu Trát' chỉ thua GPT Image 2 trong việc tạo ảnh, không ai dạy nó sửa bài, nó tự học được

marsbit07/08 10:41

Blog mới của Ông Lệ đề xuất "Tiến hóa tự động bắt đầu từ Harness", Thôi Thiên Ý từ DeepSeek chuyển tiếp đồng tình

Cựu Phó chủ tịch phụ trách an ninh tại OpenAI, Weng Li, mới đây đã xuất bản một bài blog với tiêu đề "Harness Engineering for Self-Improvement", thảo luận về con đường thực tế để AI tự phát triển (Recursive Self-Improvement - RSI). Cô đề xuất rằng sự tiến hóa tự động gần đây có thể bắt đầu từ **Harness** - hệ thống thời gian chạy bên ngoài quyết định cách mô hình gọi công cụ, quản lý ngữ cảnh, đọc/ghi tệp, chia nhỏ nhiệm vụ và xác minh kết quả - thay vì trực tiếp sửa đổi trọng số mô hình ngay từ đầu. Bài viết chỉ ra xu hướng tối ưu hóa từng bước: từ **Context Engineering** (như ACE, MCE) để quản lý bộ nhớ, đến **Workflow Design** (như AI Scientist, ADAS) để thiết kế quy trình làm việc, và cuối cùng là **Self-Improving Harness**. Ở cấp độ này, mô hình có thể phân tích điểm yếu của chính harness, đề xuất sửa đổi mã và xác minh chúng thông qua các vòng lặp như Weakness Mining, Harness Proposal và Proposal Validation. Các phương pháp như **Evolutionary Search** và **DGM** (Darwin Gödel Machine) thậm chí cho phép tìm kiếm và tiến hóa harness tự động, mang lại cải thiện hiệu suất đáng kể trên các benchmark như SWE-bench. Nhà nghiên cứu DeepSeek, Cui Tianyi, đồng tình và nhấn mạnh rằng tự phát triển theo hướng harness là một hướng đi đầy hứa hẹn như tự phát triển mô hình. Tuy nhiên, Weng Li cũng chỉ ra những thách thức hiện tại: bộ đánh giá còn yếu và mơ hồ, vấn đề quản lý vòng đời bộ nhớ, kết quả tiêu cực bị bỏ qua, sự thu hẹp đa dạng, reward hacking, và mâu thuẫn giữa thành công ngắn hạn và sức khỏe lâu dài của hệ thống. Cô tin rằng harness và mô hình sẽ củng cố lẫn nhau, và con người vẫn sẽ đóng vai trò giám sát ở cấp độ trừu tượng phù hợp, không bị loại khỏi vòng lặp. Bài blog kết luận rằng harness đang trở thành một biến số quan trọng, vì cùng một mô hình có thể thể hiện khả năng hoàn toàn khác nhau trong các harness khác nhau.

marsbit07/08 10:28

Blog mới của Ông Lệ đề xuất "Tiến hóa tự động bắt đầu từ Harness", Thôi Thiên Ý từ DeepSeek chuyển tiếp đồng tình

marsbit07/08 10:28

Đối tác của Blockchain Capital: AI đang viết lại đơn vị cơ bản của lao động

Bài viết của Kinjal Shah, đối tác tại Blockchain Capital, phân tích sự biến đổi sâu sắc của lao động dưới tác động của AI và blockchain. Tác giả cho rằng, nỗi sợ AI cướp việc làm bỏ qua một vấn đề cấu trúc quan trọng hơn: đơn vị cơ bản của lao động đang thay đổi. Lịch sử cho thấy mỗi lần chi phí phối hợp giảm (từ thợ thủ công đến nhà máy, rồi nền kinh tế gig và sáng tạo), ranh giới công ty lại dịch chuyển. Các "tầng lớp cầu nối" như nền kinh tế gig đã chứng minh tính khả thi của việc phân mảnh công việc, nhưng vẫn phụ thuộc vào nền tảng trung gian. Bước ngoặt tiếp theo được thúc đẩy bởi hai yếu tố: **lao động có thể lập trình** (các tác nhân AI hoạt động không giới hạn thời gian, mở rộng quy mô theo sức mạnh tính toán) và **tiền tệ có thể lập trình** (stablecoin). Khi kết hợp, chúng tạo ra khả năng có một dây chuyền sản xuất không có thực thể tổ chức, nơi các nhiệm vụ được phân phối, định giá và thanh toán ngay lập tức với tốc độ máy móc, không cần trung gian. Các ví dụ thực tế như Poncho của Merit Systems (cung cấp ví cho AI để thanh toán vi mô) hay các động thái từ Meta và AWS cho thấy stablecoin đang trở thành tầng thanh toán cho hoạt động kinh tế thế hệ mới. Điều này cho phép định giá chính xác theo từng nhiệm vụ, thay vì các gói đăng ký rộng. Trong tương lai, công ty sẽ ít là nơi chứa lao động hơn, mà giống một "lớp thông minh" được đặt trên thị trường lao động toàn cầu có thể lập trình. Vai trò của con người là người tổ chức - thiết kế hệ thống, xác định nhiệm vụ, đánh giá chất lượng và kết hợp đầu ra của các tác nhân AI để tạo ra giá trị tổng thể lớn hơn. Giá trị nằm ở khả năng đóng gói lại lao động, biết nên ủy thác điều gì, đánh giá ra sao và kết hợp chúng thế nào để tạo ra lợi thế cạnh tranh.

marsbit07/07 03:20

Đối tác của Blockchain Capital: AI đang viết lại đơn vị cơ bản của lao động

marsbit07/07 03:20

Karpathy mới nhất lên tiếng chỉ trích: Một câu nói khiến cả hội trường các nhà phát triển Agent im bặt

Andrej Karpathy, nhà nghiên cứu cốt cán tại Anthropic, đã gây sốc trong cộng đồng phát triển AI Agent bằng một tuyên bố thẳng thắn: Sai lầm lớn nhất hiện nay là mọi người vội vàng bắt Agent làm việc mà chưa thực sự hiểu rõ các mô hình nền tảng cơ bản. Ông rút ra bài học từ dự án "World of Bits" thất bại năm 2016 tại OpenAI, nơi họ cố gắng tạo Agent điều khiển máy tính. Công cụ khi đó là học tăng cường quá yếu, và ông cho rằng lựa chọn đúng đắn lúc bấy giờ phải là tập trung vào mô hình ngôn ngữ. Karpathy đưa ra ba lời khuyên ngược với xu hướng: 1. Dừng việc ép Agent làm mọi thứ, hãy ưu tiên xây dựng mô hình nền tảng đúng đắn trước. Việc ông gia nhập nhóm tiền huấn luyện tại Anthropic chính là một phiếu bầu cho quan điểm này. 2. Tạo Demo thì dễ, nhưng để biến thành sản phẩm thực sự có thể mất cả thập kỷ, giống như hành trình của xe tự lái hay VR. 3. Agent không phải là sản phẩm; năng lực nền tảng mới là sản phẩm. Xây dựng nền móng vững chắc, và Agent sẽ tự nhiên xuất hiện. Ông cũng gợi ý nên tìm cảm hứng từ khoa học thần kinh, ví dụ như cấu trúc não bộ (hồi hải mã, hạch nền, đồi thị), để hiểu sâu hơn về bản chất của trí tuệ. Điểm đáng chú ý nhất, Karpathy khẳng định rằng tuyến đầu của khả năng Agent không nằm ở các gã khổng lồ như OpenAI hay DeepMind, mà chính là ở các nhà phát triển độc lập và startup. Lý do là trong lĩnh vực Agent, không công ty lớn nào có lợi thế dẫn trước hàng năm trời; mọi người đều ở cùng vạch xuất phát, nơi sự linh hoạt và tốc độ thử nghiệm là lợi thế cạnh tranh. Thông điệp cuối cùng của Karpathy không phải là ngăn cản việc phát triển Agent, mà là cảnh báo không được bỏ qua nền tảng. Ông kêu gọi sự kiên nhẫn đầu tư vào nghiên cứu cơ bản và sẵn sàng cho một cuộc chạy đua dài hạn.

marsbit07/06 02:35

Karpathy mới nhất lên tiếng chỉ trích: Một câu nói khiến cả hội trường các nhà phát triển Agent im bặt

marsbit07/06 02:35

Thu nhập 100 triệu đô la mỗi năm, hai bạn cùng phòng Berkeley thế hệ 9x tạo ra mô hình kinh doanh AI sinh lời nhất

Công ty không tạo ra AI nào nhưng kiếm được 100 triệu USD mỗi năm! Đó là Arena, nền tảng bảng xếp hạng và đánh giá mô hình AI khổng lồ, bắt nguồn từ một dự án nghiên cứu mã nguồn mở có tên Chatbot Arena do một nhóm từ UC Berkeley khởi xướng vào năm 2023. Cốt lõi của Arena là một bảng xếp hạng được xây dựng dựa trên hàng chục triệu lượt bình chọn "mù" của người dùng thực. Người dùng nhập prompt, hai mô hình ẩn danh trả lời và họ chọn câu trả lời tốt hơn. Cơ chế "đấu trường" đơn giản này đã thu hút hơn 1000 triệu lượt đánh giá, trở thành điểm tham chiếu quan trọng. Tất cả các gã khổng lồ như OpenAI, Google, Anthropic, Meta đều đưa mô hình hàng đầu của họ lên đây để kiểm tra, thậm chí cả GPT-5 dưới bí danh. Bí quyết kiếm tiền của Arena nằm ở dịch vụ thương mại AI Evaluations, ra mắt tháng 9 năm ngoái. Các công ty phát triển mô hình và doanh nghiệp lớn trả phí để Arena huy động cộng đồng hàng triệu người dùng đánh giá chuyên sâu mô hình của họ, cung cấp phân tích hiệu suất trong thế giới thực mà các bài kiểm tra tiêu chuẩn không có được. Đây là mô hình kinh doanh "bán dụng cụ" trong cơn sốt AI: khi các công ty đua nhau cải thiện mô hình, nhu cầu cho dịch vụ đánh giá và tinh chỉnh sau khi triển khai càng lớn. Dự án này được đồng sáng lập bởi hai bạn cùng phòng tại Berkeley: CEO Anastasios Angelopoulos (chuyên gia học máy) và CTO Wei-Lin Chiang (người đứng sau chatbot mã nguồn mở Vicuna nổi tiếng). Dự án tách ra thành công ty vào mùa xuân 2025, nhanh chóng huy động được 100 triệu USD vốn hạt giống, định giá 6 tỷ USD. Đến tháng 1 năm nay, họ đã hoàn thành vòng gọi vốn Series A 150 triệu USD, định giá 1.7 tỷ USD. Arena không ngừng mở rộng, gần đây ra mắt Chế độ Tác nhân (Agent Mode) để đánh giá các AI thực hiện nhiệm vụ dài, phức tạp như viết mã, nghiên cứu. Arena đặt cược vào một tương lai nơi việc đánh giá khách quan, dựa trên dữ liệu thực tế về hiệu suất AI sẽ ngày càng quan trọng và có giá trị.

marsbit07/06 00:21

Thu nhập 100 triệu đô la mỗi năm, hai bạn cùng phòng Berkeley thế hệ 9x tạo ra mô hình kinh doanh AI sinh lời nhất

marsbit07/06 00:21

Thu về 24.000 sao: Một lệnh duy nhất, AI tự tìm kiếm kỹ năng

Vercel, công ty đứng sau Next.js, đã ra mắt công cụ Skills - một trình quản lý gói (package manager) dành cho AI Agent, cho phép cài đặt các "kỹ năng" (skill) chuyên biệt vào các công cụ lập trình AI như Claude Code, Cursor, Codex... chỉ bằng một dòng lệnh `npx skills add <package>`. Kho lưu trữ chính thức đã đạt 24,000 sao GitHub trong vòng 5 tháng. Một skill là một thư mục chứa tài liệu hướng dẫn (SKILL.md), tài liệu tham khảo và cả script có thể thực thi, giúp AI tuân thủ các quy tắc, phong cách code cụ thể của dự án một cách tự động và lâu dài. Tính năng nổi bật là "Find Skills", một skill giúp AI tự động tìm kiếm và cài đặt skill phù hợp nhất dựa trên yêu cầu của người dùng, hoạt động như một công cụ tìm kiếm năng lực cho AI. Tuy nhiên, tiện ích đi kèm rủi ro bảo mật lớn. Các nghiên cứu từ Snyk và Koi Security cho thấy hàng trăm skill chứa mã độc, có khả năng đánh cắp khóa, thực hiện prompt injection hoặc phân phối phần mềm độc hại. Khác với npm, skill hợp nhất lệnh, mã code và quyền truy cập đầy đủ, tạo ra mối đe dọa trực tiếp đến hệ thống cục bộ. Vercel, thông qua sáng kiến này, đang tìm cách định hình lại lớp công cụ AI, biến trải nghiệm "một dòng lệnh" từng thành công với Next.js thành chuẩn mực mới trong việc mở rộng năng lực cho trợ lý lập trình AI, đồng thời cũng đặt ra những thách thức bảo mật cần được quản lý cẩn thận.

marsbit07/06 00:21

Thu về 24.000 sao: Một lệnh duy nhất, AI tự tìm kiếm kỹ năng

marsbit07/06 00:21

活动图片