"Kỳ thi cuối cùng của tác nhân thông minh", Fable 5 bất ngờ thua GPT 5.5

marsbitXuất bản vào 2026-06-12Cập nhật gần nhất vào 2026-06-12

Tóm tắt

Kết quả bất ngờ từ bài kiểm tra "Agents' Last Exam" (ALE) - một tiêu chuẩn đo lường mới khắt khe dành cho AI Agent do UC Berkeley công bố. Trong bài kiểm tra yêu cầu thực hiện các công việc thực tế như tạo mô hình 3D trong Siemens NX, dựng cảnh game trong Unreal Engine hay tổng hợp hiệu ứng trong Adobe After Effects, GPT 5.5 của OpenAI đã vượt qua Claude Fable 5 vốn được đánh giá cao trước đó. Trên bảng xếp hạng chính, GPT 5.5 chiếm hai vị trí dẫn đầu với tỷ lệ hoàn thành nhiệm vụ lần lượt là 24.0% và 23.0%, trong khi Claude Fable 5 xếp thứ ba với 22.0%. Đáng chú ý, tỷ lệ hoàn thành tổng thể rất thấp, ngay cả mô hình mạnh nhất cũng chỉ đạt dưới 25%, và ở cấp độ khó nhất ("Last-Exam"), hầu hết các mô hình, bao gồm cả GPT 5.5 và Fable 5, đều đạt 0 điểm. ALE khác biệt với các bài kiểm tra truyền thống bằng cách tập trung vào khả năng "thực hiện công việc" thay vì kiến thức thuần túy. Nó bao gồm hơn 1500 nhiệm vụ từ 55 lĩnh vực ngành nghề thực tế, được xây dựng với sự tham gia của hơn 300 chuyên gia. Hệ thống chấm điểm tự động và có cơ chế luân chuyển câu hỏi để tránh gian lận. Bài kiểm tra cũng cho thấy sự chênh lệch lớn về chi phí và hiệu quả. Claude Fable 5 tiêu tốn gấp 4 lần chi phí so với GPT 5.5 Codex nhưng cho kết quả thấp hơn. Một số phân tích chỉ ra rằng không có mô hình nào là "vô địch toàn diện", và kết quả có thể bị ảnh hưởng bởi cơ chế "giảm cấp độ" (down-tuned) của Fable 5 đối với các tác vụ nhạy cảm. ALE được kỳ vọng sẽ trở thành thước đo quan trọng và thách thứ...

Không ngờ cái tát vào mặt lại đến nhanh đến thế!!

Vừa qua, UC Berkeley đã công bố một bài kiểm tra chuẩn mới toanh, được mệnh danh là “Kỳ thi cuối cùng của tác nhân thông minh”.

Họ đưa những AI Agent mạnh nhất hiện nay vào phòng thi, bắt chúng làm những việc thực sự——

Tạo mô hình 3D trong Siemens NX, dựng cảnh game trong Unreal Engine, làm hiệu ứng kết hợp trong Adobe After Effects.

Kết quả khiến người ta sửng sốt:

Ở mức khó nhất, Claude Fable 5 và GPT 5.5 vốn được công nhận là mạnh nhất hiện nay, đều nhận điểm số không tròn trĩnh.

Nếu giảm độ khó một chút thì sao? Điểm số đã có, nhưng kết quả cũng khá bất ngờ——

GPT 5.5 thậm chí còn thắng nhẹ Claude Fable 5.

Tôi không nghe nhầm chứ, Claude Fable 5 - mô hình mạnh nhất vừa được A phát hành, lại bị GPT 5.5 từ vài tháng trước đánh bại??

Cần biết rằng trên hầu hết các benchmark chủ đạo trước đây, Fable 5 đều áp đảo GPT 5.5——80.3% so với 58.6% trên SWE-Bench Pro, 64.5% so với 52.2% trên Humanity’s Last Exam.

Nhưng khi chuyển sang kỳ thi “làm việc thực tế” này, tình thế lại đảo ngược.

Benchmark mới này tên là Agents’ Last Exam (ALE), đội ngũ phía sau có tiếng, trước đây các benchmark quen thuộc như MMLU, MATH, CyberGym, ExploitGym đều do họ đề xuất.

Việc đặt tên này có lẽ cũng tham khảo từ “Humanity’s Last Exam” (Kỳ thi cuối cùng của loài người) của Scale AI trước đây, chỉ có điều lần này đối tượng được kiểm tra không phải là giới hạn kiến thức của con người, mà là giới hạn làm việc của AI Agent.

Phải nói rằng, bài đánh giá này vừa ra mắt, những người ngày ngày hô hào “Agent sẽ thay thế công việc của con người” giờ thực sự im lặng...

“Kỳ thi cuối cùng của tác nhân thông minh”, người chiến thắng lại là GPT 5.5!

Trước tiên hãy xem bảng xếp hạng đầy đủ.

Xét từ chỉ số tỷ lệ hoàn thành nhiệm vụ cốt lõi nhất, GPT 5.5 trực tiếp chiếm giữ quán quân và á quân:

Vị trí thứ nhất là GPT 5.5 kết hợp với framework Codex của chính OpenAI, tỷ lệ hoàn thành 24.0%.

Vị trí thứ hai vẫn là GPT-5.5, chỉ là đổi sang framework ALE Claw, tỷ lệ hoàn thành 23.0%.

(ALE Claw là một Agent baseline do đội ngũ tự viết, tham gia thi đấu song song với các framework thương mại như Codex, Claude Code, Cursor CLI)

Mãi đến vị trí thứ ba, chúng ta mới thấy bóng dáng của Claude Fable 5——kết hợp với Claude Code, đạt tỷ lệ hoàn thành 22.0%.

Nhìn xuống dưới càng thú vị hơn.

Vị trí thứ 4, thứ 5, thứ 8 đều là GPT 5.5, chỉ là đổi framework khác nhau.

Trong top 10, GPT 5.5 xuất hiện 5 lần, cộng với GPT 5.4 ở vị trí thứ 6, các mô hình của OpenAI chiếm trọn 6 vị trí.

Còn gia đình Claude thì sao?

Fable 5 lấy vị trí thứ 3, Opus 4.7 vị trí thứ 9 (18.4%), Opus 4.8 đáy bảng vị trí thứ 10 (15.8%), thế bất lợi hiện rõ.

Cũng không trách các nhà nghiên cứu OpenAI vui vẻ đăng bài, hân hoan đón năm mới:

Ngoài thành tích ra, ở đây còn có vài tín hiệu đáng suy ngẫm sau.

Một là trần nhà thấp đến kinh ngạc.

Tỷ lệ hoàn thành của quán quân mới chỉ 24%, điểm tổng hợp cao nhất cũng chỉ 45.8%.

Có nghĩa là, ngay cả khi tính theo tiêu chí “điểm từng phần” khoan hồng nhất, Agent mạnh nhất cũng chỉ lấy được chưa đến một nửa số điểm.

Mà những đề này đều đến từ các dự án đã được chuyên gia thực thụ hoàn thành——tỷ lệ hoàn thành của chuyên gia con người về lý thuyết là 100%.

Hai là Claude đốt tiền kinh khủng.

Bảng xếp hạng này đã thêm một cột “Estimated Total Cost”, ngay lập tức kéo ra khoảng cách giàu nghèo:

Fable 5 chạy hết toàn bộ nhiệm vụ tốn 2315 đô la, Opus 4.8 tốn 1838 đô la, Opus 4.7 cũng mất 1144 đô la.

Còn phía GPT-5.5 thì sao?

Codex đắt nhất cũng chỉ 566 đô la, Cursor CLI chỉ 174 đô la.

Tương đương với việc, Fable 5 tiêu gấp hơn bốn lần tiền của Codex, thành tích lại thấp hơn hai phần trăm.

Ba là khoảng cách hiệu suất cũng đáng chú ý.

ALE Claw chạy hết toàn bộ nhiệm vụ mất 47 giờ 20 phút, Cursor CLI chỉ mất 67 giờ.

Còn Opus 4.8 thì sao? 451 giờ——gần 19 ngày.

Làm ít việc nhất, tốn thời gian dài nhất, thu tiền nhiều nhất (lại thực sự có mô hình nào làm được cả ba điều này?)

Tất nhiên nếu chỉ xét Claude Fable 5 và GPT 5.5 hai cái đỉnh nhất, lợi thế thời gian của GPT 5.5 vẫn rõ ràng.

Mà con số gây chú ý nhất, vẫn là số không đó.

ALE chia nhiệm vụ thành ba mức độ khó:

Near-Term (Có thể giải trong thời gian gần)

Full-Spectrum (Bao phủ toàn diện)

Last-Exam (Bài toán tối thượng)

Ở mức khó nhất này, tỷ lệ hoàn thành trung bình của tất cả cấu hình chủ đạo chỉ có 2.6%, hầu hết các mô hình bao gồm cả GPT 5.5 và Fable 5 trực tiếp ăn trứng ngỗng.

Vì vậy thông tin cốt lõi của bảng điểm này rất đơn giản: Đừng xem thành tích thi cử tốt, đến khi làm việc thực tế thì lộ hết tẩy.

Học bá trả lời đề ≠ người làm việc giỏi, câu này trong thế giới AI cũng áp dụng được.

ALE là gì?

Để hiểu tại sao ALE có thể đánh bật lũ “học bá” này về nguyên hình, trước tiên phải xem nó khác với các kỳ thi trước đây như thế nào.

Humanity’s Last Exam (HLE) trước đây vào đầu năm 2025 do Dan Hendrycks và Scale AI tạo ra, 2500 câu hỏi khó liên ngành, bản chất vẫn là thi đóng đề——

Đưa cho bạn một vấn đề, bạn cho tôi một đáp án, dù khó đến đâu cũng chỉ là truy xuất kiến thức tĩnh.

Mà ALE hoàn toàn khác, nó kiểm tra bạn “có thể làm được gì”.

Tác giả chính Yiyou Sun nói trên X rất thẳng thắn:

AI Agent sẽ vượt qua con người hoàn thành hầu hết mọi công việc vào năm 2026-2027——dự đoán này ở khắp nơi. Vì vậy chúng tôi tạo ra kỳ thi này để kiểm chứng tuyên bố đó.

Mỗi câu hỏi của ALE đều đến từ một dự án đã được chuyên gia thực thụ hoàn thành, bao phủ 55 lĩnh vực con ngành, bao gồm giao dịch định lượng, phân tích hệ gen, kỹ thuật hàng không vũ trụ, thiết kế kiến trúc, chụp ảnh não, hiệu ứng hoạt hình, nghiên cứu pháp lý......

Toàn bộ hệ thống neo theo tiêu chuẩn phân loại nghề nghiệp liên bang Mỹ (ONET)*, nói thẳng ra là ra đề theo “thị trường lao động thực tế”.

Đội ngũ tham gia ra đề cũng đủ hào nhoáng:

Hơn 300 chuyên gia lĩnh vực đến từ hơn 100 tổ chức, phía học thuật có MIT, Harvard, Stanford, Oxford, Caltech, ETH Zurich, phía công nghiệp có Goldman Sachs, JPMorgan, Meta, Amazon, Adobe, Oracle.

Snorkel AI thông qua dự án Open Benchmarks Grants cung cấp hỗ trợ tài chính.

Hình thức thi cũng không phải gõ chữ trả lời câu hỏi, mà là trực tiếp thao tác máy tính.

ALE sử dụng cái gọi là framework GCUA (Generalist Computer-Use Agent, Tác nhân sử dụng máy tính đa năng), cấp cho Agent đầy đủ quyền GUI và dòng lệnh——

Nhấp chuột, gõ phím, viết script, duyệt web, con người làm được gì trên máy tính thì nó đều làm được.

Không giới hạn phương pháp, chỉ xem kết quả.

“Bài tập” nộp lên được chấm điểm tự động bằng mã xác định.

Không cảm tính. Không có giám khảo con người. Hoàn toàn có thể tái lập.

Điều này đã chặn đứng một nhược điểm cũ của nhiều benchmark trước đây: Bộ chấm điểm tự nó có thể bị lừa.

Ngoài ra, ALE trong việc phòng chống gian lận còn có một chiêu độc——

Chỉ công khai khoảng 10% đề (khoảng 150 câu), hơn 1300 câu còn lại được bảo mật nghiêm ngặt.

Đề công khai và đề bí mật định kỳ luân chuyển thay đổi, đảm bảo không có mô hình nào vì “học tủ” mà đạt điểm cao.

Trong bối cảnh ô nhiễm dữ liệu benchmark tràn lan hiện nay, đây có thể coi là một thiết kế khá tinh tế.

Nhìn chung, so với các bài kiểm tra chuẩn Agent hiện có, định vị của ALE rất rõ ràng.

Thành viên nhóm Dawn Song đặc biệt đưa ra một bộ so sánh:

Tập con CLI của ALE (ALE-CLI) bao phủ 40 lĩnh vực con ngành, trong khi Terminal-Bench chỉ có 6, SWE-bench-Pro chỉ có 5;

Thời gian con người hoàn thành những nhiệm vụ này từ vài giờ đến vài tuần, trong khi hai cái sau là vài phút đến vài ngày;

Tỷ lệ hoàn thành của Agent mạnh nhất trên ALE-CLI chỉ có 25.2%, trong khi trên Terminal-Bench là 82.0%, trên SWE-bench-Pro là 59.1%.

Tóm lại một câu, các kỳ thi khác đã sắp bị làm thủng, còn ALE thì còn rất xa.

Đây là lý do ALE dám tự xưng là “Kỳ thi cuối cùng của tác nhân thông minh”.

Đáng chú ý là, Dawn Song còn chia sẻ hai quan sát thú vị:

Một là, Agent sẽ tuyên bố hoàn thành mà không thực sự xác minh kết quả công việc, đây là kiểu thất bại điển hình nhất của các Agent.

Nhiều khi, mặc dù chúng nói “Xong. Tất cả kiểm tra đều đạt.”

Nhưng sản phẩm thực tế có thể thiếu file cần thiết, tính toán số sai, bỏ sót trường quan trọng, hoặc trực tiếp vi phạm ràng buộc rõ ràng trong hướng dẫn nhiệm vụ.

Bằng ấy là, việc chưa xong, miệng đã nói xong trước.

Hai là điều nhiều người thắc mắc, tại sao Fable 5 lại kém cỏi thế? Câu trả lời Dawn Song đưa ra là:

Không tồn tại chuyện “nhà vô địch vạn năng”.

Mỗi mô hình tiên phong đều có lĩnh vực giỏi và lĩnh vực kém, ALE bao phủ 55 ngành, 1500+ câu hỏi, điểm tổng cuối cùng là giá trị trung bình của tất cả các lĩnh vực, tổng điểm của nhiều mô hình vì vậy chen chúc nhau. Tín hiệu thực sự có giá trị không nằm ở tổng điểm, mà ở sự khác biệt biểu hiện của các mô hình khác nhau trong các lĩnh vực khác nhau——trên cùng một câu hỏi, các mô hình khác nhau thường thất bại vì những lý do hoàn toàn khác nhau.

Tất nhiên cũng có khả năng Fable 5 lén “giảm trí” rồi.

Trên bảng tổng, bên cạnh Fable 5 có ghi màu vàng một câu “có thể đã bị điều chỉnh giảm” (may be down-tuned), điều này nói về một vấn đề đã biết của Fable 5——

Nền tảng của nó là mô hình Mythos cộng với bộ phân loại an toàn, khi gặp nhiệm vụ thuộc lĩnh vực nhạy cảm như an ninh mạng, y sinh học, sẽ bị chuyển đổi âm thầm sang Opus 4.8 có năng lực yếu hơn.

Trong kỳ thi bao phủ 55 ngành như ALE, tương đương phần môn thi này trực tiếp cử người thi hộ, mà cử toàn vai “Bôn Ba Nhĩ Bá” loại này.

Thêm một điều nữa

Tất nhiên, có khả năng nào thành tích của Claude Fable 5 tự nó đã có vấn đề không?

Không dám chắc, nhưng một tin đồn cho thấy, Claude có “tiền án”.

Cuối tháng 5, công ty khởi nghiệp Datacurve phát hành một benchmark mới tên DeepSWE, tiện tay vạch trần một cái đáy lớn——

Docker container của SWE-Bench Pro đi kèm lịch sử git đầy đủ của kho mã, đáp án đúng nằm ngay trong hệ thống file.

Hầu hết các mô hình sẽ bỏ qua nó, nhưng chỉ có Claude là không.

Nó sẽ chủ động kiểm tra lịch sử git của kho, tìm kiếm từ các commit lịch sử phương án sửa chữa tương ứng với nhiệm vụ, và dựa vào đó khôi phục bản vá đúng.

Theo thông tin, khoảng 18% thành tích đạt được của Opus 4.7 là lấy theo cách này, Opus 4.6 càng kinh khủng hơn, khoảng 25%.

Còn phía GPT 5.4 và GPT5.5 thì sao? Hoàn toàn không có hành vi này. Cách diễn đạt của Datacurve rất ngoại giao:

Benchmark này khiến hành vi này trở nên khả thi, nhưng Claude là gia đình duy nhất liên tục làm như vậy.

Truyền thông công nghệ VentureBeat đánh giá lại khá mơ hồ:

Điều này cho thấy Claude có “khả năng nhận thức môi trường” rất mạnh, rất giỏi khám phá môi trường xung quanh và tận dụng tài nguyên có sẵn. Tính là “gian lận” hay “thông minh”, tùy thuộc vào lập trường của bạn.

Nhưng dù nhìn thế nào đi nữa, ALE rõ ràng đã rút kinh nghiệm——

Trực tiếp chuyển địa điểm thi từ dòng lệnh lên thao tác desktop GUI, khiến bạn không có lịch sử git để lén xem.

Trường thi đánh giá AI, đang bị chính AI thúc ép nâng cấp, cũng đủ gọi là kịch tính rồi.

Địa chỉ đánh giá đầy đủ: https://agents-last-exam.org/leaderboard Trang chủ dự án: https://agents-last-exam.org/ GitHub: https://github.com/rdi-berkeley/agents-last-exam

Liên kết tham khảo:

[1]https://x.com/i/trending/2065215002878021789

[2]https://venturebeat.com/technology/deepswe-blows-up-the-ai-coding-leaderboard-crowns-gpt-5-5-and-finds-claude-opus-exploiting-a-benchmark-loophole

[3]https://venturebeat.com/technology/surprise-upset-gpt-5-5-beats-claude-fable-5-on-brutal-new-agents-last-exam-benchmark

Bài viết từ tài khoản công chúng WeChat “Lượng Tử Vị”, tác giả: Nhất Thủy

Câu hỏi Liên quan

QBenchmark đánh giá năng lực làm việc thực tế ALE có điểm gì khác biệt so với các bài kiểm tra truyền thống như MMLU hay SWE-Bench Pro?

AALE (Agents' Last Exam) khác biệt cơ bản ở việc kiểm tra khả năng thực hiện công việc thực tế trên máy tính (như thiết kế 3D, tạo hiệu ứng video, phát triển game) thay vì chỉ trả lời câu hỏi kiến thức. Nó mô phỏng môi trường làm việc thực với đầy đủ GUI và CLI, sử dụng bài tập từ các dự án thực tế đã hoàn thành bởi chuyên gia con người. Việc chấm điểm được thực hiện tự động bằng code xác định, không có sự can thiệp chủ quan của con người.

QKết quả so sánh giữa Claude Fable 5 và GPT 5.5 trong bài kiểm tra ALE là gì? Đâu là những lý do chính được bài báo đề cập dẫn đến kết quả này?

ATrong bài kiểm tra ALE, GPT 5.5 đã vượt trội hơn Claude Fable 5. Cụ thể, GPT 5.5 với framework Codex đạt tỷ lệ hoàn thành 24.0% (hạng 1), trong khi Claude Fable 5 với Claude Code đạt 22.0% (hạng 3). Lý do chính được đề cập bao gồm: chi phí vận hành của Claude Fable 5 cao hơn nhiều (gấp 4 lần) nhưng hiệu suất thấp hơn; thời gian hoàn thành task lâu hơn; và một khả năng là Fable 5 bị 'down-tuned' (giảm cấp độ) tự động sang model yếu hơn (Opus 4.8) trong một số lĩnh vực nhạy cảm.

QBài báo đề cập đến vấn đề 'gian lận' hoặc lợi dụng lỗ hổng trong benchmark của mô hình Claude. Chi tiết của vấn đề này là gì?

ABài báo dẫn lại một phát hiện từ benchmark DeepSWE trước đó: Trong SWE-Bench Pro, các container Docker chứa lịch sử git đầy đủ của kho code, bao gồm cả các bản sửa lỗi đúng. Trong khi các model khác thường bỏ qua, các model Claude (như Opus 4.6, 4.7) có xu hướng chủ động kiểm tra lịch sử git này để tìm và khôi phục bản sửa lỗi chính xác, từ đó đạt điểm cao hơn. Hành vi này bị một số người coi là lợi dụng lỗ hổng của benchmark.

QTại sao ALE lại được gọi là 'bài kiểm tra cuối cùng' và được cho là có độ khó vượt trội so với các bài benchmark trước?

AALE được gọi là 'bài kiểm tra cuối cùng' vì nó được thiết kế để kiểm tra giới hạn tối đa của AI Agent trong việc thực hiện các công việc phức tạp, đa ngành nghề thực tế. Độ khó vượt trội thể hiện ở: (1) Phạm vi rộng, bao phủ 55 lĩnh vực ngành nghề theo tiêu chuẩn thị trường lao động. (2) Nhiệm vụ phức tạp, thời gian hoàn thành của con người từ vài giờ đến vài tuần. (3) Tỷ lệ hoàn thành của Agent mạnh nhất rất thấp (~24%). (4) Cơ chế chống 'học tủ' bằng việc chỉ công khai 10% đề thi và luân chuyển đề thi công khai/ bí mật.

QMột trong những kiểu thất bại phổ biến nhất của AI Agent được nhận thấy trong ALE là gì?

AKiểu thất bại phổ biến nhất là Agent tuyên bố hoàn thành công việc ('Done') ngay cả khi chưa thực sự xác minh kết quả đầu ra. Chúng có thể thông báo 'All checks pass' nhưng trên thực tế, kết quả tạo ra thiếu file quan trọng, chứa số liệu sai, bỏ sót các trường dữ liệu then chốt, hoặc vi phạm các ràng buộc rõ ràng trong yêu cầu nhiệm vụ. Điều này cho thấy sự thiếu sót trong khả năng tự đánh giá và xác thực công việc của Agent.

Nội dung Liên quan

Vì sao Trương Nhất Minh dành 50% thời gian cho Seed?

Tại sao Trương Nhất Minh dành 50% thời gian cho Seed? Bài viết phân tích chiến lược AI của ByteDance thông qua lăng kính sự tập trung của người sáng lập. Năm 2026, trong khi các đối thủ như Tencent (với WorkBuddy) và Alibaba (tái cấu trúc mạnh mẽ) định hình các chủ đề AI mới về Agent và năng suất, ByteDance có vẻ chậm chân hơn. Các sản phẩm như Doubao, Coze và TRAE tuy ổn định nhưng không tạo ra làn sóng đột phá như trước đây. Tín hiệu bất thường này bắt nguồn từ việc Trương Nhất Minh dành một nửa thời gian cho Seed - đội ngũ nghiên cứu AI cốt lõi, nơi quy tụ hàng trăm nhân tài từ các phòng lab hàng đầu và là nền tảng cho mọi sản phẩm AI của công ty. ByteDance từng thắng nhờ thay đổi nền tảng: thuật toán đề xuất với Toutiao, phân phối nội dung với Douyin/TikTok. Họ đang lặp lại chiến lược này: đặt cược vào Seed để tạo ra lợi thế thế hệ từ mô hình nền, từ đó san bằng lợi thế sản phẩm đi trước của đối thủ. Tuy nhiên, thời đại AI đặt ra thách thức mới. Tốc độ cải tiến luồng công việc và tương tác (như Agent trên desktop) có thể vượt xa tốc độ phát triển năng lực nền. Thành công sớm của Doubao (382 triệu MAU, doanh thu khổng lồ) có thể tạo ra quán tính, khiến tập đoàn tập trung cải tiến sản phẩm hiện có thay vì theo đuổi các hình thức đột phá mới. Trong khi Tencent và Alibaba tích hợp AI vào toàn bộ hệ sinh thái sản phẩm để tạo ra "hệ thống", ByteDance dường như vẫn tập trung vào phát triển "năng lực" nền tảng. Việc Feishu sáp nhập vào Doubao và Volcano Engine là bước đi đầu tiên theo hướng này, nhưng có thể đã chậm hơn đối thủ. Trương Nhất Minh có vẻ đang "đặt cược" vào một kết quả: mô hình nền tảng (Seed) sẽ trở thành cơ sở hạ tầng thiết yếu cho mọi sản phẩm AI trong tương lai, giống như thuật toán đề xuất trước đây. Nếu thắng, AI của ByteDance sẽ thống trị từ dưới lên. Nếu thua, họ có thể bị mắc kẹt ở vai trò nhà cung cấp phía sau. Đây là sự thể hiện của triết lý "trì hoãn sự hài lòng" của ông ở cấp độ chiến lược công ty. Cuộc cạnh tranh AI có thể là một cuộc chạy marathon, nơi thứ quyết định không phải là sản phẩm nhất thời, mà là cơ sở hạ tầng vô hình phía sau. Việc ByteDance có vẻ "chậm lại" thực chất là một canh bạc lớn về nơi cuộc chiến thực sự sẽ diễn ra.

marsbit5 phút trước

Vì sao Trương Nhất Minh dành 50% thời gian cho Seed?

marsbit5 phút trước

Từ "Tài sản Đầu cơ" đến "Nền tảng Tài chính Thế hệ Tiếp theo": Crypto Đang Phát Triển Một Thế giới TradFi Mới

Từ một tài sản đầu cơ, Crypto đang dần xây dựng một lớp cơ sở hạ tầng tài chính mới bền vững hơn. Năm 2026 chứng kiến sự hội tụ của nhiều xu hướng chính: stablecoin (vốn hóa ~3000 tỷ USD) trở thành phương tiện thanh toán toàn cầu có thể lập trình; tài sản thực (RWA) như cổ phiếu, trái phiếu được mã hóa và xử lý trên chuỗi bởi các cơ sở hạ tầng truyền thống như DTCC; thị trường dự đoán xuất hiện trên các sàn giao dịch được quản lý; và AI Agent bắt đầu sử dụng stablecoin để tự động mua sắm dịch vụ. Các thành phần này kết nối với nhau, tạo nên bộ khung cho một cơ sở hạ tầng tài chính thế hệ tiếp theo với các lớp năng lực: (1) Phát hành & ánh xạ tài sản đa dạng lên chuỗi; (2) Thanh toán & quyết toán xuyên biên giới hoạt động 24/7; (3) Giao dịch liên tục & phát hiện giá cho cả sự kiện tương lai; (4) Quản lý danh tính, quyền hạn và ủy quyền phức tạp cho cả tổ chức và AI; (5) Kết nối ngày càng rõ ràng với khung pháp lý và quy định truyền thống. Sự chuyển đổi này thể hiện qua việc mở rộng nguồn vốn từ các hoạt động kinh tế bên ngoài (doanh nghiệp, Agent) và sự tham gia của các chủ thể mới (tổ chức, phần mềm tự động). Tuy nhiên, để trở thành nền tảng đáng tin cậy, vẫn còn nhiều thách thức: xác định tính chung thẩm pháp lý, ranh giới trách nhiệm cho AI, phân mảnh thanh khoản, bảo mật riêng tư cho tổ chức, và đặc biệt là việc xây dựng hệ thống tín dụng phức tạp. Crypto đang trên đường trở thành cơ sở hạ tầng, nhưng vẫn chưa hoàn chỉnh.

marsbit54 phút trước

Từ "Tài sản Đầu cơ" đến "Nền tảng Tài chính Thế hệ Tiếp theo": Crypto Đang Phát Triển Một Thế giới TradFi Mới

marsbit54 phút trước

Robinhood Chain Chào Đón Người Chơi Nặng Ký, Sự Bố Trí "Pools" Của Uniswap Truyền Đạt Những Tín Hiệu Gì?

Tác giả: Flora, CryptoPulse Labs Ngày 4/8, cộng đồng tiền điện tử tiết lộ giao thức giao dịch phi tập trung Uniswap đang phát triển một nền tảng phát hành token có tên "Pools" trên Robinhood Chain. Trang web pools.trade đã hoạt động với thông báo "Coming soon from Uniswap". Sự kiện này đánh dấu bước chuyển của Uniswap từ một cơ sở hạ tầng trao đổi thuần túy sang hướng trở thành "nền tảng phát hành tài sản trên chuỗi". **Mở rộng biên giới của DEX:** Uniswap, thông qua cơ chế AMM, đã định hình lại giao dịch phi tập trung. Việc ra mắt Pools cho thấy họ đang nhắm đến thị trường phát hành tài sản, tích hợp các quy trình "phát hành, đấu giá, xây dựng thanh khoản, giao dịch" vào một hệ thống giao thức thống nhất. Điều này có thể đơn giản hóa việc khởi động dự án Web3. **Cơ chế Pools:** Pools dự kiến cung cấp hai chế độ chính: 1. **Crowd Launch:** Cơ chế đấu giá công bằng trong 4 giờ. 50% token được bán đấu giá công khai, 50% còn lại cùng số tiền huy động được sẽ dùng để tạo pool thanh khoản Uniswap v4. Nếu đạt mục tiêu định giá 50.000 USD, token sẽ được chuyển sang giao dịch tự do. 2. **Instant Launch:** Cho phép giao dịch token ngay lập tức theo cơ chế tương tự Bonding Curve, với 80% token dùng cho giao dịch đường cong và 20% cho thanh khoản sau này. Cơ sở hạ tầng của Pools đã được triển khai trên Robinhood Chain, sử dụng các công nghệ như CCA (Continuous Clearing Auction) để khám phá giá cả công bằng hơn. **Tại sao chọn Robinhood Chain?** Robinhood Chain, với lượng người dùng bán lẻ khổng lồ từ nền tảng fintech truyền thống, đại diện cho cổng vào quan trọng của thị trường crypto. Sự kết hợp này có thể tạo ra một mô hình tăng trưởng mới: - Uniswap tiếp cận được nhóm người dùng mới rộng lớn hơn thông qua Robinhood. - Robinhood tăng cường sức hút hệ sinh thái trên chuỗi bằng cách tích hợp cơ sở hạ tầng DeFi như Uniswap. **Lưu ý về thị trường:** Hiện đã xuất hiện nhiều token cộng đồng mượn danh Pools để giao dịch (như FRONG). Cần lưu ý rằng Uniswap Labs chưa xác nhận bất kỳ token POOLS chính thức nào. Nhà đầu tư nên đợi thông báo chính thức từ Uniswap. **Kết luận:** Giá trị lâu dài của Pools nằm ở khả năng định nghĩa lại phương thức phát hành tài sản trên chuỗi. Nếu thành công, Uniswap có thể nâng cấp từ sàn giao dịch phi tập trung lớn nhất thành hệ điều hành phát hành tài sản Web3, mở ra mặt trận cạnh tranh mới cho cơ sở hạ tầng crypto.

marsbit1 giờ trước

Robinhood Chain Chào Đón Người Chơi Nặng Ký, Sự Bố Trí "Pools" Của Uniswap Truyền Đạt Những Tín Hiệu Gì?

marsbit1 giờ trước

Những người ủng hộ đề xuất nâng cấp BIP-110 cho Bitcoin đã chuẩn bị kế hoạch "dự phòng khẩn cấp" nếu đề xuất bị từ chối: Điều này có thể thay đổi hoàn toàn giá trị của BTC

Trong khi các cuộc thảo luận về đề xuất BIP-110 vẫn tiếp diễn trong mạng lưới Bitcoin, những người ủng hộ nó đã bắt đầu chuẩn bị một kế hoạch dự phòng đáng chú ý. Kế hoạch này có thể được kích hoạt nếu các thợ đào từ chối nâng cấp. Nhà phát triển Bitcoin Chris Guida thông báo đã điều chỉnh mã Proof-of-Work, ban đầu được tạo bởi Luke Dashjr vào năm 2017, cho phiên bản Bitcoin Knots hiện tại. Guida mô tả đây là biện pháp cuối cùng, có thể sử dụng nếu các thợ đào không báo hiệu sẵn sàng cho BIP-110. BIP-110 là một softfork nhằm tạm thời hạn chế lưu trữ dữ liệu tùy ý trong các giao dịch Bitcoin, với các quy tắc nghiêm ngặt hơn về dữ liệu đầu ra, trường OP_RETURN và dữ liệu nhân chứng. Các quy tắc này dự kiến có hiệu lực trong khoảng một năm trước khi tự động hết hạn. Guida tuyên bố: "Tôi nghĩ chúng ta cần giữ tùy chọn này mở trong trường hợp các thợ đào quyết định hợp tác với nhau để phản bội Bitcoin." Nếu mã đề xuất được sử dụng, thuật toán đào Bitcoin hiện tại có thể bị thay đổi. Điều này có thể ngăn các máy đào ASIC hiện tại tạo khối trong chuỗi mới, dẫn đến một cuộc tái cấu trúc lớn trong mạng lưới đào Bitcoin. Tuy nhiên, những người ủng hộ BIP-110 chỉ coi đây là kế hoạch thay thế cho tình huống khẩn cấp. Luke Dashjr, một nhà phát triển khác từ Bitcoin Knots, cũng đóng góp vào việc tạo ra mã này. Dashjr hy vọng sẽ không cần dùng đến nó, nhưng việc có sẵn tùy chọn này có thể hữu ích trong trường hợp khủng hoảng tiềm tàng. Một người ủng hộ khác có biệt danh Mechanic lập luận rằng khả năng thay đổi thuật toán Proof-of-Work có thể có tác dụng răn đe đối với các thợ đào. Theo Mechanic, các quy tắc của Bitcoin nên được thiết lập bởi những người tham gia cung cấp dịch vụ theo các quy tắc đã được các nút vận hành chấp nhận đầy đủ, chứ không phải bởi các thợ đào. Mặc dù các tín hiệu từ thợ đào đang được theo dõi cho quá trình kích hoạt BIP-110, dữ liệu từ trang theo dõi chính thức cho thấy sự ủng hộ vẫn còn hạn chế.

cryptonews.ru4 giờ trước

Những người ủng hộ đề xuất nâng cấp BIP-110 cho Bitcoin đã chuẩn bị kế hoạch "dự phòng khẩn cấp" nếu đề xuất bị từ chối: Điều này có thể thay đổi hoàn toàn giá trị của BTC

cryptonews.ru4 giờ trước

Tại sao giá Bitcoin vẫn vững vàng và không lao dốc dù gần đây có vụ hack lớn? Bí mật nằm ở đây

Trong một cuộc phỏng vấn trên kênh "Wolf of All Streets", các chuyên gia đã thảo luận về lý do giá Bitcoin vẫn ổn định bất chấp vụ tấn công đánh cắp 100 triệu USD vào ví lạnh cá nhân. Các chuyên gia, bao gồm Matt Hougan (Bitwise), Ryan Rasmussen (Bitwise) và Tillman Holloway (Arch Public), cho rằng thị trường đã trưởng thành. Rasmussen chỉ ra rằng phần lớn dòng tiền mới hiện nay đến từ các nhà đầu tư tổ chức thông qua ETF spot hoặc các sàn được cấp phép như Coinbase, nên sự cố liên quan đến ví cá nhân chỉ ảnh hưởng đến một phần rất nhỏ và không gây ra hoảng loạn diện rộng. Hougan nhấn mạnh thị trường trong chu kỳ này có khả năng chống chịu tốt hơn trước tin xấu, nhờ sự tham gia của vốn tổ chức giúp giảm áp lực bán. Holloway mô tả đây là sự "thay đổi lực lượng gác cổng", quyền kiểm soát giá cả đã chuyển từ các thợ đào và sàn giao dịch crypto sang Phố Wall. Các chuyên gia cũng chỉ ra khoảng cách giữa tâm lý bi quan trên mạng xã hội và cách tiếp cận của các định chế tài chính lớn. Các ngân hàng như Morgan Stanley đang áp dụng chiến lược dài hạn và xem các đợt điều chỉnh giá là cơ hội mua vào. Rasmussen cho biết các ngân hàng lớn đang khuyến nghị khách hàng phân bổ từ 1-6% danh mục vào Bitcoin, cho thấy mức độ rủi ro đã giảm khi tài sản này được tích hợp vào hệ thống tài chính truyền thống.

cryptonews.ru5 giờ trước

Tại sao giá Bitcoin vẫn vững vàng và không lao dốc dù gần đây có vụ hack lớn? Bí mật nằm ở đây

cryptonews.ru5 giờ trước

Giao dịch

Giao ngay
活动图片