LeCun liên tục chuyển tiếp, tác phẩm mới VISReg giải quyết vấn đề cốt lõi "sụp đổ biểu diễn" trong mô hình thế giới JEPA

marsbitDipublikasikan tanggal 2026-07-28Terakhir diperbarui pada 2026-07-28

Abstrak

Mô hình thế giới JEPA dựa trên nền tảng học tự giám sát (SSL) mà Yann LeCun ủng hộ từ năm 2017. Tuy nhiên, SSL thường đối mặt với vấn đề "sụp đổ biểu diễn" (representation collapse), khiến mô hình ánh xạ các đầu vào khác nhau vào quá ít vector, làm giảm khả năng phân biệt. Các phương pháp phổ biến hiện nay sử dụng nhiều thủ thuật phức tạp, dễ vỡ và khó giải thích. Công trình mới VISReg (Variance-Invariance-Sketching Regularization) do LeCun đánh giá cao, giải quyết vấn đề cốt lõi này bằng cách tách mục tiêu chính quy hóa thành hai phần độc lập: **"quy mô" (scale)** và **"hình dạng" (shape)**. - **Quy mô:** Kiểm soát phương sai của từng chiều biểu diễn, đảm bảo gradient vẫn mạnh ngay cả khi bắt đầu sụp đổ. - **Hình dạng:** Sử dụng khoảng cách Sliced Wasserstein (SWD) và kỹ thuật "stop-gradient" để căn chỉnh hình dạng phân phối biểu diễn với phân phối Gauss chuẩn, mà không ảnh hưởng đến quy mô. VISReg đạt được ba ưu điểm chính: 1. **Ổn định & Hiệu quả:** Không cần các thủ thuật huấn luyện phức tạp (như EMA, mạng giáo viên-học sinh), dễ điều chỉnh tham số và mở rộng. Độ phức tạp tính toán tuyến tính, thấp hơn so với VICReg. 2. **Khả năng tổng quát hóa mạnh mẽ:** Trên 15 bộ dữ liệu (gồm 8 nội miền và 6 ngoại phân phối - OOD), VISReg vượt trội hoặc ngang bằng các phương pháp SSL hàng đầu như DINO, MAE, I-JEPA. Đặc biệt, khi được đào tạo trên ImageNet-22K (~14 triệu ảnh), nó đạt hiệu suất OOD tương đương DINOv2 được đào tạo trên tập dữ liệu lớn gấp 10 lần. 3. **Linh hoạt:** Ch...

Nền tảng của mô hình thế giới JEPA là Học tự giám sát (Self-Supervised Learning, SSL) mà Yann LeCun đã đề xuất liên tục từ năm 2017.

SSL có thể học các biểu diễn tổng quát từ lượng dữ liệu khổng lồ mà không cần chú thích thủ công, nhưng phổ biến phải đối mặt với một vấn đề cốt lõi - sụp đổ biểu diễn (representation collapse): mô hình có xu hướng ánh xạ các đầu vào khác nhau vào cùng một hoặc rất ít vector, trông có vẻ đã hoàn thành việc huấn luyện nhưng thực tế chưa học được biểu diễn có khả năng phân biệt.

Để ngăn chặn sự sụp đổ, các phương pháp chủ đạo phần lớn phụ thuộc vào một loạt kỹ thuật heuristic (EMA, mạng giáo viên-học sinh, dừng gradient, đóng băng lớp, v.v.). Những kỹ thuật này làm cho việc huấn luyện trở nên mong manh, khó điều chỉnh tham số, đồng thời làm suy yếu khả năng diễn giải và mở rộng của phương pháp.

Một hướng tiếp cận khác là trực tiếp ràng buộc phân phối biểu diễn thông qua các thành phần chính quy hóa.

VICReg do nhóm của LeCun đề xuất chia mục tiêu học thành ba thành phần: phương sai, bất biến và hiệp phương sai, sử dụng hiệp phương sai để ràng buộc sự tương quan giữa các chiều; nhưng hiệp phương sai chỉ mô tả thống kê bậc hai, không thể phân biệt được hai loại biểu diễn "có cùng giá trị trung bình, phương sai, nhưng hình dạng phân phối khác nhau".

SIGReg được đề xuất sau đó dựa trên định lý Cramér–Wold, sử dụng kỹ thuật sketching để căn chỉnh toàn bộ phân phối nhúng với phân phối chuẩn chuẩn, từ đó ràng buộc hình dạng phân phối hoàn chỉnh.

Tuy nhiên, SIGReg vẫn tồn tại hai nhược điểm chính:

  • Gradient biến mất khi sụp đổ: Khi biểu diễn bắt đầu sụp đổ, gradient của SIGReg cũng suy giảm theo - sự sụp đổ càng nghiêm trọng, tín hiệu sửa chữa càng yếu, mô hình khó tự phục hồi;
  • Ghép đôi quy mô và hình dạng: Chưa tách riêng hai thuộc tính độc lập "kích thước độ lớn (quy mô)" và "hình thái phân phối (hình dạng)", hai yếu tố này can thiệp lẫn nhau trong quá trình tối ưu hóa, dẫn đến khả năng thích ứng kém hơn trên dữ liệu đuôi dài, chất lượng thấp, hạng thấp.

Nói cách khác, khi mô hình cần tín hiệu gradient nhất để thoát khỏi trạng thái sụp đổ, gradient của SIGReg lại tiệm cận biến mất.

Đây chính là vấn đề cốt lõi mà VISReg cần giải quyết.

Gần đây, công trình học tự giám sát mới VISReg (Variance-Invariance-Sketching Regularization) được chủ nhân giải Turing Yann LeCun liên tục chuyển tiếp và đánh giá cao - ông nhận xét khi chuyển tiếp: "VICReg begat SIGReg which begat VISReg" (VICReg sinh ra SIGReg, SIGReg lại sinh ra VISReg), một câu nói đã nêu rõ sự kế thừa công nghệ của hướng tiếp cận chính quy hóa này.

Được LeCun công nhận như vậy, VISReg mạnh ở điểm nào?

Câu trả lời nằm ở chỗ: Nó chính xác nhắm vào vấn đề cốt lõi của mô hình thế giới JEPA mà LeCun đã đặt cược lâu dài - sụp đổ biểu diễn (representation collapse).

Liên kết bài báo:https://arxiv.org/abs/2606.02572

Mã nguồn / Trọng số tiền huấn luyện:https://github.com/HaiyuWu/visreg

Trang chủ dự án:https://haiyuwu.github.io/visreg/

VISReg tách thành phần chính quy hóa ngăn sụp đổ thành hai mục tiêu độc lập "quy mô" và "hình dạng", mà không phụ thuộc vào bất kỳ kỹ thuật huấn luyện heuristic nào hay lượng dữ liệu khổng lồ, đã vượt qua 7 phương pháp học tự giám sát chủ đạo về hiệu suất tổng hợp trên 15 tập dữ liệu; trong đó chỉ sử dụng khoảng 1/10 dữ liệu huấn luyện, đã đuổi kịp DINOv2 trên chuẩn ngoài phân phối (OOD).

Hình 2: Mô phỏng biên độ gradient ‖∇L‖ của các phương pháp chính quy hóa khác nhau ở các giai đoạn sụp đổ biểu diễn. VISReg vẫn duy trì được gradient mạnh trong trạng thái sụp đổ, trong khi gradient của SIGReg gần như biến mất.

Phương pháp cốt lõi

VISReg kết hợp ưu điểm của VICReg và SIGReg: giữ lại thành phần phương sai của VICReg để kiểm soát quy mô, đồng thời sử dụng mục tiêu sketching dựa trên khoảng cách Wasserstein cắt lát (Sliced Wasserstein Distance, SWD) thay thế thành phần hiệp phương sai để kiểm soát hình dạng, và thông qua stop-gradient để tách rời hai thành phần này một cách triệt để. Toàn bộ mục tiêu chính quy hóa gồm ba phần.

1. Chính quy hóa Quy mô (Scale Regularization)

Phần đầu tiên ràng buộc phương sai của từng chiều, ngăn chặn sụp đổ biên độ:

Tính chất quan trọng của nó là: Khi mô hình sụp đổ, gradient của thành phần này tiệm cận một hằng số, từ đó đảm bảo mô hình có thể phục hồi ổn định - điều này bù đắp chính xác nhược điểm gradient biến mất của SIGReg.

2. Chính quy hóa Hình dạng (Shape Regularization)

Phần thứ hai trước tiên chuẩn hóa để loại bỏ ảnh hưởng của quy mô, sau đó ràng buộc riêng hình dạng. Bước then chốt là chuẩn hóa có "dừng gradient" (stop-gradient, sg):

Ở đây, stop-gradient được áp dụng cho độ lệch chuẩn σσ, khiến việc tối ưu hóa mất mát hình dạng sẽ không thay đổi ngược lại quy mô - đây chính là cơ chế mà hai mục tiêu "quy mô" và "hình dạng" thực sự tách rời, không can thiệp lẫn nhau.

Sau khi chuẩn hóa, sử dụng khoảng cách Wasserstein cắt lát để căn chỉnh hình dạng hình học của phân phối với phân phối Gauss đẳng hướng:

Trong đó

là phân vị chuẩn Gauss,

là hướng chiếu ngẫu nhiên (tức là "cắt lát / sketching").

Cơ sở lý thuyết của nó là Định lý Cramér–Wold (Bổ đề 3.1 của bài báo): Hai phân phối bằng nhau khi và chỉ khi tất cả các phép chiếu một chiều của chúng dọc theo mọi hướng trên hình cầu đơn vị đều bằng nhau. Do đó, chỉ cần căn chỉnh biểu diễn đa chiều sau khi cắt lát theo đủ nhiều hướng một chiều ngẫu nhiên với phân phối Gauss, thì tương đương với việc căn chỉnh toàn bộ phân phối trong không gian đa chiều - điều này cho phép sử dụng thao tác sắp xếp một chiều rẻ tiền để mô tả hình dạng phân phối hoàn chỉnh, thay vì chỉ là thống kê bậc hai.

3. Mục tiêu hợp nhất

Phần thứ ba là một tổn thất tâm hóa kéo giá trị trung bình batch μ về gốc tọa độ

Ba thành phần chính quy hóa được kết hợp theo trọng số:

Tổn thất dự đoán sử dụng mục tiêu bất biến của JEPA / LeJEPA - căn chỉnh các embedding của các góc nhìn (global + local, tổng cộng V góc nhìn)

về giá trị trung bình của góc nhìn toàn cục

:

Cuối cùng, sử dụng một siêu tham số λ để cân bằng giữa dự đoán và chính quy hóa, thu được mục tiêu hoàn chỉnh:

So sánh với VICReg: VICReg cũng tách chính quy hóa thành phương sai + hiệp phương sai, nhưng hiệp phương sai chỉ mô tả thống kê bậc hai; VISReg sử dụng mục tiêu sketching dựa trên Wasserstein cắt lát để mô tả đầy đủ hình dạng phân phối, đồng thời giữ lại thành phần phương sai để kiểm soát quy mô - vừa giữ được tính linh hoạt của VICReg, vừa đạt được tính chặt chẽ ở cấp độ phân phối.

Chỉ cần khoảng 15 dòng mã PyTorch

Mục tiêu chính quy hóa này rất nhẹ trong việc triển khai, logic cốt lõi chỉ cần khoảng 15 dòng:

Độ phức tạp tính toán và khả năng mở rộng

Về mặt tính toán và khả năng mở rộng, VISReg cũng có ưu thế. Độ phức tạp tính toán của phần chính quy hóa là

(N là batch, D là số chiều, K là số lát cắt), là tuyến tính đối với tất cả các yếu tố mở rộng; ngược lại, thành phần hiệp phương sai của VICReg là

, tăng theo bình phương của số chiều.

Ở quy mô batch tương đương, tốc độ chạy và mức sử dụng bộ nhớ của VISReg trên một GPU H100 đều vượt trội so với SIGReg.

Quan trọng hơn, K lát cắt ngẫu nhiên có thể được phân bổ trên nhiều GPU: trên M GPU, mỗi GPU tạo K/M lát cắt, hiệu quả tương đương với việc tạo tất cả K lát cắt trên một GPU.

Trong thử nghiệm, khi số lát cắt trên một GPU không đủ, chuyển sang sử dụng 8 GPU, mỗi GPU 128 lát cắt (tổng cộng 1024), có thể thu hẹp khoảng cách độ chính xác với "một GPU 1024 lát cắt" từ khoảng 2.4% xuống 0.22%. Điều này có nghĩa là khi mở rộng quy mô huấn luyện, K có thể giữ nguyên hằng số, hầu như không tăng thêm gánh nặng cho mỗi GPU.

Hình: Thay đổi độ chính xác thăm dò tuyến tính khi tăng số lượng GPU với K và D cố định. Khi K không đủ (K = 1⁄4D), sử dụng số lượng GPU gấp 8 lần có thể bù đắp độ chính xác đến mức K = 2D - điều này cho phép duy trì hằng số K trong huấn luyện quy mô lớn.

Kết quả thử nghiệm

Trở lại câu hỏi trong tiêu đề - VISReg mạnh thực sự ở đâu? Nhóm nghiên cứu đã so sánh VISReg với 7 phương pháp học tự giám sát chủ đạo như MoCoV3, DINO, iBOT, I-JEPA, MAE, data2vec trên 15 tập dữ liệu (8 trong miền + 6 ngoài phân phối + dự đoán dày đặc ADE20K), bao gồm các lĩnh vực thiên văn, y tế, viễn thám, kết cấu, hoa, v.v. Câu trả lời được thể hiện ở nhiều chiều, từ nhận dạng đến phân đoạn, tạo sinh.

1. Thăm dò tuyến tính Trong miền (In-Domain)

Để đảm bảo so sánh công bằng, thí nghiệm được chia thành hai nhóm dựa trên việc có sử dụng kỹ thuật heuristic hay không. Trong nhóm không sử dụng bất kỳ kỹ thuật heuristic nào, VISReg dẫn đầu: độ chính xác thăm dò tuyến tính trong miền của ViT-B/16 đạt 75.7%, cao hơn MAE (75.1%); ViT-L/14 tăng lên 77.0%, cao hơn LeJEPA (75.6%). So với iBOT, DINO sử dụng kỹ thuật heuristic, VISReg chỉ thấp hơn một chút trên các tập dữ liệu thông thường, nhưng vượt qua tất cả các phương pháp trên tập dữ liệu kết cấu DTD - điều này cho thấy khả năng tổng quát hóa xuyên miền của nó xuất phát từ bản thân phương pháp, chứ không phải do xếp chồng các kỹ thuật thủ công.

2. Tổng quát hóa Ngoài phân phối (OOD): Tối ưu toàn diện

Tổng quát hóa ngoài phân phối là một bài kiểm tra nghiêm ngặt hơn độ chính xác trong miền: các phương pháp phụ thuộc heuristic thường được điều chỉnh tối ưu kỹ lưỡng trong miền ImageNet, nhưng chưa chắc đã chuyển giao được sang phân phối mới khác biệt lớn. Nhóm nghiên cứu đánh giá trên 6 tập dữ liệu OOD bao phủ các lĩnh vực y tế (ChestXRay, RetinaMNIST, OrganAMNIST), thiên văn (Galaxy10), viễn thám (AID), kết cấu (DTD), những tập dữ liệu này hoàn toàn không liên quan đến miền huấn luyện ImageNet. Kết quả cho thấy, VISReg đạt được độ chính xác OOD trung bình tốt nhất trên tất cả các phương pháp và tất cả các quy mô kiến trúc, thậm chí vượt qua một số phương pháp sử dụng kỹ thuật heuristic và có kiến trúc lớn hơn.

Hình 4: Độ chính xác thăm dò tuyến tính OOD trung bình. VISReg vượt trội toàn diện so với iBOT, DINO, MoCoV3, I-JEPA, MAE, data2vaec, v.v.

Như Hình 4 cho thấy, độ chính xác OOD trung bình của ViT-B/16 với VISReg là 70.19%, ViT-L/14 là 70.63%, rõ ràng cao hơn MAE (67.85%), và vượt trội hơn các phương pháp như MoCoV3 (69.46%), DINO (69.56%), I-JEPA (68.55%).

3. Hiệu quả dữ liệu: Với 1/10 dữ liệu ngang bằng DINOv2

Khi tiền huấn luyện VISReg (ViT-L/14) trên ImageNet-22K (khoảng 14 triệu hình ảnh), độ chính xác trung bình trên 6 tập dữ liệu OOD đạt 72.94%, tương đương với DINOv2 (72.93%) được huấn luyện trên quy mô gấp 10 lần LVD-142M (142 triệu hình ảnh). Nói cách khác, VISReg đạt được mức độ tương đương với khoảng 1/10 dữ liệu. (Để đối chiếu, VISReg cùng là ViT-L/14 nhưng chỉ được tiền huấn luyện trên ImageNet-1K có độ chính xác trung bình là 70.63%.) Điều này cho thấy biểu diễn mà nó học được có tính tổng quát rất mạnh.

Hình 5: VISReg được tiền huấn luyện trên ImageNet-22K, trên chuẩn OOD ngang bằng với DINOv2 được huấn luyện với dữ liệu gấp 10 lần (LVD-142M).

4. Tinh chỉnh chuyển giao: Vượt trội toàn diện so với DINO

Mặc dù độ chính xác thăm dò tuyến tính trong một số tập dữ liệu trong miền của VISReg hơi thấp hơn DINO, nhưng sau khi tinh chỉnh, nó vượt qua cả DINO và tiền huấn luyện có giám sát trên tất cả năm tập dữ liệu CIFAR-10, CIFAR-100, Flowers, ImageNet-1K, Galaxy10 - điều này cho thấy phân phối biểu diễn của nó đồng đều hơn, dư thừa thấp hơn, khả năng chuyển giao mạnh hơn.

Hình: So sánh học chuyển giao. Sau tinh chỉnh, VISReg vượt trội hơn DINO và tiền huấn luyện có giám sát trên tất cả các tập dữ liệu thử nghiệm (CIFAR-10, CIFAR-100, Flowers, ImageNet-1K, Galaxy10).

5. Dự đoán dày đặc và hướng dẫn tạo sinh

Ưu thế của VISReg không chỉ giới hạn ở phân loại. Trên phân đoạn ngữ nghĩa tuyến tính ADE20K (ViT-B/16), mIoU của nó là 30.16, cao hơn DINO (29.40) và MAE (23.60), chỉ đứng sau MoCoV3 (31.69); trong điều kiện không sử dụng bất kỳ kỹ thuật heuristic nào, kết quả này có tính cạnh tranh. Bài báo cũng thừa nhận, dự đoán dày đặc vẫn còn khoảng cách với phương pháp tốt nhất, là trọng tâm tối ưu hóa tiếp theo.

Hình 7: Phân đoạn ngữ nghĩa tuyến tính trên ADE20K. Trong điều kiện không sử dụng bất kỳ kỹ thuật heuristic nào, VISReg đạt được mIoU có tính cạnh tranh, chỉ đứng sau MoCoV3.

Trong hướng dẫn tạo sinh (SiT-B/2, khung iREPA, 100 nghìn bước huấn luyện), việc tạo sinh được hướng dẫn bởi đặc trưng VISReg vượt trội hơn DINO ở ba trong bốn chỉ số: gFID 40.36 (DINO 41.15), Precision 51.38 (DINO 50.51), Recall 61.26 (DINO 60.70), IS cơ bản ngang bằng (33.48 so với 33.47). Điều này cho thấy biểu diễn mà VISReg học được cũng tốt hơn khi làm tín hiệu hướng dẫn tạo sinh.

Hình 8: Tạo ảnh sử dụng SiT-B/2, được hướng dẫn bởi đặc trưng của VISReg và DINO. VISReg cung cấp hướng dẫn tốt hơn trên hầu hết các chỉ số (gFID thấp hơn, Precision và Recall cao hơn).

6. Độ bền vững trên dữ liệu chất lượng thấp

Trên các tập dữ liệu chất lượng thấp như phân phối đuôi dài (ImageNet-LT) và hạng thấp (Galaxy10), VISReg có thể ổn định ngăn chặn sự sụp đổ và học được biểu diễn có ý nghĩa, trong khi DINO thất bại trực tiếp nếu thiếu điều chỉnh tham số tinh tế.

Bảng 1: Độ chính xác thăm dò tuyến tính trên ImageNet-LT

Bảng 2: Độ chính xác thăm dò tuyến tính trong miền trên Galaxy10

Kết luận

VISReg cho thấy: Việc tách thành phần chính quy hóa biểu diễn thành hai thành phần độc lập "quy mô" và "hình dạng", có thể thu được một phương pháp học tự giám sát ổn định hơn, hiệu quả hơn, có khả năng tổng quát hóa mạnh hơn so với các phương pháp hiện có.

Trong điều kiện không sử dụng bất kỳ kỹ thuật heuristic huấn luyện nào, nó đạt được kết quả dẫn đầu hoặc gần dẫn đầu ở nhiều chiều như nhận dạng hình ảnh, phân đoạn và hướng dẫn tạo sinh, và với khoảng 1/10 dữ liệu đã đạt được mức OOD của DINOv2. Điều này cung cấp một giải pháp chính quy hóa mới cho vấn đề sụp đổ biểu diễn tồn tại lâu dài trong mô hình thế giới JEPA.

Tài liệu tham khảo:

https://arxiv.org/abs/2606.02572

Bài viết này đến từ tài khoản WeChat công chúng "Tân Trí Nguyên", tác giả: LRST

Kripto yang Sedang Tren

Pertanyaan Terkait

QVISReg là gì và nó giải quyết vấn đề cốt lõi nào trong học tự giám sát?

AVISReg (Variance-Invariance-Sketching Regularization) là một phương pháp chính quy hóa mới trong học tự giám sát (SSL). Nó được thiết kế để giải quyết vấn đề cốt lõi 'sụp đổ biểu diễn' (representation collapse), nơi mà mô hình có xu hướng ánh xạ các đầu vào khác nhau thành cùng một hoặc một số ít vector, dẫn đến việc không học được các biểu diễn phân biệt hữu ích.

QVISReg cải tiến các phương pháp tiền nhiệm VICReg và SIGReg như thế nào?

AVISReg kế thừa và cải tiến từ VICReg và SIGReg. Nó giữ lại 'mục tiêu phương sai' (variance term) của VICReg để kiểm soát quy mô (scale), đồng thời thay thế 'mục tiêu hiệp phương sai' (covariance term) bằng một 'mục tiêu phác thảo dựa trên khoảng cách Sliced Wasserstein' (SWD) từ SIGReg để kiểm soát hình dạng phân phối (shape). Điểm then chốt là VISReg tách rời hai mục tiêu quy mô và hình dạng thông qua kỹ thuật dừng gradient, ngăn chúng can thiệp lẫn nhau trong quá trình tối ưu hóa, từ đó khắc phục nhược điểm gradient biến mất khi sụp đổ của SIGReg và sự hạn chế chỉ mô tả thống kê bậc hai của VICReg.

QKết quả thử nghiệm chính nào chứng minh hiệu quả vượt trội của VISReg?

ACác thử nghiệm chính cho thấy VISReg vượt trội trên nhiều mặt: (1) Đạt độ chính xác thăm dò tuyến tính (linear probing) tốt nhất trung bình trên 6 tập dữ liệu ngoài phân phối (OOD). (2) Chỉ sử dụng khoảng 1/10 dữ liệu (ImageNet-22K so với LVD-142M) nhưng đạt hiệu suất ngang bằng DINOv2 trên benchmark OOD. (3) Sau khi tinh chỉnh (fine-tuning), nó vượt trội DINO và huấn luyện có giám sát trên tất cả 5 tập dữ liệu thử nghiệm (CIFAR-10, CIFAR-100, Flowers, ImageNet-1K, Galaxy10). (4) Thể hiện tính ổn định và khả năng học tốt trên dữ liệu chất lượng thấp như phân phối đuôi dài (ImageNet-LT) và dữ liệu hạng thấp (Galaxy10), nơi các phương pháp như DINO có thể thất bại nếu không điều chỉnh tham số cẩn thận.

QTại sao VISReg được cho là có khả năng mở rộng tốt hơn về mặt tính toán?

AVISReg có khả năng mở rộng tính toán tốt hơn vì độ phức tạp tính toán của phần chính quy hóa là O(N*D*K) (với N là batch size, D là số chiều, K là số lát cắt ngẫu nhiên), tăng tuyến tính với tất cả các yếu tố. Trong khi đó, phần hiệp phương sai của VICReg có độ phức tạp O(N*D^2), tăng theo bình phương số chiều. Hơn nữa, các lát cắt ngẫu nhiên K có thể được phân tán trên nhiều GPU, cho phép mở rộng quy mô đào tạo mà hầu như không làm tăng gánh nặng tính toán trên mỗi GPU.

QTầm quan trọng của VISReg đối với mô hình thế giới JEPA mà Yann LeCun đề xuất là gì?

AVISReg có tầm quan trọng đặc biệt đối với lộ trình phát triển mô hình thế giới JEPA (Joint-Embedding Predictive Architecture) mà Yann LeCun đang theo đuổi. JEPA dựa trên nền tảng học tự giám sát để học các biểu diễn chung, và 'sụp đổ biểu diễn' là một thách thức cốt lõi cản trở hiệu quả của nó. Bằng cách cung cấp một cơ chế chính quy hóa ổn định, mạnh mẽ và có thể mở rộng để ngăn chặn sụp đổ mà không cần dựa vào các thủ thuật heuristic phức tạp, VISReg trực tiếp giải quyết một vấn đề then chốt trong kiến trúc JEPA, mở đường cho việc xây dựng các mô hình thế giới tự giám sát mạnh mẽ và có khả năng tổng quát hóa cao hơn.

Bacaan Terkait

Laporan Pertengahan Tahun RWA On-Chain 2026: Kapitalisasi Pasar Saham Tokenisasi Meningkat Dua Kali Lipat dalam Setahun, Namun 90% Hak Hanyalah Cangkang Kosong

Laporan Tengah Tahun RWA On-Chain 2026: Kapitalisasi Pasar Saham Ter-tokenisasi Melonjak Dua Kali Lipat dalam Setahun, Namun 90% Hak Adalah 'Cangkang Kosong' Meski data menunjukkan nilai pasar saham ter-tokenisasi terdistribusi naik dari $951 juta (Maret 2026) menjadi $1.89 miliar (Juli 2026), laporan dari insights4vc ini mengungkap kontradiksi mendasar di balik angka tersebut. Mayoritas produk yang memiliki likuiditas tinggi (seperti dari Ondo dan xStocks yang menguasai 72.7% nilai) adalah produk 'pembungkus' yang tidak memberikan hak kepemilikan hukum yang nyata atas saham dasarnya. Sebaliknya, produk yang memiliki hak hukum penuh (seperti saham kanonik) masih sangat terbatas likuiditas dan distribusinya. Pasar berkembang ke arah dua jalur berbeda: produk lepas pantai berfokus pada keterjangkauan dan kompatibilitas lintas blockchain, sementara infrastruktur AS yang teregulasi fokus pada kepastian hukum dan integrasi dengan sistem penyelesaian tradisional (seperti DTC). Tidak ada produk yang saat ini secara berskala menggabungkan keempat elemen kunci: kepemilikan hukum standar, distribusi luas, likuiditas institusional, dan penemuan harga mandiri di on-chain. Pertumbuhan besar didorong terutama oleh beberapa produk saja (SECZ, FGRS, STRCx). Konsentrasi tinggi terjadi di beberapa platform, dan meski tersebar di berbagai jaringan blockchain, banyak produk masih bergantung pada penyedia jasa keuangan tradisional yang sama. Intinya, laporan ini menekankan perlunya kehati-hatian: angka kapitalisasi pasar yang besar tidak mencerminkan arus dana investor atau keutuhan hak kepemilikan. Mayoritas nilai yang dilaporkan berasal dari instrumen yang lebih menyerupai kontrak turunan daripada kepemilikan saham langsung yang sah.

marsbit11m yang lalu

Laporan Pertengahan Tahun RWA On-Chain 2026: Kapitalisasi Pasar Saham Tokenisasi Meningkat Dua Kali Lipat dalam Setahun, Namun 90% Hak Hanyalah Cangkang Kosong

marsbit11m yang lalu

Bitcoin di Agustus: Ahli Menantikan Pengujian Rentang, Bukan Pembalikan Cepat

Bitcoin pada Agustus, menurut para analis, kemungkinan akan tetap berada di bawah tekanan. Setelah pemulihan di bulan Juli, pasar tampaknya belum siap untuk pertumbuhan berkelanjutan, dengan risiko penurunan di bawah $60.000 masih ada. Pada akhir Juli, bitcoin diperdagangkan sekitar $63.500, turun sekitar 50% dari rekor tertingginya pada Oktober 2025. Para ahli menyebut kombinasi kondisi makroekonomi yang sulit sebagai faktor penekan, termasuk suku bunga tinggi di AS, inflasi yang tetap tinggi, dan dolar AS yang kuat. Tingkat bunga yang tinggi membuat instrumen pendapatan tetap lebih menarik, sehingga mengalihkan modal dari aset berisiko seperti kripto. Selain itu, aliran keluar bersih dari ETF berbasis bitcoin pada paruh pertama tahun ini menandakan lemahnya permintaan kelembagaan saat ini. Secara historis, Agustus bukanlah bulan yang kuat untuk pasar kripto. Secara teknis, bitcoin terus bergerak dalam kisaran sempit $60.000–$65.000. Para analis memberikan beberapa skenario untuk bulan ini: skenario dasar adalah pergerakan dalam kisaran $58.000–$68.000 (probabilitas 50%), skenario negatif adalah penurunan ke $50.000–$55.000 (probabilitas 30%), dan skenario positif adalah kenaikan ke $71.000–$75.000 (probabilitas 20%). Saran untuk investor adalah fokus pada akumulasi bertahap pada level saat ini untuk jangka panjang, karena harga dianggap menarik. Namun, kewaspadaan diperlukan terhadap potensi penurunan jangka pendek di bawah $60.000. Pergerakan yang lebih signifikan kemungkinan baru akan terjadi pada kuartal IV tahun ini. Faktor kunci yang perlu dipantau meliputi keputusan suku bunga Fed, inflasi, dinamika ETF, dan minat terhadap aset berisiko.

cryptonews.ru2j yang lalu

Bitcoin di Agustus: Ahli Menantikan Pengujian Rentang, Bukan Pembalikan Cepat

cryptonews.ru2j yang lalu

Dompet Perangkat Keras Coldcard Diretas: Peretas Menarik 594 Bitcoin dalam 25 Menit

Dompet perangkat keras Coldcard berhasil diretas: peretas menarik 594 bitcoin dalam 25 menit. Insiden ini merusak reputasi dompet perangkat keras sebagai metode penyimpanan mata uang digital teraman. Pada 30 Juli 2026, penyerang berhasil menarik 594,5 BTC (sekitar $40 juta) dari 500 alamat. Akar masalahnya adalah bug perangkat lunak yang tak terdeteksi selama lima tahun. Kesalahan pengetikan dalam sebuah makro secara tidak sengaja menonaktifkan fungsi chip khusus untuk menghasilkan angka acak yang benar-benar aman di dompet Coldcard sejak Maret 2021. Alih-alih, perangkat menghasilkan kunci berdasarkan data yang dapat diprediksi, seperti nomor seri prosesor dan waktu sistem, sehingga sangat mengurangi keamanan kriptografinya. Peretas tidak memerlukan akses fisik. Mereka hanya perlu memahami parameter generator yang bermasalah ini dan melakukan pencarian brute-force secara offline untuk menghasilkan kemungkinan frasa seed, menemukan alamat dengan saldo di blockchain publik, dan menandatangani transaksi penarikan. Perusahaan di balik Coldcard, Coinkite, awalnya menyatakan versi baru tidak rentan, tetapi kemudian mengakui semua perangkat yang menjalankan firmware yang terpengaruh berisiko. CEO mereka meminta maaf namun mengecualikan kompensasi finansial kepada korban. Pemilik yang terdampak harus segera: 1. Memperbarui firmware ke versi aman (4.2.0 untuk Mk3, 5.6.0 untuk Mk4/Mk5, atau 1.5.0Q untuk model Q). 2. Menghasilkan frasa seed baru yang benar-benar acak pada perangkat yang telah diperbarui. 3. Memindahkan semua dana ke alamat baru yang dibuat dari frasa seed tersebut. Penggunaan frasa sandi BIP-39 dapat membantu, tetapi tidak menggantikan kebutuhan membuat kunci baru. Insiden ini menyoroti bahwa bahkan perangkat keras khusus memerlukan audit kode independen yang berkelanjutan, terutama untuk fungsi kriptografi. Beberapa lanalisis, termasuk dari Galaxy Research, memperkirakan total dana yang dicuri bisa mencapai 1.000 BTC. Kasus ini mengingatkan pada insiden serupa di masa lalu, seperti bug OpenSSL di Debian, dan mempertanyakan apakah audit otomatis oleh AI dapat sepenuhnya menggantikan tinjauan manusia pada kode kritis.

cryptonews.ru2j yang lalu

Dompet Perangkat Keras Coldcard Diretas: Peretas Menarik 594 Bitcoin dalam 25 Menit

cryptonews.ru2j yang lalu

Trading

Spot

Artikel Populer

Cara Membeli CORE

Selamat datang di HTX.com! Kami telah membuat pembelian CORE (CORE) menjadi mudah dan nyaman. Ikuti panduan langkah demi langkah kami untuk memulai perjalanan kripto Anda.Langkah 1: Buat Akun HTX AndaGunakan alamat email atau nomor ponsel Anda untuk mendaftar akun gratis di HTX. Rasakan perjalanan pendaftaran yang mudah dan buka semua fitur.Dapatkan Akun SayaLangkah 2: Buka Beli Kripto, lalu Pilih Metode Pembayaran AndaKartu Kredit/Debit: Gunakan Visa atau Mastercard Anda untuk membeli CORE (CORE) secara instan.Saldo: Gunakan dana dari saldo akun HTX Anda untuk melakukan trading dengan lancar.Pihak Ketiga: Kami telah menambahkan metode pembayaran populer seperti Google Pay dan Apple Pay untuk meningkatkan kenyamanan.P2P: Lakukan trading langsung dengan pengguna lain di HTX.Over-the-Counter (OTC): Kami menawarkan layanan yang dibuat khusus dan kurs yang kompetitif bagi para trader.Langkah 3: Simpan CORE (CORE) AndaSetelah melakukan pembelian, simpan CORE (CORE) di akun HTX Anda. Selain itu, Anda dapat mengirimkannya ke tempat lain melalui transfer blockchain atau menggunakannya untuk memperdagangkan mata uang kripto lainnya.Langkah 4: Lakukan trading CORE (CORE)Lakukan trading CORE (CORE) dengan mudah di pasar spot HTX. Cukup akses akun Anda, pilih pasangan perdagangan, jalankan trading, lalu pantau secara real-time. Kami menawarkan pengalaman yang ramah pengguna baik untuk pemula maupun trader berpengalaman.

715 Total TayanganDipublikasikan pada 2024.12.13Diperbarui pada 2026.06.02

Cara Membeli CORE

Diskusi

Selamat datang di Komunitas HTX. Di sini, Anda bisa terus mendapatkan informasi terbaru tentang perkembangan platform terkini dan mendapatkan akses ke wawasan pasar profesional. Pendapat pengguna mengenai harga CORE (CORE) disajikan di bawah ini.

活动图片