LeCun liên tục chuyển tiếp, tác phẩm mới VISReg giải quyết vấn đề cốt lõi "sụp đổ biểu diễn" trong mô hình thế giới JEPA

marsbit发布于2026-07-28更新于2026-07-28

文章摘要

Mô hình thế giới JEPA dựa trên nền tảng học tự giám sát (SSL) mà Yann LeCun ủng hộ từ năm 2017. Tuy nhiên, SSL thường đối mặt với vấn đề "sụp đổ biểu diễn" (representation collapse), khiến mô hình ánh xạ các đầu vào khác nhau vào quá ít vector, làm giảm khả năng phân biệt. Các phương pháp phổ biến hiện nay sử dụng nhiều thủ thuật phức tạp, dễ vỡ và khó giải thích. Công trình mới VISReg (Variance-Invariance-Sketching Regularization) do LeCun đánh giá cao, giải quyết vấn đề cốt lõi này bằng cách tách mục tiêu chính quy hóa thành hai phần độc lập: **"quy mô" (scale)** và **"hình dạng" (shape)**. - **Quy mô:** Kiểm soát phương sai của từng chiều biểu diễn, đảm bảo gradient vẫn mạnh ngay cả khi bắt đầu sụp đổ. - **Hình dạng:** Sử dụng khoảng cách Sliced Wasserstein (SWD) và kỹ thuật "stop-gradient" để căn chỉnh hình dạng phân phối biểu diễn với phân phối Gauss chuẩn, mà không ảnh hưởng đến quy mô. VISReg đạt được ba ưu điểm chính: 1. **Ổn định & Hiệu quả:** Không cần các thủ thuật huấn luyện phức tạp (như EMA, mạng giáo viên-học sinh), dễ điều chỉnh tham số và mở rộng. Độ phức tạp tính toán tuyến tính, thấp hơn so với VICReg. 2. **Khả năng tổng quát hóa mạnh mẽ:** Trên 15 bộ dữ liệu (gồm 8 nội miền và 6 ngoại phân phối - OOD), VISReg vượt trội hoặc ngang bằng các phương pháp SSL hàng đầu như DINO, MAE, I-JEPA. Đặc biệt, khi được đào tạo trên ImageNet-22K (~14 triệu ảnh), nó đạt hiệu suất OOD tương đương DINOv2 được đào tạo trên tập dữ liệu lớn gấp 10 lần. 3. **Linh hoạt:** Ch...

Nền tảng của mô hình thế giới JEPA là Học tự giám sát (Self-Supervised Learning, SSL) mà Yann LeCun đã đề xuất liên tục từ năm 2017.

SSL có thể học các biểu diễn tổng quát từ lượng dữ liệu khổng lồ mà không cần chú thích thủ công, nhưng phổ biến phải đối mặt với một vấn đề cốt lõi - sụp đổ biểu diễn (representation collapse): mô hình có xu hướng ánh xạ các đầu vào khác nhau vào cùng một hoặc rất ít vector, trông có vẻ đã hoàn thành việc huấn luyện nhưng thực tế chưa học được biểu diễn có khả năng phân biệt.

Để ngăn chặn sự sụp đổ, các phương pháp chủ đạo phần lớn phụ thuộc vào một loạt kỹ thuật heuristic (EMA, mạng giáo viên-học sinh, dừng gradient, đóng băng lớp, v.v.). Những kỹ thuật này làm cho việc huấn luyện trở nên mong manh, khó điều chỉnh tham số, đồng thời làm suy yếu khả năng diễn giải và mở rộng của phương pháp.

Một hướng tiếp cận khác là trực tiếp ràng buộc phân phối biểu diễn thông qua các thành phần chính quy hóa.

VICReg do nhóm của LeCun đề xuất chia mục tiêu học thành ba thành phần: phương sai, bất biến và hiệp phương sai, sử dụng hiệp phương sai để ràng buộc sự tương quan giữa các chiều; nhưng hiệp phương sai chỉ mô tả thống kê bậc hai, không thể phân biệt được hai loại biểu diễn "có cùng giá trị trung bình, phương sai, nhưng hình dạng phân phối khác nhau".

SIGReg được đề xuất sau đó dựa trên định lý Cramér–Wold, sử dụng kỹ thuật sketching để căn chỉnh toàn bộ phân phối nhúng với phân phối chuẩn chuẩn, từ đó ràng buộc hình dạng phân phối hoàn chỉnh.

Tuy nhiên, SIGReg vẫn tồn tại hai nhược điểm chính:

  • Gradient biến mất khi sụp đổ: Khi biểu diễn bắt đầu sụp đổ, gradient của SIGReg cũng suy giảm theo - sự sụp đổ càng nghiêm trọng, tín hiệu sửa chữa càng yếu, mô hình khó tự phục hồi;
  • Ghép đôi quy mô và hình dạng: Chưa tách riêng hai thuộc tính độc lập "kích thước độ lớn (quy mô)" và "hình thái phân phối (hình dạng)", hai yếu tố này can thiệp lẫn nhau trong quá trình tối ưu hóa, dẫn đến khả năng thích ứng kém hơn trên dữ liệu đuôi dài, chất lượng thấp, hạng thấp.

Nói cách khác, khi mô hình cần tín hiệu gradient nhất để thoát khỏi trạng thái sụp đổ, gradient của SIGReg lại tiệm cận biến mất.

Đây chính là vấn đề cốt lõi mà VISReg cần giải quyết.

Gần đây, công trình học tự giám sát mới VISReg (Variance-Invariance-Sketching Regularization) được chủ nhân giải Turing Yann LeCun liên tục chuyển tiếp và đánh giá cao - ông nhận xét khi chuyển tiếp: "VICReg begat SIGReg which begat VISReg" (VICReg sinh ra SIGReg, SIGReg lại sinh ra VISReg), một câu nói đã nêu rõ sự kế thừa công nghệ của hướng tiếp cận chính quy hóa này.

Được LeCun công nhận như vậy, VISReg mạnh ở điểm nào?

Câu trả lời nằm ở chỗ: Nó chính xác nhắm vào vấn đề cốt lõi của mô hình thế giới JEPA mà LeCun đã đặt cược lâu dài - sụp đổ biểu diễn (representation collapse).

Liên kết bài báo:https://arxiv.org/abs/2606.02572

Mã nguồn / Trọng số tiền huấn luyện:https://github.com/HaiyuWu/visreg

Trang chủ dự án:https://haiyuwu.github.io/visreg/

VISReg tách thành phần chính quy hóa ngăn sụp đổ thành hai mục tiêu độc lập "quy mô" và "hình dạng", mà không phụ thuộc vào bất kỳ kỹ thuật huấn luyện heuristic nào hay lượng dữ liệu khổng lồ, đã vượt qua 7 phương pháp học tự giám sát chủ đạo về hiệu suất tổng hợp trên 15 tập dữ liệu; trong đó chỉ sử dụng khoảng 1/10 dữ liệu huấn luyện, đã đuổi kịp DINOv2 trên chuẩn ngoài phân phối (OOD).

Hình 2: Mô phỏng biên độ gradient ‖∇L‖ của các phương pháp chính quy hóa khác nhau ở các giai đoạn sụp đổ biểu diễn. VISReg vẫn duy trì được gradient mạnh trong trạng thái sụp đổ, trong khi gradient của SIGReg gần như biến mất.

Phương pháp cốt lõi

VISReg kết hợp ưu điểm của VICReg và SIGReg: giữ lại thành phần phương sai của VICReg để kiểm soát quy mô, đồng thời sử dụng mục tiêu sketching dựa trên khoảng cách Wasserstein cắt lát (Sliced Wasserstein Distance, SWD) thay thế thành phần hiệp phương sai để kiểm soát hình dạng, và thông qua stop-gradient để tách rời hai thành phần này một cách triệt để. Toàn bộ mục tiêu chính quy hóa gồm ba phần.

1. Chính quy hóa Quy mô (Scale Regularization)

Phần đầu tiên ràng buộc phương sai của từng chiều, ngăn chặn sụp đổ biên độ:

Tính chất quan trọng của nó là: Khi mô hình sụp đổ, gradient của thành phần này tiệm cận một hằng số, từ đó đảm bảo mô hình có thể phục hồi ổn định - điều này bù đắp chính xác nhược điểm gradient biến mất của SIGReg.

2. Chính quy hóa Hình dạng (Shape Regularization)

Phần thứ hai trước tiên chuẩn hóa để loại bỏ ảnh hưởng của quy mô, sau đó ràng buộc riêng hình dạng. Bước then chốt là chuẩn hóa có "dừng gradient" (stop-gradient, sg):

Ở đây, stop-gradient được áp dụng cho độ lệch chuẩn σσ, khiến việc tối ưu hóa mất mát hình dạng sẽ không thay đổi ngược lại quy mô - đây chính là cơ chế mà hai mục tiêu "quy mô" và "hình dạng" thực sự tách rời, không can thiệp lẫn nhau.

Sau khi chuẩn hóa, sử dụng khoảng cách Wasserstein cắt lát để căn chỉnh hình dạng hình học của phân phối với phân phối Gauss đẳng hướng:

Trong đó

là phân vị chuẩn Gauss,

là hướng chiếu ngẫu nhiên (tức là "cắt lát / sketching").

Cơ sở lý thuyết của nó là Định lý Cramér–Wold (Bổ đề 3.1 của bài báo): Hai phân phối bằng nhau khi và chỉ khi tất cả các phép chiếu một chiều của chúng dọc theo mọi hướng trên hình cầu đơn vị đều bằng nhau. Do đó, chỉ cần căn chỉnh biểu diễn đa chiều sau khi cắt lát theo đủ nhiều hướng một chiều ngẫu nhiên với phân phối Gauss, thì tương đương với việc căn chỉnh toàn bộ phân phối trong không gian đa chiều - điều này cho phép sử dụng thao tác sắp xếp một chiều rẻ tiền để mô tả hình dạng phân phối hoàn chỉnh, thay vì chỉ là thống kê bậc hai.

3. Mục tiêu hợp nhất

Phần thứ ba là một tổn thất tâm hóa kéo giá trị trung bình batch μ về gốc tọa độ

Ba thành phần chính quy hóa được kết hợp theo trọng số:

Tổn thất dự đoán sử dụng mục tiêu bất biến của JEPA / LeJEPA - căn chỉnh các embedding của các góc nhìn (global + local, tổng cộng V góc nhìn)

về giá trị trung bình của góc nhìn toàn cục

:

Cuối cùng, sử dụng một siêu tham số λ để cân bằng giữa dự đoán và chính quy hóa, thu được mục tiêu hoàn chỉnh:

So sánh với VICReg: VICReg cũng tách chính quy hóa thành phương sai + hiệp phương sai, nhưng hiệp phương sai chỉ mô tả thống kê bậc hai; VISReg sử dụng mục tiêu sketching dựa trên Wasserstein cắt lát để mô tả đầy đủ hình dạng phân phối, đồng thời giữ lại thành phần phương sai để kiểm soát quy mô - vừa giữ được tính linh hoạt của VICReg, vừa đạt được tính chặt chẽ ở cấp độ phân phối.

Chỉ cần khoảng 15 dòng mã PyTorch

Mục tiêu chính quy hóa này rất nhẹ trong việc triển khai, logic cốt lõi chỉ cần khoảng 15 dòng:

Độ phức tạp tính toán và khả năng mở rộng

Về mặt tính toán và khả năng mở rộng, VISReg cũng có ưu thế. Độ phức tạp tính toán của phần chính quy hóa là

(N là batch, D là số chiều, K là số lát cắt), là tuyến tính đối với tất cả các yếu tố mở rộng; ngược lại, thành phần hiệp phương sai của VICReg là

, tăng theo bình phương của số chiều.

Ở quy mô batch tương đương, tốc độ chạy và mức sử dụng bộ nhớ của VISReg trên một GPU H100 đều vượt trội so với SIGReg.

Quan trọng hơn, K lát cắt ngẫu nhiên có thể được phân bổ trên nhiều GPU: trên M GPU, mỗi GPU tạo K/M lát cắt, hiệu quả tương đương với việc tạo tất cả K lát cắt trên một GPU.

Trong thử nghiệm, khi số lát cắt trên một GPU không đủ, chuyển sang sử dụng 8 GPU, mỗi GPU 128 lát cắt (tổng cộng 1024), có thể thu hẹp khoảng cách độ chính xác với "một GPU 1024 lát cắt" từ khoảng 2.4% xuống 0.22%. Điều này có nghĩa là khi mở rộng quy mô huấn luyện, K có thể giữ nguyên hằng số, hầu như không tăng thêm gánh nặng cho mỗi GPU.

Hình: Thay đổi độ chính xác thăm dò tuyến tính khi tăng số lượng GPU với K và D cố định. Khi K không đủ (K = 1⁄4D), sử dụng số lượng GPU gấp 8 lần có thể bù đắp độ chính xác đến mức K = 2D - điều này cho phép duy trì hằng số K trong huấn luyện quy mô lớn.

Kết quả thử nghiệm

Trở lại câu hỏi trong tiêu đề - VISReg mạnh thực sự ở đâu? Nhóm nghiên cứu đã so sánh VISReg với 7 phương pháp học tự giám sát chủ đạo như MoCoV3, DINO, iBOT, I-JEPA, MAE, data2vec trên 15 tập dữ liệu (8 trong miền + 6 ngoài phân phối + dự đoán dày đặc ADE20K), bao gồm các lĩnh vực thiên văn, y tế, viễn thám, kết cấu, hoa, v.v. Câu trả lời được thể hiện ở nhiều chiều, từ nhận dạng đến phân đoạn, tạo sinh.

1. Thăm dò tuyến tính Trong miền (In-Domain)

Để đảm bảo so sánh công bằng, thí nghiệm được chia thành hai nhóm dựa trên việc có sử dụng kỹ thuật heuristic hay không. Trong nhóm không sử dụng bất kỳ kỹ thuật heuristic nào, VISReg dẫn đầu: độ chính xác thăm dò tuyến tính trong miền của ViT-B/16 đạt 75.7%, cao hơn MAE (75.1%); ViT-L/14 tăng lên 77.0%, cao hơn LeJEPA (75.6%). So với iBOT, DINO sử dụng kỹ thuật heuristic, VISReg chỉ thấp hơn một chút trên các tập dữ liệu thông thường, nhưng vượt qua tất cả các phương pháp trên tập dữ liệu kết cấu DTD - điều này cho thấy khả năng tổng quát hóa xuyên miền của nó xuất phát từ bản thân phương pháp, chứ không phải do xếp chồng các kỹ thuật thủ công.

2. Tổng quát hóa Ngoài phân phối (OOD): Tối ưu toàn diện

Tổng quát hóa ngoài phân phối là một bài kiểm tra nghiêm ngặt hơn độ chính xác trong miền: các phương pháp phụ thuộc heuristic thường được điều chỉnh tối ưu kỹ lưỡng trong miền ImageNet, nhưng chưa chắc đã chuyển giao được sang phân phối mới khác biệt lớn. Nhóm nghiên cứu đánh giá trên 6 tập dữ liệu OOD bao phủ các lĩnh vực y tế (ChestXRay, RetinaMNIST, OrganAMNIST), thiên văn (Galaxy10), viễn thám (AID), kết cấu (DTD), những tập dữ liệu này hoàn toàn không liên quan đến miền huấn luyện ImageNet. Kết quả cho thấy, VISReg đạt được độ chính xác OOD trung bình tốt nhất trên tất cả các phương pháp và tất cả các quy mô kiến trúc, thậm chí vượt qua một số phương pháp sử dụng kỹ thuật heuristic và có kiến trúc lớn hơn.

Hình 4: Độ chính xác thăm dò tuyến tính OOD trung bình. VISReg vượt trội toàn diện so với iBOT, DINO, MoCoV3, I-JEPA, MAE, data2vaec, v.v.

Như Hình 4 cho thấy, độ chính xác OOD trung bình của ViT-B/16 với VISReg là 70.19%, ViT-L/14 là 70.63%, rõ ràng cao hơn MAE (67.85%), và vượt trội hơn các phương pháp như MoCoV3 (69.46%), DINO (69.56%), I-JEPA (68.55%).

3. Hiệu quả dữ liệu: Với 1/10 dữ liệu ngang bằng DINOv2

Khi tiền huấn luyện VISReg (ViT-L/14) trên ImageNet-22K (khoảng 14 triệu hình ảnh), độ chính xác trung bình trên 6 tập dữ liệu OOD đạt 72.94%, tương đương với DINOv2 (72.93%) được huấn luyện trên quy mô gấp 10 lần LVD-142M (142 triệu hình ảnh). Nói cách khác, VISReg đạt được mức độ tương đương với khoảng 1/10 dữ liệu. (Để đối chiếu, VISReg cùng là ViT-L/14 nhưng chỉ được tiền huấn luyện trên ImageNet-1K có độ chính xác trung bình là 70.63%.) Điều này cho thấy biểu diễn mà nó học được có tính tổng quát rất mạnh.

Hình 5: VISReg được tiền huấn luyện trên ImageNet-22K, trên chuẩn OOD ngang bằng với DINOv2 được huấn luyện với dữ liệu gấp 10 lần (LVD-142M).

4. Tinh chỉnh chuyển giao: Vượt trội toàn diện so với DINO

Mặc dù độ chính xác thăm dò tuyến tính trong một số tập dữ liệu trong miền của VISReg hơi thấp hơn DINO, nhưng sau khi tinh chỉnh, nó vượt qua cả DINO và tiền huấn luyện có giám sát trên tất cả năm tập dữ liệu CIFAR-10, CIFAR-100, Flowers, ImageNet-1K, Galaxy10 - điều này cho thấy phân phối biểu diễn của nó đồng đều hơn, dư thừa thấp hơn, khả năng chuyển giao mạnh hơn.

Hình: So sánh học chuyển giao. Sau tinh chỉnh, VISReg vượt trội hơn DINO và tiền huấn luyện có giám sát trên tất cả các tập dữ liệu thử nghiệm (CIFAR-10, CIFAR-100, Flowers, ImageNet-1K, Galaxy10).

5. Dự đoán dày đặc và hướng dẫn tạo sinh

Ưu thế của VISReg không chỉ giới hạn ở phân loại. Trên phân đoạn ngữ nghĩa tuyến tính ADE20K (ViT-B/16), mIoU của nó là 30.16, cao hơn DINO (29.40) và MAE (23.60), chỉ đứng sau MoCoV3 (31.69); trong điều kiện không sử dụng bất kỳ kỹ thuật heuristic nào, kết quả này có tính cạnh tranh. Bài báo cũng thừa nhận, dự đoán dày đặc vẫn còn khoảng cách với phương pháp tốt nhất, là trọng tâm tối ưu hóa tiếp theo.

Hình 7: Phân đoạn ngữ nghĩa tuyến tính trên ADE20K. Trong điều kiện không sử dụng bất kỳ kỹ thuật heuristic nào, VISReg đạt được mIoU có tính cạnh tranh, chỉ đứng sau MoCoV3.

Trong hướng dẫn tạo sinh (SiT-B/2, khung iREPA, 100 nghìn bước huấn luyện), việc tạo sinh được hướng dẫn bởi đặc trưng VISReg vượt trội hơn DINO ở ba trong bốn chỉ số: gFID 40.36 (DINO 41.15), Precision 51.38 (DINO 50.51), Recall 61.26 (DINO 60.70), IS cơ bản ngang bằng (33.48 so với 33.47). Điều này cho thấy biểu diễn mà VISReg học được cũng tốt hơn khi làm tín hiệu hướng dẫn tạo sinh.

Hình 8: Tạo ảnh sử dụng SiT-B/2, được hướng dẫn bởi đặc trưng của VISReg và DINO. VISReg cung cấp hướng dẫn tốt hơn trên hầu hết các chỉ số (gFID thấp hơn, Precision và Recall cao hơn).

6. Độ bền vững trên dữ liệu chất lượng thấp

Trên các tập dữ liệu chất lượng thấp như phân phối đuôi dài (ImageNet-LT) và hạng thấp (Galaxy10), VISReg có thể ổn định ngăn chặn sự sụp đổ và học được biểu diễn có ý nghĩa, trong khi DINO thất bại trực tiếp nếu thiếu điều chỉnh tham số tinh tế.

Bảng 1: Độ chính xác thăm dò tuyến tính trên ImageNet-LT

Bảng 2: Độ chính xác thăm dò tuyến tính trong miền trên Galaxy10

Kết luận

VISReg cho thấy: Việc tách thành phần chính quy hóa biểu diễn thành hai thành phần độc lập "quy mô" và "hình dạng", có thể thu được một phương pháp học tự giám sát ổn định hơn, hiệu quả hơn, có khả năng tổng quát hóa mạnh hơn so với các phương pháp hiện có.

Trong điều kiện không sử dụng bất kỳ kỹ thuật heuristic huấn luyện nào, nó đạt được kết quả dẫn đầu hoặc gần dẫn đầu ở nhiều chiều như nhận dạng hình ảnh, phân đoạn và hướng dẫn tạo sinh, và với khoảng 1/10 dữ liệu đã đạt được mức OOD của DINOv2. Điều này cung cấp một giải pháp chính quy hóa mới cho vấn đề sụp đổ biểu diễn tồn tại lâu dài trong mô hình thế giới JEPA.

Tài liệu tham khảo:

https://arxiv.org/abs/2606.02572

Bài viết này đến từ tài khoản WeChat công chúng "Tân Trí Nguyên", tác giả: LRST

热门币种推荐

相关问答

QVISReg là gì và nó giải quyết vấn đề cốt lõi nào trong học tự giám sát?

AVISReg (Variance-Invariance-Sketching Regularization) là một phương pháp chính quy hóa mới trong học tự giám sát (SSL). Nó được thiết kế để giải quyết vấn đề cốt lõi 'sụp đổ biểu diễn' (representation collapse), nơi mà mô hình có xu hướng ánh xạ các đầu vào khác nhau thành cùng một hoặc một số ít vector, dẫn đến việc không học được các biểu diễn phân biệt hữu ích.

QVISReg cải tiến các phương pháp tiền nhiệm VICReg và SIGReg như thế nào?

AVISReg kế thừa và cải tiến từ VICReg và SIGReg. Nó giữ lại 'mục tiêu phương sai' (variance term) của VICReg để kiểm soát quy mô (scale), đồng thời thay thế 'mục tiêu hiệp phương sai' (covariance term) bằng một 'mục tiêu phác thảo dựa trên khoảng cách Sliced Wasserstein' (SWD) từ SIGReg để kiểm soát hình dạng phân phối (shape). Điểm then chốt là VISReg tách rời hai mục tiêu quy mô và hình dạng thông qua kỹ thuật dừng gradient, ngăn chúng can thiệp lẫn nhau trong quá trình tối ưu hóa, từ đó khắc phục nhược điểm gradient biến mất khi sụp đổ của SIGReg và sự hạn chế chỉ mô tả thống kê bậc hai của VICReg.

QKết quả thử nghiệm chính nào chứng minh hiệu quả vượt trội của VISReg?

ACác thử nghiệm chính cho thấy VISReg vượt trội trên nhiều mặt: (1) Đạt độ chính xác thăm dò tuyến tính (linear probing) tốt nhất trung bình trên 6 tập dữ liệu ngoài phân phối (OOD). (2) Chỉ sử dụng khoảng 1/10 dữ liệu (ImageNet-22K so với LVD-142M) nhưng đạt hiệu suất ngang bằng DINOv2 trên benchmark OOD. (3) Sau khi tinh chỉnh (fine-tuning), nó vượt trội DINO và huấn luyện có giám sát trên tất cả 5 tập dữ liệu thử nghiệm (CIFAR-10, CIFAR-100, Flowers, ImageNet-1K, Galaxy10). (4) Thể hiện tính ổn định và khả năng học tốt trên dữ liệu chất lượng thấp như phân phối đuôi dài (ImageNet-LT) và dữ liệu hạng thấp (Galaxy10), nơi các phương pháp như DINO có thể thất bại nếu không điều chỉnh tham số cẩn thận.

QTại sao VISReg được cho là có khả năng mở rộng tốt hơn về mặt tính toán?

AVISReg có khả năng mở rộng tính toán tốt hơn vì độ phức tạp tính toán của phần chính quy hóa là O(N*D*K) (với N là batch size, D là số chiều, K là số lát cắt ngẫu nhiên), tăng tuyến tính với tất cả các yếu tố. Trong khi đó, phần hiệp phương sai của VICReg có độ phức tạp O(N*D^2), tăng theo bình phương số chiều. Hơn nữa, các lát cắt ngẫu nhiên K có thể được phân tán trên nhiều GPU, cho phép mở rộng quy mô đào tạo mà hầu như không làm tăng gánh nặng tính toán trên mỗi GPU.

QTầm quan trọng của VISReg đối với mô hình thế giới JEPA mà Yann LeCun đề xuất là gì?

AVISReg có tầm quan trọng đặc biệt đối với lộ trình phát triển mô hình thế giới JEPA (Joint-Embedding Predictive Architecture) mà Yann LeCun đang theo đuổi. JEPA dựa trên nền tảng học tự giám sát để học các biểu diễn chung, và 'sụp đổ biểu diễn' là một thách thức cốt lõi cản trở hiệu quả của nó. Bằng cách cung cấp một cơ chế chính quy hóa ổn định, mạnh mẽ và có thể mở rộng để ngăn chặn sụp đổ mà không cần dựa vào các thủ thuật heuristic phức tạp, VISReg trực tiếp giải quyết một vấn đề then chốt trong kiến trúc JEPA, mở đường cho việc xây dựng các mô hình thế giới tự giám sát mạnh mẽ và có khả năng tổng quát hóa cao hơn.

你可能也喜欢

彼得·希夫声称Strategy公司的STRC计划损害了MSTR股东的利益

Strategy公司(MSTR)发布二季度财报后,其股价在7月31日面临更大抛压。知名比特币批评者彼得·希夫随后指责公司宣称的核心企业目标——维持其优先股STRC价格接近100美元声明价值——损害了MSTR普通股股东的利益。希夫认为,该政策在优先股投资者和普通股股东之间造成了直接冲突,意味着公司并非以股东价值最大化为首要目标。 Strategy则解释,维持STRC价格稳定是其数字信贷资本更广泛战略的一部分,旨在稳定公司资本结构。STRC是一种永久优先股,目前提供每年12%的现金股息,且股息率每月调整,以激励其交易价格接近100美元面值,降低价格波动。该结构为公司收购比特币提供了额外融资渠道,但要求管理层平衡股息义务、流动性储备、优先股定价和普通股动态。 公司管理层已扩充美元储备至约37.5亿美元,用以覆盖约2.1年的优先股股息和利息支出,并回购了部分STRC。这些行动显示出公司意图强化优先股结构,同时保持财务灵活性。 市场观点出现分歧。希夫持续警告,Strategy对优先证券和资本募集的使用可能导致普通股股东权益被稀释。而其他机构如Grayscale Research则认为,公司近期出售部分比特币降低了融资风险,STRC价格的复苏也反映了市场对其资本结构的信心增强。未来考验在于公司如何平衡比特币增持、优先股股息支付、可能的股票回购以及普通股面临的市场压力。

cryptonews.ru46分钟前

彼得·希夫声称Strategy公司的STRC计划损害了MSTR股东的利益

cryptonews.ru46分钟前

交易

现货

热门文章

如何购买CORE

欢迎来到HTX.com!我们已经让购买Core DAO(CORE)变得简单而便捷。跟随我们的逐步指南,放心开始您的加密货币之旅。第一步:创建您的HTX账户使用您的电子邮件、手机号码注册一个免费账户在HTX上。体验无忧的注册过程并解锁所有平台功能。立即注册第二步:前往买币页面,选择您的支付方式信用卡/借记卡购买:使用您的Visa或Mastercard即时购买Core DAO(CORE)。余额购买:使用您HTX账户余额中的资金进行无缝交易。第三方购买:探索诸如Google Pay或Apple Pay等流行支付方法以增加便利性。C2C购买:在HTX平台上直接与其他用户交易。HTX场外交易台(OTC)购买:为大量交易者提供个性化服务和竞争性汇率。第三步:存储您的Core DAO(CORE)购买完您的Core DAO(CORE)后,将其存储在您的HTX账户钱包中。您也可以通过区块链转账将其发送到其他地方或者用于交易其他加密货币。第四步:交易Core DAO(CORE)在HTX的现货市场轻松交易Core DAO(CORE)。访问您的账户,选择您的交易对,执行您的交易,并实时监控。HTX为初学者和经验丰富的交易者提供了友好的用户体验。

1.4k人学过发布于 2024.05.09更新于 2026.06.02

如何购买CORE

相关讨论

欢迎来到HTX社区。在这里,您可以了解最新的平台发展动态并获得专业的市场意见。以下是用户对CORE(CORE)币价的意见。

活动图片