LeCun liên tục chuyển tiếp, tác phẩm mới VISReg giải quyết vấn đề cốt lõi "sụp đổ biểu diễn" trong mô hình thế giới JEPA

marsbitОпубликовано 2026-07-28Обновлено 2026-07-28

Введение

Mô hình thế giới JEPA dựa trên nền tảng học tự giám sát (SSL) mà Yann LeCun ủng hộ từ năm 2017. Tuy nhiên, SSL thường đối mặt với vấn đề "sụp đổ biểu diễn" (representation collapse), khiến mô hình ánh xạ các đầu vào khác nhau vào quá ít vector, làm giảm khả năng phân biệt. Các phương pháp phổ biến hiện nay sử dụng nhiều thủ thuật phức tạp, dễ vỡ và khó giải thích. Công trình mới VISReg (Variance-Invariance-Sketching Regularization) do LeCun đánh giá cao, giải quyết vấn đề cốt lõi này bằng cách tách mục tiêu chính quy hóa thành hai phần độc lập: **"quy mô" (scale)** và **"hình dạng" (shape)**. - **Quy mô:** Kiểm soát phương sai của từng chiều biểu diễn, đảm bảo gradient vẫn mạnh ngay cả khi bắt đầu sụp đổ. - **Hình dạng:** Sử dụng khoảng cách Sliced Wasserstein (SWD) và kỹ thuật "stop-gradient" để căn chỉnh hình dạng phân phối biểu diễn với phân phối Gauss chuẩn, mà không ảnh hưởng đến quy mô. VISReg đạt được ba ưu điểm chính: 1. **Ổn định & Hiệu quả:** Không cần các thủ thuật huấn luyện phức tạp (như EMA, mạng giáo viên-học sinh), dễ điều chỉnh tham số và mở rộng. Độ phức tạp tính toán tuyến tính, thấp hơn so với VICReg. 2. **Khả năng tổng quát hóa mạnh mẽ:** Trên 15 bộ dữ liệu (gồm 8 nội miền và 6 ngoại phân phối - OOD), VISReg vượt trội hoặc ngang bằng các phương pháp SSL hàng đầu như DINO, MAE, I-JEPA. Đặc biệt, khi được đào tạo trên ImageNet-22K (~14 triệu ảnh), nó đạt hiệu suất OOD tương đương DINOv2 được đào tạo trên tập dữ liệu lớn gấp 10 lần. 3. **Linh hoạt:** Ch...

Nền tảng của mô hình thế giới JEPA là Học tự giám sát (Self-Supervised Learning, SSL) mà Yann LeCun đã đề xuất liên tục từ năm 2017.

SSL có thể học các biểu diễn tổng quát từ lượng dữ liệu khổng lồ mà không cần chú thích thủ công, nhưng phổ biến phải đối mặt với một vấn đề cốt lõi - sụp đổ biểu diễn (representation collapse): mô hình có xu hướng ánh xạ các đầu vào khác nhau vào cùng một hoặc rất ít vector, trông có vẻ đã hoàn thành việc huấn luyện nhưng thực tế chưa học được biểu diễn có khả năng phân biệt.

Để ngăn chặn sự sụp đổ, các phương pháp chủ đạo phần lớn phụ thuộc vào một loạt kỹ thuật heuristic (EMA, mạng giáo viên-học sinh, dừng gradient, đóng băng lớp, v.v.). Những kỹ thuật này làm cho việc huấn luyện trở nên mong manh, khó điều chỉnh tham số, đồng thời làm suy yếu khả năng diễn giải và mở rộng của phương pháp.

Một hướng tiếp cận khác là trực tiếp ràng buộc phân phối biểu diễn thông qua các thành phần chính quy hóa.

VICReg do nhóm của LeCun đề xuất chia mục tiêu học thành ba thành phần: phương sai, bất biến và hiệp phương sai, sử dụng hiệp phương sai để ràng buộc sự tương quan giữa các chiều; nhưng hiệp phương sai chỉ mô tả thống kê bậc hai, không thể phân biệt được hai loại biểu diễn "có cùng giá trị trung bình, phương sai, nhưng hình dạng phân phối khác nhau".

SIGReg được đề xuất sau đó dựa trên định lý Cramér–Wold, sử dụng kỹ thuật sketching để căn chỉnh toàn bộ phân phối nhúng với phân phối chuẩn chuẩn, từ đó ràng buộc hình dạng phân phối hoàn chỉnh.

Tuy nhiên, SIGReg vẫn tồn tại hai nhược điểm chính:

  • Gradient biến mất khi sụp đổ: Khi biểu diễn bắt đầu sụp đổ, gradient của SIGReg cũng suy giảm theo - sự sụp đổ càng nghiêm trọng, tín hiệu sửa chữa càng yếu, mô hình khó tự phục hồi;
  • Ghép đôi quy mô và hình dạng: Chưa tách riêng hai thuộc tính độc lập "kích thước độ lớn (quy mô)" và "hình thái phân phối (hình dạng)", hai yếu tố này can thiệp lẫn nhau trong quá trình tối ưu hóa, dẫn đến khả năng thích ứng kém hơn trên dữ liệu đuôi dài, chất lượng thấp, hạng thấp.

Nói cách khác, khi mô hình cần tín hiệu gradient nhất để thoát khỏi trạng thái sụp đổ, gradient của SIGReg lại tiệm cận biến mất.

Đây chính là vấn đề cốt lõi mà VISReg cần giải quyết.

Gần đây, công trình học tự giám sát mới VISReg (Variance-Invariance-Sketching Regularization) được chủ nhân giải Turing Yann LeCun liên tục chuyển tiếp và đánh giá cao - ông nhận xét khi chuyển tiếp: "VICReg begat SIGReg which begat VISReg" (VICReg sinh ra SIGReg, SIGReg lại sinh ra VISReg), một câu nói đã nêu rõ sự kế thừa công nghệ của hướng tiếp cận chính quy hóa này.

Được LeCun công nhận như vậy, VISReg mạnh ở điểm nào?

Câu trả lời nằm ở chỗ: Nó chính xác nhắm vào vấn đề cốt lõi của mô hình thế giới JEPA mà LeCun đã đặt cược lâu dài - sụp đổ biểu diễn (representation collapse).

Liên kết bài báo:https://arxiv.org/abs/2606.02572

Mã nguồn / Trọng số tiền huấn luyện:https://github.com/HaiyuWu/visreg

Trang chủ dự án:https://haiyuwu.github.io/visreg/

VISReg tách thành phần chính quy hóa ngăn sụp đổ thành hai mục tiêu độc lập "quy mô" và "hình dạng", mà không phụ thuộc vào bất kỳ kỹ thuật huấn luyện heuristic nào hay lượng dữ liệu khổng lồ, đã vượt qua 7 phương pháp học tự giám sát chủ đạo về hiệu suất tổng hợp trên 15 tập dữ liệu; trong đó chỉ sử dụng khoảng 1/10 dữ liệu huấn luyện, đã đuổi kịp DINOv2 trên chuẩn ngoài phân phối (OOD).

Hình 2: Mô phỏng biên độ gradient ‖∇L‖ của các phương pháp chính quy hóa khác nhau ở các giai đoạn sụp đổ biểu diễn. VISReg vẫn duy trì được gradient mạnh trong trạng thái sụp đổ, trong khi gradient của SIGReg gần như biến mất.

Phương pháp cốt lõi

VISReg kết hợp ưu điểm của VICReg và SIGReg: giữ lại thành phần phương sai của VICReg để kiểm soát quy mô, đồng thời sử dụng mục tiêu sketching dựa trên khoảng cách Wasserstein cắt lát (Sliced Wasserstein Distance, SWD) thay thế thành phần hiệp phương sai để kiểm soát hình dạng, và thông qua stop-gradient để tách rời hai thành phần này một cách triệt để. Toàn bộ mục tiêu chính quy hóa gồm ba phần.

1. Chính quy hóa Quy mô (Scale Regularization)

Phần đầu tiên ràng buộc phương sai của từng chiều, ngăn chặn sụp đổ biên độ:

Tính chất quan trọng của nó là: Khi mô hình sụp đổ, gradient của thành phần này tiệm cận một hằng số, từ đó đảm bảo mô hình có thể phục hồi ổn định - điều này bù đắp chính xác nhược điểm gradient biến mất của SIGReg.

2. Chính quy hóa Hình dạng (Shape Regularization)

Phần thứ hai trước tiên chuẩn hóa để loại bỏ ảnh hưởng của quy mô, sau đó ràng buộc riêng hình dạng. Bước then chốt là chuẩn hóa có "dừng gradient" (stop-gradient, sg):

Ở đây, stop-gradient được áp dụng cho độ lệch chuẩn σσ, khiến việc tối ưu hóa mất mát hình dạng sẽ không thay đổi ngược lại quy mô - đây chính là cơ chế mà hai mục tiêu "quy mô" và "hình dạng" thực sự tách rời, không can thiệp lẫn nhau.

Sau khi chuẩn hóa, sử dụng khoảng cách Wasserstein cắt lát để căn chỉnh hình dạng hình học của phân phối với phân phối Gauss đẳng hướng:

Trong đó

là phân vị chuẩn Gauss,

là hướng chiếu ngẫu nhiên (tức là "cắt lát / sketching").

Cơ sở lý thuyết của nó là Định lý Cramér–Wold (Bổ đề 3.1 của bài báo): Hai phân phối bằng nhau khi và chỉ khi tất cả các phép chiếu một chiều của chúng dọc theo mọi hướng trên hình cầu đơn vị đều bằng nhau. Do đó, chỉ cần căn chỉnh biểu diễn đa chiều sau khi cắt lát theo đủ nhiều hướng một chiều ngẫu nhiên với phân phối Gauss, thì tương đương với việc căn chỉnh toàn bộ phân phối trong không gian đa chiều - điều này cho phép sử dụng thao tác sắp xếp một chiều rẻ tiền để mô tả hình dạng phân phối hoàn chỉnh, thay vì chỉ là thống kê bậc hai.

3. Mục tiêu hợp nhất

Phần thứ ba là một tổn thất tâm hóa kéo giá trị trung bình batch μ về gốc tọa độ

Ba thành phần chính quy hóa được kết hợp theo trọng số:

Tổn thất dự đoán sử dụng mục tiêu bất biến của JEPA / LeJEPA - căn chỉnh các embedding của các góc nhìn (global + local, tổng cộng V góc nhìn)

về giá trị trung bình của góc nhìn toàn cục

:

Cuối cùng, sử dụng một siêu tham số λ để cân bằng giữa dự đoán và chính quy hóa, thu được mục tiêu hoàn chỉnh:

So sánh với VICReg: VICReg cũng tách chính quy hóa thành phương sai + hiệp phương sai, nhưng hiệp phương sai chỉ mô tả thống kê bậc hai; VISReg sử dụng mục tiêu sketching dựa trên Wasserstein cắt lát để mô tả đầy đủ hình dạng phân phối, đồng thời giữ lại thành phần phương sai để kiểm soát quy mô - vừa giữ được tính linh hoạt của VICReg, vừa đạt được tính chặt chẽ ở cấp độ phân phối.

Chỉ cần khoảng 15 dòng mã PyTorch

Mục tiêu chính quy hóa này rất nhẹ trong việc triển khai, logic cốt lõi chỉ cần khoảng 15 dòng:

Độ phức tạp tính toán và khả năng mở rộng

Về mặt tính toán và khả năng mở rộng, VISReg cũng có ưu thế. Độ phức tạp tính toán của phần chính quy hóa là

(N là batch, D là số chiều, K là số lát cắt), là tuyến tính đối với tất cả các yếu tố mở rộng; ngược lại, thành phần hiệp phương sai của VICReg là

, tăng theo bình phương của số chiều.

Ở quy mô batch tương đương, tốc độ chạy và mức sử dụng bộ nhớ của VISReg trên một GPU H100 đều vượt trội so với SIGReg.

Quan trọng hơn, K lát cắt ngẫu nhiên có thể được phân bổ trên nhiều GPU: trên M GPU, mỗi GPU tạo K/M lát cắt, hiệu quả tương đương với việc tạo tất cả K lát cắt trên một GPU.

Trong thử nghiệm, khi số lát cắt trên một GPU không đủ, chuyển sang sử dụng 8 GPU, mỗi GPU 128 lát cắt (tổng cộng 1024), có thể thu hẹp khoảng cách độ chính xác với "một GPU 1024 lát cắt" từ khoảng 2.4% xuống 0.22%. Điều này có nghĩa là khi mở rộng quy mô huấn luyện, K có thể giữ nguyên hằng số, hầu như không tăng thêm gánh nặng cho mỗi GPU.

Hình: Thay đổi độ chính xác thăm dò tuyến tính khi tăng số lượng GPU với K và D cố định. Khi K không đủ (K = 1⁄4D), sử dụng số lượng GPU gấp 8 lần có thể bù đắp độ chính xác đến mức K = 2D - điều này cho phép duy trì hằng số K trong huấn luyện quy mô lớn.

Kết quả thử nghiệm

Trở lại câu hỏi trong tiêu đề - VISReg mạnh thực sự ở đâu? Nhóm nghiên cứu đã so sánh VISReg với 7 phương pháp học tự giám sát chủ đạo như MoCoV3, DINO, iBOT, I-JEPA, MAE, data2vec trên 15 tập dữ liệu (8 trong miền + 6 ngoài phân phối + dự đoán dày đặc ADE20K), bao gồm các lĩnh vực thiên văn, y tế, viễn thám, kết cấu, hoa, v.v. Câu trả lời được thể hiện ở nhiều chiều, từ nhận dạng đến phân đoạn, tạo sinh.

1. Thăm dò tuyến tính Trong miền (In-Domain)

Để đảm bảo so sánh công bằng, thí nghiệm được chia thành hai nhóm dựa trên việc có sử dụng kỹ thuật heuristic hay không. Trong nhóm không sử dụng bất kỳ kỹ thuật heuristic nào, VISReg dẫn đầu: độ chính xác thăm dò tuyến tính trong miền của ViT-B/16 đạt 75.7%, cao hơn MAE (75.1%); ViT-L/14 tăng lên 77.0%, cao hơn LeJEPA (75.6%). So với iBOT, DINO sử dụng kỹ thuật heuristic, VISReg chỉ thấp hơn một chút trên các tập dữ liệu thông thường, nhưng vượt qua tất cả các phương pháp trên tập dữ liệu kết cấu DTD - điều này cho thấy khả năng tổng quát hóa xuyên miền của nó xuất phát từ bản thân phương pháp, chứ không phải do xếp chồng các kỹ thuật thủ công.

2. Tổng quát hóa Ngoài phân phối (OOD): Tối ưu toàn diện

Tổng quát hóa ngoài phân phối là một bài kiểm tra nghiêm ngặt hơn độ chính xác trong miền: các phương pháp phụ thuộc heuristic thường được điều chỉnh tối ưu kỹ lưỡng trong miền ImageNet, nhưng chưa chắc đã chuyển giao được sang phân phối mới khác biệt lớn. Nhóm nghiên cứu đánh giá trên 6 tập dữ liệu OOD bao phủ các lĩnh vực y tế (ChestXRay, RetinaMNIST, OrganAMNIST), thiên văn (Galaxy10), viễn thám (AID), kết cấu (DTD), những tập dữ liệu này hoàn toàn không liên quan đến miền huấn luyện ImageNet. Kết quả cho thấy, VISReg đạt được độ chính xác OOD trung bình tốt nhất trên tất cả các phương pháp và tất cả các quy mô kiến trúc, thậm chí vượt qua một số phương pháp sử dụng kỹ thuật heuristic và có kiến trúc lớn hơn.

Hình 4: Độ chính xác thăm dò tuyến tính OOD trung bình. VISReg vượt trội toàn diện so với iBOT, DINO, MoCoV3, I-JEPA, MAE, data2vaec, v.v.

Như Hình 4 cho thấy, độ chính xác OOD trung bình của ViT-B/16 với VISReg là 70.19%, ViT-L/14 là 70.63%, rõ ràng cao hơn MAE (67.85%), và vượt trội hơn các phương pháp như MoCoV3 (69.46%), DINO (69.56%), I-JEPA (68.55%).

3. Hiệu quả dữ liệu: Với 1/10 dữ liệu ngang bằng DINOv2

Khi tiền huấn luyện VISReg (ViT-L/14) trên ImageNet-22K (khoảng 14 triệu hình ảnh), độ chính xác trung bình trên 6 tập dữ liệu OOD đạt 72.94%, tương đương với DINOv2 (72.93%) được huấn luyện trên quy mô gấp 10 lần LVD-142M (142 triệu hình ảnh). Nói cách khác, VISReg đạt được mức độ tương đương với khoảng 1/10 dữ liệu. (Để đối chiếu, VISReg cùng là ViT-L/14 nhưng chỉ được tiền huấn luyện trên ImageNet-1K có độ chính xác trung bình là 70.63%.) Điều này cho thấy biểu diễn mà nó học được có tính tổng quát rất mạnh.

Hình 5: VISReg được tiền huấn luyện trên ImageNet-22K, trên chuẩn OOD ngang bằng với DINOv2 được huấn luyện với dữ liệu gấp 10 lần (LVD-142M).

4. Tinh chỉnh chuyển giao: Vượt trội toàn diện so với DINO

Mặc dù độ chính xác thăm dò tuyến tính trong một số tập dữ liệu trong miền của VISReg hơi thấp hơn DINO, nhưng sau khi tinh chỉnh, nó vượt qua cả DINO và tiền huấn luyện có giám sát trên tất cả năm tập dữ liệu CIFAR-10, CIFAR-100, Flowers, ImageNet-1K, Galaxy10 - điều này cho thấy phân phối biểu diễn của nó đồng đều hơn, dư thừa thấp hơn, khả năng chuyển giao mạnh hơn.

Hình: So sánh học chuyển giao. Sau tinh chỉnh, VISReg vượt trội hơn DINO và tiền huấn luyện có giám sát trên tất cả các tập dữ liệu thử nghiệm (CIFAR-10, CIFAR-100, Flowers, ImageNet-1K, Galaxy10).

5. Dự đoán dày đặc và hướng dẫn tạo sinh

Ưu thế của VISReg không chỉ giới hạn ở phân loại. Trên phân đoạn ngữ nghĩa tuyến tính ADE20K (ViT-B/16), mIoU của nó là 30.16, cao hơn DINO (29.40) và MAE (23.60), chỉ đứng sau MoCoV3 (31.69); trong điều kiện không sử dụng bất kỳ kỹ thuật heuristic nào, kết quả này có tính cạnh tranh. Bài báo cũng thừa nhận, dự đoán dày đặc vẫn còn khoảng cách với phương pháp tốt nhất, là trọng tâm tối ưu hóa tiếp theo.

Hình 7: Phân đoạn ngữ nghĩa tuyến tính trên ADE20K. Trong điều kiện không sử dụng bất kỳ kỹ thuật heuristic nào, VISReg đạt được mIoU có tính cạnh tranh, chỉ đứng sau MoCoV3.

Trong hướng dẫn tạo sinh (SiT-B/2, khung iREPA, 100 nghìn bước huấn luyện), việc tạo sinh được hướng dẫn bởi đặc trưng VISReg vượt trội hơn DINO ở ba trong bốn chỉ số: gFID 40.36 (DINO 41.15), Precision 51.38 (DINO 50.51), Recall 61.26 (DINO 60.70), IS cơ bản ngang bằng (33.48 so với 33.47). Điều này cho thấy biểu diễn mà VISReg học được cũng tốt hơn khi làm tín hiệu hướng dẫn tạo sinh.

Hình 8: Tạo ảnh sử dụng SiT-B/2, được hướng dẫn bởi đặc trưng của VISReg và DINO. VISReg cung cấp hướng dẫn tốt hơn trên hầu hết các chỉ số (gFID thấp hơn, Precision và Recall cao hơn).

6. Độ bền vững trên dữ liệu chất lượng thấp

Trên các tập dữ liệu chất lượng thấp như phân phối đuôi dài (ImageNet-LT) và hạng thấp (Galaxy10), VISReg có thể ổn định ngăn chặn sự sụp đổ và học được biểu diễn có ý nghĩa, trong khi DINO thất bại trực tiếp nếu thiếu điều chỉnh tham số tinh tế.

Bảng 1: Độ chính xác thăm dò tuyến tính trên ImageNet-LT

Bảng 2: Độ chính xác thăm dò tuyến tính trong miền trên Galaxy10

Kết luận

VISReg cho thấy: Việc tách thành phần chính quy hóa biểu diễn thành hai thành phần độc lập "quy mô" và "hình dạng", có thể thu được một phương pháp học tự giám sát ổn định hơn, hiệu quả hơn, có khả năng tổng quát hóa mạnh hơn so với các phương pháp hiện có.

Trong điều kiện không sử dụng bất kỳ kỹ thuật heuristic huấn luyện nào, nó đạt được kết quả dẫn đầu hoặc gần dẫn đầu ở nhiều chiều như nhận dạng hình ảnh, phân đoạn và hướng dẫn tạo sinh, và với khoảng 1/10 dữ liệu đã đạt được mức OOD của DINOv2. Điều này cung cấp một giải pháp chính quy hóa mới cho vấn đề sụp đổ biểu diễn tồn tại lâu dài trong mô hình thế giới JEPA.

Tài liệu tham khảo:

https://arxiv.org/abs/2606.02572

Bài viết này đến từ tài khoản WeChat công chúng "Tân Trí Nguyên", tác giả: LRST

Трендовые криптовалюты

Связанные с этим вопросы

QVISReg là gì và nó giải quyết vấn đề cốt lõi nào trong học tự giám sát?

AVISReg (Variance-Invariance-Sketching Regularization) là một phương pháp chính quy hóa mới trong học tự giám sát (SSL). Nó được thiết kế để giải quyết vấn đề cốt lõi 'sụp đổ biểu diễn' (representation collapse), nơi mà mô hình có xu hướng ánh xạ các đầu vào khác nhau thành cùng một hoặc một số ít vector, dẫn đến việc không học được các biểu diễn phân biệt hữu ích.

QVISReg cải tiến các phương pháp tiền nhiệm VICReg và SIGReg như thế nào?

AVISReg kế thừa và cải tiến từ VICReg và SIGReg. Nó giữ lại 'mục tiêu phương sai' (variance term) của VICReg để kiểm soát quy mô (scale), đồng thời thay thế 'mục tiêu hiệp phương sai' (covariance term) bằng một 'mục tiêu phác thảo dựa trên khoảng cách Sliced Wasserstein' (SWD) từ SIGReg để kiểm soát hình dạng phân phối (shape). Điểm then chốt là VISReg tách rời hai mục tiêu quy mô và hình dạng thông qua kỹ thuật dừng gradient, ngăn chúng can thiệp lẫn nhau trong quá trình tối ưu hóa, từ đó khắc phục nhược điểm gradient biến mất khi sụp đổ của SIGReg và sự hạn chế chỉ mô tả thống kê bậc hai của VICReg.

QKết quả thử nghiệm chính nào chứng minh hiệu quả vượt trội của VISReg?

ACác thử nghiệm chính cho thấy VISReg vượt trội trên nhiều mặt: (1) Đạt độ chính xác thăm dò tuyến tính (linear probing) tốt nhất trung bình trên 6 tập dữ liệu ngoài phân phối (OOD). (2) Chỉ sử dụng khoảng 1/10 dữ liệu (ImageNet-22K so với LVD-142M) nhưng đạt hiệu suất ngang bằng DINOv2 trên benchmark OOD. (3) Sau khi tinh chỉnh (fine-tuning), nó vượt trội DINO và huấn luyện có giám sát trên tất cả 5 tập dữ liệu thử nghiệm (CIFAR-10, CIFAR-100, Flowers, ImageNet-1K, Galaxy10). (4) Thể hiện tính ổn định và khả năng học tốt trên dữ liệu chất lượng thấp như phân phối đuôi dài (ImageNet-LT) và dữ liệu hạng thấp (Galaxy10), nơi các phương pháp như DINO có thể thất bại nếu không điều chỉnh tham số cẩn thận.

QTại sao VISReg được cho là có khả năng mở rộng tốt hơn về mặt tính toán?

AVISReg có khả năng mở rộng tính toán tốt hơn vì độ phức tạp tính toán của phần chính quy hóa là O(N*D*K) (với N là batch size, D là số chiều, K là số lát cắt ngẫu nhiên), tăng tuyến tính với tất cả các yếu tố. Trong khi đó, phần hiệp phương sai của VICReg có độ phức tạp O(N*D^2), tăng theo bình phương số chiều. Hơn nữa, các lát cắt ngẫu nhiên K có thể được phân tán trên nhiều GPU, cho phép mở rộng quy mô đào tạo mà hầu như không làm tăng gánh nặng tính toán trên mỗi GPU.

QTầm quan trọng của VISReg đối với mô hình thế giới JEPA mà Yann LeCun đề xuất là gì?

AVISReg có tầm quan trọng đặc biệt đối với lộ trình phát triển mô hình thế giới JEPA (Joint-Embedding Predictive Architecture) mà Yann LeCun đang theo đuổi. JEPA dựa trên nền tảng học tự giám sát để học các biểu diễn chung, và 'sụp đổ biểu diễn' là một thách thức cốt lõi cản trở hiệu quả của nó. Bằng cách cung cấp một cơ chế chính quy hóa ổn định, mạnh mẽ và có thể mở rộng để ngăn chặn sụp đổ mà không cần dựa vào các thủ thuật heuristic phức tạp, VISReg trực tiếp giải quyết một vấn đề then chốt trong kiến trúc JEPA, mở đường cho việc xây dựng các mô hình thế giới tự giám sát mạnh mẽ và có khả năng tổng quát hóa cao hơn.

Похожее

UNI вырос вдвое за два месяца на фоне общего спада: пятилетняя задержка в восстановлении стоимости

В июне-июле 2025 года, на фоне общей волатильности крипторынка, токен UNI децентрализованной биржи Uniswap показал исключительный рост, почти удвоившись в цене с $2,3 до $4,6. Основная причина — реализация механизма сбора доли комиссий протокола (т.н. «переключатель комиссий») и их направления на выкуп и сжигание UNI, что изменило его статус с чисто управленческого токена на актив с реальным денежным потоком. Несмотря на то, что предложение было принято еще в декабре 2024 года, значимый эффект проявился только в июле 2025 года после запуска Robinhood Chain, ориентированной на токенизированные акции. Развернутые на ней пулы Uniswap резко увеличили объемы торгов и комиссий протокола. Ежедневные средства, направляемые на сжигание UNI, выросли примерно с $114 тысяч до $325 тысяч, причем более половины суммы генерировала Robinhood Chain. Ключевым фактором успеха механизма выкупа и сжигания для UNI стала зрелая и распределенная структура предложения токена, выпущенного еще в 2020 году, без крупных предстоящих разблокировок. Это отличает его от многих новых проектов, где эмиссия часто превышает объемы выкупа. Главный вопрос на будущее — сможет ли Uniswap сохранить высокие объемы торгов на Robinhood Chain после окончания 90-дневного периода субсидирования комиссий сети, или текущий рост окажется временным эффектом.

marsbit6 мин. назад

UNI вырос вдвое за два месяца на фоне общего спада: пятилетняя задержка в восстановлении стоимости

marsbit6 мин. назад

Экстренный отзыв функции генерации изображений Nano Banana 2 в Google Earth!

В Google Earth экстренно отозвали функцию генерации изображений Nano Banana 2 после того, как пользователи менее чем за день "сломали" её, создавая неподобающий или абсурдный контент (например, исторические памятники в постапокалиптическом стиле). Функция, позволявшая накладывать сгенерированные ИИ изображения на реальные спутниковые снимки и 3D-ландшафты в Google Earth, была временно отключена для усиления защитных мер. Эта технология, названная "геопространственным закреплением" (Geospatial Grounding), использует текущий спутниковый вид, данные рельефа и камеры для создания изображений, которые реалистично вписываются в реальную географию. Она открывала новые возможности: визуализацию исторических мест, создание информационных графиков и предварительный просмотр архитектурных проектов в их реальном окружении. Однако недостатки, такие как отсутствие поддержки режима Street View и неточности в генерируемой информации, а также возможность злоупотреблений, вынудили Google отозвать функцию. Этот шаг подчеркивает стратегию Google по использованию своего уникального массива географических данных для создания нового типа "правдоподобной" AI-визуализации, в отличие от конкурентов, сосредоточенных только на эстетике изображений.

marsbit1 ч. назад

Экстренный отзыв функции генерации изображений Nano Banana 2 в Google Earth!

marsbit1 ч. назад

Алтман признаёт: переоценил способность ИИ отнимать работу! Хуан Жэньсюнь: разговоры о безработице абсолютно ошибочны

Открытие OpenAI - не первая крупная компания под управлением ИИ, но Сэм Олтман изменил свою позицию. В подкасте «Invest Like the Best» он заявил, что люди «не хотят ИИ-гендиректора», поскольку им важно знать, кто принимает решения и несет ответственность. Он также признал, что переоценил скорость, с которой ИИ заменит младшие офисные должности. Дженсен Хуанг, глава NVIDIA, в свою очередь, заявил на YC Startup School, что нарратив об «ИИ, уничтожающем рабочие места», ошибочен. Он разграничил понятия «задача» и «работа»: ИИ берет на себя некоторые задачи, но не устраняет всю должность. Например, спрос на радиологов и разработчиков ПО растет, поскольку ИИ помогает быстрее обрабатывать накопленные объемы работы, позволяя расширять деятельность. Исследование Университета Мэриленда и LinkUp, охватившее 155 млн вакансий в США с 2018 года, не выявило общего снижения спроса на работу из-за ИИ. Доля вакансий для выпускников даже выросла. Молодые специалисты могут получить преимущество, используя ИИ для компенсации недостатка опыта. Однако стандартные вводные задачи (обработка данных, написание базового кода), которые раньше служили стартовой ступенькой для карьеры, теперь автоматизируются. Это сужает точку входа на рынок труда для новичков. Ключевой вывод: по мере автоматизации задач ценность человеческой работы смещается в сторону ответственности, построения доверия, принятия окончательных решений и личного взаимодействия. Эти элементы, которые ИИ не может заменить, становятся настоящим профессиональным преимуществом.

marsbit1 ч. назад

Алтман признаёт: переоценил способность ИИ отнимать работу! Хуан Жэньсюнь: разговоры о безработице абсолютно ошибочны

marsbit1 ч. назад

Крупные изменения в ФРС? Сообщается, что Ваш рассматривает возможность сокращения частоты заседаний по ставкам, нарушая 40-летнюю традицию

Председатель ФРС Уолш рассматривает возможность сокращения количества регулярных заседаний по установлению процентных ставок, проводимых Федеральным комитетом по открытым рынкам (FOMC) каждый год. Это изменение, если оно будет реализовано, станет одним из самых значительных преобразований в работе ФРС за последние десятилетия и打破ет практику, действующую с 1981 года, когда заседания проводятся восемь раз в год (примерно каждые шесть недель). Согласно информации The New York Times, Уолш вынес этот вопрос на обсуждение на заседании ФРС на этой неделе. Новый график может быть определен до следующего заседания в середине сентября, хотя конкретные изменения вступят в силу позже. Закон о банках 1935 года требует, чтобы FOMC проводил «не менее четырех заседаний в год». Сокращение количества заседаний уменьшит возможности для голосования по процентным ставкам и может ослабить способность ФРС оперативно реагировать на изменения в инфляции и на рынке труда. Это также сократит каналы получения рынком сигналов о денежно-кредитной политике и снизит прозрачность, что противоречит многолетнему тренду на ее усиление. Данный шаг соответствует общему стилю руководства Уолша, который уже сократил объем публичных заявлений и рассматривает возможность уменьшения количества пресс-конференций после заседаний. Это предложение является частью более широкой повестки Уолша по «институциональной реформе» ФРС. В истории ФРС частота заседаний менялась: до 1981 года они могли проводиться до 19 раз в год, как это было в 1956 году. Внутренняя памятная записка ФРС 1988 года признавала преимущества более частых заседаний для оперативного рассмотрения новой информации, но сочла существующий график из восьми заседаний подходящим. Реформа Уолша идет в противоположном направлении, и ее потенциальное влияние на гибкость политики и коммуникацию с рынком будет тщательно отслеживаться.

marsbit2 ч. назад

Крупные изменения в ФРС? Сообщается, что Ваш рассматривает возможность сокращения частоты заседаний по ставкам, нарушая 40-летнюю традицию

marsbit2 ч. назад

Еженедельная подборка редакции Weekly Editor's Picks (25-31 июля)

Еженедельные выборы редактора (25-31 июля). В мире финансов и криптовалют продолжают доминировать темы макроэкономической неопределенности и технологических сдвигов. На фоне одного из самых неопределенных заседаний ФРС, где сохраняется риск повышения ставок, эксперты обсуждают долгосрочную ценность криптовалют. Акцент делается на стратегическом инвестировании в биткоин как «цифровое золото» и базовые смарт-контрактные платформы, а не на краткосрочных спекуляциях. На рынке акций наблюдается тенденция к «криптовализации»: нарративы и рычаги усиливают волатильность. При этом успешные платформы, такие как Hyperliquid и Polymarket, сталкиваются с трудностями при расширении за пределы своей основной специализации. В секторе AI и чипов сохраняется напряженность. Рост стоимости кредитных дефолтных свопов (CDS) Nvidia отражает опасения по поводу рисков финансирования инфраструктуры AI. Корейский гигант SK Hynix, несмотря на рекордную прибыль, не оправдал завышенных рыночных ожиданий, что подчеркивает споры между быками и медведями о будущем росте. Законодательная судьба американского билля Clarity Act остается под вопросом из-за политических разногласий, хотя рынок, вероятно, уже учел эту неопределенность. В экосистеме Ethereum начался масштабный переход стейкинга в сторону более эффективной архитектуры валидаторов после обновления Pectra. Также среди ключевых событий недели: выход на рынок акций Changxin Tech, мнения Сэма Олтмана и Тома Ли о будущем OpenAI и Ethereum, а также данные о крупных сделках южнокорейских производителей чипов с американскими технологическими гигантами.

marsbit2 ч. назад

Еженедельная подборка редакции Weekly Editor's Picks (25-31 июля)

marsbit2 ч. назад

Торговля

Спот

Популярные статьи

Как купить CORE

Добро пожаловать на HTX.com! Мы сделали приобретение CORE (CORE) простым и удобным. Следуйте нашему пошаговому руководству и отправляйтесь в свое крипто-путешествие.Шаг 1: Создайте аккаунт на HTXИспользуйте свой адрес электронной почты или номер телефона, чтобы зарегистрироваться и бесплатно создать аккаунт на HTX. Пройдите удобную регистрацию и откройте для себя весь функционал.Создать аккаунтШаг 2: Перейдите в Купить криптовалюту и выберите свой способ оплатыКредитная/Дебетовая Карта: Используйте свою карту Visa или Mastercard для мгновенной покупки CORE (CORE).Баланс: Используйте средства с баланса вашего аккаунта HTX для простой торговли.Третьи Лица: Мы добавили популярные способы оплаты, такие как Google Pay и Apple Pay, для повышения удобства.P2P: Торгуйте напрямую с другими пользователями на HTX.Внебиржевая Торговля (OTC): Мы предлагаем индивидуальные услуги и конкурентоспособные обменные курсы для трейдеров.Шаг 3: Хранение CORE (CORE)После приобретения вами CORE (CORE) храните их в своем аккаунте на HTX. В качестве альтернативы вы можете отправить их куда-либо с помощью перевода в блокчейне или использовать для торговли с другими криптовалютами.Шаг 4: Торговля CORE (CORE)С легкостью торгуйте CORE (CORE) на спотовом рынке HTX. Просто зайдите в свой аккаунт, выберите торговую пару, совершайте сделки и следите за ними в режиме реального времени. Мы предлагаем удобный интерфейс как для начинающих, так и для опытных трейдеров.

699 просмотров всегоОпубликовано 2024.03.29Обновлено 2026.06.02

Как купить CORE

Обсуждения

Добро пожаловать в Сообщество HTX. Здесь вы сможете быть в курсе последних новостей о развитии платформы и получить доступ к профессиональной аналитической информации о рынке. Мнения пользователей о цене на CORE (CORE) представлены ниже.

活动图片