# Bài viết Liên quan Độ chính xác

Trung tâm Tin tức HTX cung cấp những bài viết mới nhất và phân tích chuyên sâu về "Độ chính xác", bao gồm xu hướng thị trường, cập nhật dự án, phát triển công nghệ và chính sách quản lý trong ngành tiền kỹ thuật số.

Dự đoán vòng loại World Cup, các mô hình AI khác nhau sai biệt nhiều đến vậy?

Trong thử nghiệm dự đoán kết quả vòng loại trực tiếp World Cup, các mô hình AI thể hiện sự khác biệt rõ rệt về hiệu quả. DeepSeek và Gemini tỏa sáng nhờ khả năng dự đoán chính xác trận đấu giữa Hà Lan và Maroc. Gemini thậm chí còn đưa ra tỷ số hòa 1-1 trong thời gian thi đấu chính thức và dự đoán Maroc thắng trên chấm luân lưu, trùng khớp hoàn toàn với thực tế. DeepSeek cũng có phân tích tương tự, nhấn mạnh khả năng phòng ngự và phản công của Maroc. Grok và Qwen (Thông Vấn) thể hiện ổn định trong các trận có cửa trên rõ ràng, dự đoán đúng cả đội thắng và tỷ số sát thực tế, như trận Canada thắng Nam Phi 1-0 và Brazil thắng Nhật Bản 2-1. ChatGPT thiên về phân tích quá trình trận đấu, thường cảnh báo về những khó khăn mà các đội mạnh có thể gặp phải, mặc dù không luôn đúng về tỷ số cuối cùng. Tuy nhiên, tất cả các mô hình đều "thất bại tập thể" trong trận Đức gặp Paraguay, đều đánh giá quá cao sức mạnh của Đức và không lường trước được khả năng kéo bài của Paraguay dẫn đến loạt sút luân lưu. Tóm lại, mỗi mô hình có thế mạnh riêng: DeepSeek và Gemini nổi bật ở các dự đoán bất ngờ; Grok và Qwen chính xác về tỷ số ở các trận ít biến động; ChatGPT và Claude cung cấp phân tích quá trình chi tiết. Người dùng nên lựa chọn mô hình phù hợp dựa trên nhu cầu cụ thể: tham khảo tỷ số hay phân tích diễn biến.

Odaily星球日报07/02 01:46

Dự đoán vòng loại World Cup, các mô hình AI khác nhau sai biệt nhiều đến vậy?

Odaily星球日报07/02 01:46

Có người dùng Hyperliquid dự đoán thị trường chứng khoán Hàn Quốc, tỷ lệ chính xác lên tới 74%?

Một nghiên cứu đã đánh giá khả năng dự báo thị trường chứng khoán Hàn Quốc của các hợp đồng tương lai vĩnh viễn giao dịch cuối tuần trên nền tảng Hyperliquid, xem xét 62 mẫu quan sát cho 4 tài sản: Samsung Electronics, SK Hynix, Hyundai Motor và quỹ ETF EWY. Kết quả tổng thể cho thấy tỷ lệ dự đoán chính xác hướng mở cửa thứ Hai là 73.8% (45/62 trường hợp). Tuy nhiên, hiệu suất giữa các tài sản rất khác biệt: - **Samsung Electronics**: Kết quả ấn tượng nhất với 15/16 lần dự đoán đúng (94%), có ý nghĩa thống kê cao. Ngay cả khi lấy giá đóng cửa thứ Bảy (cách thời điểm mở cửa ~24 giờ), tỷ lệ chính xác vẫn đạt 75%. - **Hyundai Motor**: 13/16 lần đúng (81%), nhưng không có ý nghĩa thống kê sau khi điều chỉnh thiên hướng giảm nhẹ vào thứ Hai. - **SK Hynix**: Chỉ 10/16 lần đúng, hiệu suất tương đương dự đoán ngẫu nhiên. - **EWY (ETF Hàn Quốc giao dịch tại Mỹ)**: Kết quả kém nhất, chỉ 7/13 lần đúng, thậm chí thua chiến lược luôn dự đoán tăng. Sự khác biệt được lý giải phần lớn bởi chênh lệch múi giờ. Thời điểm mở cửa của KRX (Hàn Quốc) gần như trùng với thời điểm đóng cửa phiên cuối tuần trên Hyperliquid, trong khi EWY mở cửa muộn hơn nhiều, cho phép thông tin mới xuất hiện. Kết quả cho Samsung Electronics cho thấy thị trường cuối tuần trên Hyperliquid cung cấp thông tin vượt ra ngoài xu hướng đơn thuần từ phiên giao dịch thứ Sáu trước đó. Nghiên cứu kết luận rằng, mặc dù khối lượng giao dịch cuối tuần còn nhỏ và cần xác minh thêm, dữ liệu từ Hyperliquid, đặc biệt là đối với Samsung Electronics, có thể là một chỉ báo hữu ích đáng tham khảo cho các nhà đầu tư trước phiên đấu giá mở cửa thứ Hai.

Foresight News06/10 10:09

Có người dùng Hyperliquid dự đoán thị trường chứng khoán Hàn Quốc, tỷ lệ chính xác lên tới 74%?

Foresight News06/10 10:09

Xác suất ẩn trong giá cả: Tỷ lệ cược World Cup được tính như thế nào?

**Xác suất trong Giá cả: Tỷ lệ World Cup được Tính như thế nào?** Trước World Cup 2026, hai hệ thống uy tín đưa ra "xác suất vô địch" khác nhau: thị trường dự đoán (Polymarket, Kalshi) xếp Pháp là ứng cử viên số 1 (~17%), trong khi siêu máy tính Opta xếp Tây Ban Nha là số 1 (16.1%). Bài viết giải thích cách hai con số này được tạo ra: 1. **Xác suất từ Thị trường:** Giá hợp đồng (từ 0-100 cent) phản ánh trực tiếp xác suất thị trường. Giá tổng hợp dựa trên khối lượng giao dịch khổng lồ (hơn 523 triệu USD). Tuy nhiên, tính thanh khoản vẫn còn hạn chế, và nghiên cứu cho thấy sự thiên lệch "longshot" tồn tại ngay cả trên thị trường tiên đoán crypto: các cửa cược dài hạn thường bị đánh giá thấp hơn khả năng thực tế. 2. **Xác suất từ Mô hình:** Opta sử dụng dữ liệu đội bóng và mô phỏng toàn bộ giải đấu 10,000 lần để tính tần suất vô địch. Điều đáng chú ý là đầu vào của mô hình này bao gồm cả tỷ lệ cược từ thị trường cá cược truyền thống. Không có nghiên cứu học thuật chặt chẽ nào so sánh độ chính xác lâu dài giữa hai phương pháp trên. Một điểm khác biệt lớn là tính minh bạch: mọi giao dịch trên Polymarket đều được ghi lại trên blockchain, cho phép kiểm toán công khai. Một yếu tố phi thị trường ảnh hưởng đến giá là sự không chắc chắn về quy định, như luật mới ở Minnesota (Mỹ) coi việc vận hành thị trường dự đoán là trọng tội. Tóm lại, "xác suất" bạn thấy có thể là giá thị trường (chịu ảnh hưởng của tính thanh khoản và thiên lệch) hoặc tần suất mô phỏng (phụ thuộc vào mô hình). Câu hỏi quan trọng khi đối mặt với bất kỳ con số nào là: **Nó được sản xuất như thế nào?**

marsbit06/05 00:29

Xác suất ẩn trong giá cả: Tỷ lệ cược World Cup được tính như thế nào?

marsbit06/05 00:29

Nghiên cứu mới của AMD đảo lộn nhận thức: FP4 huấn luyện không ổn định, nguyên nhân không phải do tính ngẫu nhiên không đủ

Bài viết nghiên cứu mới của AMD và Đại học Bang Pennsylvania lật ngược nhận thức trước đây về việc huấn luyện mô hình lớn bằng định dạng FP4. Trái với suy nghĩ phổ biến rằng sự bất ổn đến từ tính ngẫu nhiên không đủ, nghiên cứu xác định nguyên nhân chính là lỗi cấu trúc từ việc thu nhỏ tỷ lệ (micro-scaling) tích lũy và khuếch đại dọc theo đường truyền gradient trọng số (Wgrad) nhạy cảm. Các thí nghiệm kiểm soát trên phần cứng AMD Instinct MI355X với định dạng MXFP4 cho thấy: khi thay thế phép tính Wgrad từ FP8 sang MXFP4, chất lượng hội tụ suy giảm đáng kể. Các chiến lược thêm tính ngẫu nhiên như làm tròn ngẫu nhiên hoặc phép xoay Hadamard ngẫu nhiên thậm chí còn gây ra phân kỳ. Ngược lại, phép xoay Hadamard xác định đã ổn định quá trình huấn luyện bằng cách áp dụng cùng một phép biến đổi mỗi bước, giữ cho mẫu lỗi nhất quán và tránh tích lũy. Với giải pháp này, nghiên cứu đã hoàn thành việc tiền huấn luyện đầy đủ cho Llama 3.1-8B trên C4, đạt được tốc độ huấn luyện nhanh hơn 9-10% so với đường cơ sở FP8, với chi phí token chỉ tăng thêm 8-9%. Đây là minh chứng đầu tiên về việc huấn luyện mô hình lớn hoàn chỉnh bằng FP4 trên phần cứng nguyên bản. Nghiên cứu có ý nghĩa quan trọng: (1) Cung cấp chẩn đoán nguyên nhân rõ ràng, hướng dẫn tập trung vào lỗi cấu trúc thay vì tính ngẫu nhiên; (2) Mở rộng phạm vi sử dụng FP4 từ suy luận sang huấn luyện, tiềm năng tăng gấp đôi hiệu suất phần cứng hiện có; (3) Dựa trên tiêu chuẩn mở OCP Microscaling, đảm bảo khả năng di chuyển giữa các nền tảng phần cứng khác nhau.

marsbit05/27 06:21

Nghiên cứu mới của AMD đảo lộn nhận thức: FP4 huấn luyện không ổn định, nguyên nhân không phải do tính ngẫu nhiên không đủ

marsbit05/27 06:21

Bá Bảng GitHub, Hướng Dẫn Bắt Buộc Cho Người Dùng Claude Code

**Tóm tắt tiếng Việt:** Một file văn bản đơn giản có tên CLAUDE.md đang gây bão trên GitHub, giúp tăng độ chính xác khi lập trình với Claude Code từ 65% lên 94%. Vấn đề chính của nhiều lập trình viên là mỗi phiên làm việc với AI đều bắt đầu từ số 0, phải giải thích lại ngữ cảnh dự án, công nghệ và quyết định trước đó, dẫn đến lãng phí thời gian và sai sót. CLAUDE.md đóng vai trò như một "hướng dẫn sử dụng" đặt trong thư mục gốc dự án. Claude sẽ tự đọc file này khi khởi động, từ đó hiểu được: quy tắc trả lời, cách viết code, khi nào cần hỏi lại, thao tác nào không được tự ý thực hiện, tech stack của dự án và các quyết định quan trọng trong quá khứ. Điều này giúp giảm thiểu việc giải thích lặp lại và kiểm soát phạm vi thay đổi của AI. Bài viết giới thiệu 21 quy tắc được chia thành ba nhóm chính: 1. **Thiết lập mặc định:** Giảm thời gian lặp lại thông tin về bản thân, dự án và phong cách giao tiếp. 2. **Ràng buộc hành vi:** Ngăn AI tự ý sửa đổi code ngoài phạm vi, yêu cầu xác nhận trước các thao tác quan trọng hoặc có tính phá hủy. 3. **Bộ nhớ & Tech Stack:** Duy trì các file MEMORY.md và ERRORS.md để ghi lại quyết định và bài học, đồng thời khóa chặt công nghệ sử dụng, tránh đề xuất các công cụ không tương thích. Đặc biệt, 4 quy tắc cốt lõi do Andrej Karpathy đúc kết được nhấn mạnh: Luôn hỏi lại nếu chưa rõ, ưu tiên giải pháp đơn giản nhất, không chạm vào code không liên quan, và thẳng thắn chỉ ra những điểm không chắc chắn. Chỉ với 2 giờ thiết lập, một file văn bản thuần túy này có thể giúp mỗi lập trình viên tiết kiệm tới 975 USD chi phí lãng phí mỗi tuần, biến Claude Code thành một công cụ lập trình ổn định và đáng tin cậy hơn.

marsbit05/18 09:41

Bá Bảng GitHub, Hướng Dẫn Bắt Buộc Cho Người Dùng Claude Code

marsbit05/18 09:41

Polymarket Không Phải Là Cỗ Máy Sự Thật Toàn Năng

Polymarket, một nền tảng dự đoán thị trường tiền điện tử, thường được mô tả như "cỗ máy sự thật" nhờ khả năng dự báo sự kiện thông qua cá cược tập thể. Tuy nhiên, phân tích dữ liệu từ Brier.fyi cho thấy độ chính xác của nó không đồng đều. Trong khi thị trường chính trị và kinh tế đạt điểm cao (A đến B+), các dự báo về thể thao và văn hóa lại kém tin cậy, thậm chí tệ hơn cả việc đoán ngẫu nhiên. Mối lo ngại lớn hơn nằm ở việc các tỷ lệ cược này, được các hãng tin tức lớn như WSJ và CNN đưa tin, đang bắt đầu ảnh hưởng đến chính sự kiện chúng dự đoán (hiệu ứng nội sinh). Các giao dịch viên lớn (cá voi) có thể thao túng thị trường bằng thông tin riêng hoặc thậm chí thông tin mật, như các vụ cá cược vào chiến dịch quân sự hay bắt giữ tổng thống Venezuela được chứng minh là có thông tin nội bộ. Tóm lại, Polymarket chỉ thực sự hiệu quả cho các sự kiện ngắn hạn, có tính binary và được quan tâm rộng rãi (như bầu cử). Phần lớn các dự báo còn lại thiếu tính thanh khoản và độ chính xác. Nguy cơ thực sự là khi thế giới tin tưởng mù quáng vào các tỷ lệ cược này, biến chúng thành "sự thật" được định hình bởi một số ít người có tiền và thông tin đặc quyền.

marsbit04/15 11:44

Polymarket Không Phải Là Cỗ Máy Sự Thật Toàn Năng

marsbit04/15 11:44

Hàng chục triệu lỗi mỗi giờ, cuộc điều tra tiết lộ "ảo tưởng về độ chính xác" của công cụ tìm kiếm AI Google

Theo một nghiên cứu do The New York Times ủy quyền và thực hiện bởi công ty AI Oumi, tính năng AI Overviews (Tổng quan AI) của Google có tỷ lệ chính xác khoảng 91%. Tuy nhiên, với quy mô xử lý khoảng 5 nghìn tỷ lượt tìm kiếm mỗi năm của Google, tỷ lệ lỗi 9% này đồng nghĩa với việc mỗi giờ có thể phát sinh hơn 57 triệu câu trả lời không chính xác. Một vấn đề nghiêm trọng hơn là các trích dẫn nguồn không đáng tin cậy. Dữ liệu cho thấy 56% câu trả lời đúng của Gemini 3 (phiên bản nâng cấp) đi kèm với các liên kết tham khảo không hỗ trợ cho thông tin được đưa ra. Các nguồn chất lượng thấp như Facebook và Reddit thường xuyên được trích dẫn. Ngoài ra, tính năng này dễ bị thao túng. Một phóng viên BBC đã thử nghiệm bằng một bài báo giả mạo và thông tin sai lệch xuất hiện trong kết quả AI Overviews chưa đầy 24 giờ sau đó. Google phản bác nghiên cứu, cho rằng phương pháp kiểm tra có "những lỗ hổng nghiêm trọng", bao gồm việc sử dụng một mô hình AI khác để đánh giá và các truy vấn thử nghiệm không phản ánh hành vi tìm kiếm thực tế.

marsbit04/10 12:32

Hàng chục triệu lỗi mỗi giờ, cuộc điều tra tiết lộ "ảo tưởng về độ chính xác" của công cụ tìm kiếm AI Google

marsbit04/10 12:32

Wikipedia ban hành quy định biên tập mới: Thông qua biểu quyết, nghiêm cấm sử dụng AI để tạo hoặc viết lại nội dung bài viết

Vào ngày 26/3, Wikipedia đã chính thức thông qua biểu quyết để áp dụng chính sách biên tập mới nhắm vào các mô hình ngôn ngữ lớn (LLM), nghiêm cấm người dùng trực tiếp sử dụng AI để tạo hoặc viết lại nội dung bài viết. Quyết định này đánh dấu một bước tiến quan trọng trong việc bảo vệ tính chính xác của nội dung và chủ quyền biên tập của con người. Chính sách mới nâng cấp quy định trước đây từ “không nên tạo bài viết mới từ đầu” lên thành “nghiêm cấm sử dụng LLM để tạo hoặc viết lại nội dung”. Theo báo cáo, chính sách được thông qua với tỷ lệ áp đảo 40-2 từ cộng đồng biên tập viên tình nguyện, phản ánh mối lo ngại sâu sắc về việc thông tin sai lệch từ AI có thể làm suy yếu kho kiến thức. Mặc dù vậy, quy định mới không hoàn toàn loại bỏ AI, mà định vị nó như một công cụ hỗ trợ: biên tập viên vẫn có thể sử dụng LLM để đưa ra đề xuất chỉnh sửa cơ bản, nhưng phải được kiểm duyệt bởi con người, đồng thời nghiêm cấm đưa vào bất kỳ nội dung mới chưa được xác thực nào để tránh hiện tượng “ảo tưởng” của mô hình. Trong bối cảnh AI generative ngày càng thâm nhập sâu vào lĩnh vực sáng tạo nội dung, quyết định của Wikipedia thể hiện sự cân nhắc thận trọng giữa hiệu suất và tính xác thực. Bằng cách xác định ranh giới giữa “hỗ trợ” và “sáng tạo”, Wikipedia đang nỗ lực bảo vệ hệ sinh thái biên tập của con người, đồng thời ngăn chặn khủng hoảng niềm tin do sự tràn lan của nội dung tự động.

marsbit03/27 01:10

Wikipedia ban hành quy định biên tập mới: Thông qua biểu quyết, nghiêm cấm sử dụng AI để tạo hoặc viết lại nội dung bài viết

marsbit03/27 01:10

活动图片