# Bài viết Liên quan Đa phương thức

Trung tâm Tin tức HTX cung cấp những bài viết mới nhất và phân tích chuyên sâu về "Đa phương thức", bao gồm xu hướng thị trường, cập nhật dự án, phát triển công nghệ và chính sách quản lý trong ngành tiền kỹ thuật số.

Gemini 3.5 đã đến! Đêm nay, chính Google tự đào thải Google

Bài viết tóm tắt các sản phẩm và công nghệ chính được giới thiệu tại Google I/O 2026: 1. **Gemini Omni**: Một mô hình AI đa năng, có thể nhận đầu vào dưới mọi hình thức (hình ảnh, âm thanh, video, văn bản) và tạo ra video chất lượng cao. Nó thực sự hiểu biết thế giới vật lý, cho phép người dùng chỉnh sửa video thông qua trò chuyện và duy trì tính nhất quán của đối tượng và logic xuyên suốt các cảnh. 2. **Gemini 3.5 Flash**: Được quảng cáo là mô hình mã hóa và tác nhân AI mạnh mẽ nhất của Google, vượt trội so với Gemini 3.1 Pro và các đối thủ khác trong nhiều bài kiểm tra tiêu chuẩn. Nó nhanh hơn đáng kể và đã được tích hợp vào Gemini App và chế độ AI của Google Tìm kiếm. 3. **Antigravity 2.0**: Nền tảng phát triển tác nhân AI độc lập mới, được nâng cấp thành ứng dụng máy tính để bàn. Một bản demo ấn tượng cho thấy 93 tác nhân con, sử dụng 3.5 Flash, đã xây dựng được một hệ điều hành hoạt động đầy đủ từ đầu trong vòng 12 giờ. 4. **Gemini Spark**: Một tác nhân AI cá nhân, chạy 24/7 trên đám mây. Nó có thể tự động xử lý các tác vụ phức tạp bằng cách tích hợp với bộ công cụ Google Workspace (như Gmail, Docs, Sheets, Slides) và hỗ trợ lệnh bằng giọng nói để tạo và quản lý nhiều tác vụ song song. 5. **Các thông báo khác**: Bao gồm thiết kế lại Gemini App với mã lực tính phí, kế hoạch đăng ký AI Ultra mới với giá cả được điều chỉnh, và bản nâng cấp lớn cho Google Tìm kiếm với việc tích hợp 3.5 Flash. Bài viết kết luận rằng sự kết hợp đồng thời của các khả năng AI tiên tiến này (hiểu và tạo đa phương thức, tác nhân tự hành) đánh dấu một bước tiến lớn, thu hẹp khoảng cách về mặt kỹ thuật để tiến tới Trí tuệ Siêu việt (ASI).

链捕手05/20 07:01

Gemini 3.5 đã đến! Đêm nay, chính Google tự đào thải Google

链捕手05/20 07:01

Google dùng AI 'giết chết' Google, buổi ra mắt này khiến người xem cảm thấy ngộp thở

Tại Google I/O, Sundar Pichai công bố Gemini đạt hơn 900 triệu người dùng hàng tháng. Sự kiện tập trung vào hai mô hình lõi: Gemini Omni và Gemini 3.5 Flash. Gemini Omni là mô hình đa phương thức hướng tới "mô hình thế giới", có khả năng tạo và chỉnh sửa video nâng cao từ các lệnh đơn giản, thậm chí mô phỏng các hiệu ứng vật lý. Nó sẽ được tích hợp vào các sản phẩm như Gemini App và Google Flow. Gemini 3.5 Flash được tối ưu cho tốc độ, chi phí thấp và khả năng thực thi, đặc biệt trong lập trình. Cùng với công cụ phát triển Antigravity 2.0, nó cho phép các tác nhân AI (Agent) xây dựng các dự án phức tạp như một hệ điều hành với chi phí hiệu quả. Google cũng công bố nhiều bản cập nhật lớn: * **Tìm kiếm:** Nâng cấp lên Gemini 3.5, tích hợp tính năng AI Overviews và giới thiệu "Tác nhân Thông tin" có thể theo dõi chủ đề theo thời gian. * **Gemini Spark:** Một tác nhân AI cá nhân chạy 24/7 trên đám mây, có thể xử lý nhiều tác vụ phức tạp tự động, ngay cả khi thiết bị tắt. * **Gemini App:** Thiết kế lại với giao diện Neural Expressive và thêm tính năng "Daily Brief" – một bản tóm tắt cá nhân hóa cho buổi sáng. * **Công cụ sáng tạo:** Ra mắt Google Pics để chỉnh sửa ảnh, cập nhật Stitch cho thiết kế giao diện, và bổ sung nhiều tính năng AI mạnh mẽ vào Google Flow cho chỉnh sửa video, âm nhạc. * **Phần cứng:** Giới thiệu kính thông minh chạy Android XR, có cả phiên bản hiển thị hình ảnh và phiên bản chỉ âm thanh (ra mắt trước vào mùa thu), cho phép tương tác với Gemini qua âm thanh riêng tư. * **Bảo mật:** Giới thiệu CodeMender, một tác nhân tự động phát hiện và sửa lỗi bảo mật trong mã nguồn. Bài báo chỉ ra rằng, đằng sau những nâng cấp trải nghiệm miễn phí, Google đang chuyển hướng sang mô hình kinh doanh dựa trên thuê bao AI cao cấp và dịch vụ cơ sở hạ tầng doanh nghiệp để trang trải chi phí điện toán khổng lồ cho các mô hình và tác nhân AI phức tạp này. Câu hỏi then chốt là liệu người dùng có sẵn sàng trả tiền cho một "trợ lý toàn năng" AI hay không.

marsbit05/19 23:57

Google dùng AI 'giết chết' Google, buổi ra mắt này khiến người xem cảm thấy ngộp thở

marsbit05/19 23:57

Người tạo ra Kling trở lại Alibaba và tạo ra một 'ngựa ô' mới

Người đứng sau mô hình AI video HappyHorse-1.0 của Alibaba, Zhang Di, từng làm việc tại Alibaba và Kuaishou, đã trở lại Alibaba vào tháng 11/2025 và chỉ sau 5 tháng đã cho ra mắt HappyHorse. Mô hình này đã đứng đầu bảng xếp hạng Artificial Analysis trong cả hai hạng mục text-to-video và image-to-video, vượt qua các đối thủ như ByteDance và Kuaishou. HappyHorse có 15 tỷ tham số, sử dụng kiến trúc Transformer đa phương thức, cho phép đồng bộ hóa khẩu hình với nhiều ngôn ngữ và giảm thời gian tạo video xuống còn 38 giây cho video 5 giây. Điều này giúp nó phù hợp cho các ứng dụng thương mại. Alibaba định hướng ứng dụng HappyHorse vào lĩnh vực thương mại điện tử, giúp các nhà bán hàng tạo video quảng cáo sản phẩm nhanh chóng, đa dạng hóa kịch bản và ngôn ngữ, đồng thời tăng hiệu quả chuyển đổi. Với lợi thế dữ liệu giao dịch và hành vi người dùng, Alibaba có thể tối ưu hóa video cho mục đích bán hàng. Tuy nhiên, vẫn có những thách thức về bản quyền và độ trung thực của nội dung AI. Nhưng với một kế hoạch ứng dụng rõ ràng, HappyHorse hứa hẹn mang lại lợi thế cạnh tranh cho Alibaba trong thị trường video AI.

marsbit04/13 05:14

Người tạo ra Kling trở lại Alibaba và tạo ra một 'ngựa ô' mới

marsbit04/13 05:14

Vừa mới đây, "trái bơ" trị giá 14.3 tỷ USD của Mark Zuckerberg đã ra mắt, thách thức GPT-5.4, tác phẩm đầu tay đắt giá nhất của người Hoa tại Thung lũng Silicon

Vừa qua, Meta chính thức ra mắt Muse Spark (biệt danh "Avocado" - quả bơ), mô hình AI đa phương tiện mạnh mẽ từ Phòng thí nghiệm Siêu trí tuệ (MSL) của họ. Với điểm số ấn tượng 52 trên bảng xếp hạng Artificial Analysis, Muse Spark được xem là đối thủ cạnh tranh trực tiếp với GPT-5.4, Gemini 3.1 Pro và Opus 4.6. Mô hình này sở hữu khả năng đa phương tiện gốc, chuỗi suy nghĩ thị giác, điều phối đa tác tử (multi-agent) và gọi công cụ linh hoạt. Đặc biệt, chế độ "Suy ngẫm" (Contemplating) cho phép nhiều agent hoạt động song song để xử lý các tác vụ phức tạp. Trong lĩnh vực y tế, Muse Spark thể hiện ưu thế vượt trội nhờ sự hợp tác với hơn 1000 bác sĩ trong quá trình đào tạo. Tuy nhiên, khả năng viết mã và xử lý tác vụ agent dài hạn vẫn còn kém hơn so với một số đối thủ. Meta tuyên bố đã cải tiến đáng kể hiệu suất training, giảm 90% nhu cầu điện toán so với Llama 4 Maverick, đồng thời tối ưu hóa việc sử dụng token. Muse Spark hiện đã có mặt trên meta.ai và ứng dụng Meta AI, hoàn toàn miễn phí nhưng không mã nguồn mở. Đây được xem là bước tiến lớn của Meta trong cuộc đua AI, dưới sự dẫn dắt của Giám đốc AI Alexandr Wang và đội ngũ kỹ sư tài năng.

marsbit04/09 07:54

Vừa mới đây, "trái bơ" trị giá 14.3 tỷ USD của Mark Zuckerberg đã ra mắt, thách thức GPT-5.4, tác phẩm đầu tay đắt giá nhất của người Hoa tại Thung lũng Silicon

marsbit04/09 07:54

AI2 Công Bố Trình Tác Vụ Web Mã Nguồn Mở Toàn Phần MolmoWeb: Chỉ Cần 'Thị Giác' Là Có Thể Điều Khiển Trang Web

Viện Nghiên cứu Trí tuệ Nhân tạo Allen (AI2) vừa công bố tác nhân duyệt web mã nguồn mở đột phá **MolmoWeb**. Khác với các tác nhân truyền thống phụ thuộc vào mã nguồn trang web (DOM), MolmoWeb chỉ đưa ra quyết định dựa trên việc đọc ảnh chụp màn hình, đánh dấu một bước nhảy vọt lớn trong công nghệ điều hướng web dựa trên "thị giác". MolmoWeb hoạt động theo cách chụp ảnh màn hình trình duyệt, phân tích hình ảnh để quyết định thao tác tiếp theo (như nhấp chuột, cuộn trang), rồi thực hiện và lặp lại. Phương thức này giúp nó mạnh mẽ hơn vì bố cục trực quan của trang web thường ổn định hơn mã nguồn. Về hiệu suất, dù chỉ có quy mô tham số 4B và 8B, MolmoWeb thể hiện sức mạnh vượt trội: - **Dẫn đầu bảng xếp hạng:** Phiên bản 8B đạt **78.2%** trên bài kiểm tra WebVoyager, không chỉ đứng đầu trong các mô hình nguồn mở mà còn sát với mô hình độc quyền o3 của OpenAI (79.3%). - **Tiềm năng lớn:** Bằng cách chạy lặp lại và chọn kết quả tốt nhất, tỷ lệ thành công có thể tăng vọt lên **94.7%**. - **Định vị chính xác:** Nó thậm chí vượt qua Claude3.7 của Anthropic trong các bài kiểm tra định vị phần tử giao diện. AI2 cũng công bố bộ dữ liệu mở khổng lồ **MolmoWebMix**, bao gồm: - **36.000 nhiệm vụ duyệt web thực** được thực hiện bởi tình nguyện viên. - Hơn **2.2 triệu** cặp ảnh chụp màn hình - câu hỏi. - Dữ liệu tổng hợp tự động được xác thực bởi GPT-4o, thậm chí còn hiệu quả hơn dữ liệu con người trong việc hướng dẫn tác nhân. Hiện tại, MolmoWeb đã được mở hoàn toàn trên **Hugging Face** và **GitHub** với giấy phép Apache 2.0. Dù vẫn còn thách thức với các hướng dẫn phức tạp, xác thực đăng nhập và tuân thủ pháp lý, AI2 tin rằng sự minh bạch và cộng tác cộng đồng là chìa khóa để chống lại sự độc quyền dữ liệu.

marsbit03/26 01:41

AI2 Công Bố Trình Tác Vụ Web Mã Nguồn Mở Toàn Phần MolmoWeb: Chỉ Cần 'Thị Giác' Là Có Thể Điều Khiển Trang Web

marsbit03/26 01:41

Từ điển thuật ngữ AI (Phiên bản tháng 3/2026), đề nghị lưu lại

Từ vựng AI cần biết năm 2026: 30 thuật ngữ quan trọng từ cơ bản đến nâng cao Bài viết tổng hợp 30 thuật ngữ AI phổ biến, chia thành 2 nhóm: **Từ cơ bản (12):** - LLM (Mô hình ngôn ngữ lớn): Mô hình xử lý ngôn ngữ được đào tạo trên dữ liệu khổng lồ. - AI Agent: Hệ thống tự động hiểu mục tiêu và thực thi tác vụ. - Multimodal (Đa phương thức): Xử lý cùng lúc văn bản, hình ảnh, âm thanh. - Prompt: Lệnh đầu vào cho AI. - Generative AI (AIGC): AI tập trung vào tạo nội dung mới. - Token: Đơn vị xử lý văn bản, dùng để tính phí và đo lường. - Context Window: Số token tối đa AI có thể xử lý trong một lần. - Memory: Khả năng ghi nhớ lịch sử và sở thích người dùng. - Training & Inference: Quá trình đào tạo và triển khai mô hình. - Tool Calling: Khả năng gọi API và công cụ bên ngoài. **Từ nâng cao (18):** Bao gồm Transformer (kiến trúc mô hình), Attention (cơ chế tập trung), Hallucination (lỗi tạo nội dung sai), RAG (Tạo nội dung tăng cường bằng tìm kiếm), Fine-tuning (tinh chỉnh mô hình), cùng các khái niệm mới như Agentic Workflow, Subagents, Skills và Vibe Coding (lập trình bằng giao tiếp tự nhiên). Bài khuyến nghị nắm vững các thuật ngữ này để theo kịp xu hướng AI, đặc biệt trong bối cảnh ứng dụng ngày càng mở rộng.

marsbit03/11 11:55

Từ điển thuật ngữ AI (Phiên bản tháng 3/2026), đề nghị lưu lại

marsbit03/11 11:55

活动图片