# Bài viết Liên quan Tạo video

Trung tâm Tin tức HTX cung cấp những bài viết mới nhất và phân tích chuyên sâu về "Tạo video", bao gồm xu hướng thị trường, cập nhật dự án, phát triển công nghệ và chính sách quản lý trong ngành tiền kỹ thuật số.

Bản Nano Banana phiên bản video đã ra mắt: Tích hợp kiến thức thế giới của Gemini, tạo ảnh bản gốc chỉ mất 4 giây

Google đã chính thức ra mắt hai mô hình AI đa phương thức mới: Gemini Omni Flash và Nano Banana 2 Lite. Gemini Omni Flash là một mô hình tạo video có khả năng chỉnh sửa video thông qua hội thoại tự nhiên, kết hợp đầu vào đa phương thức (văn bản, hình ảnh, video) và sử dụng kiến thức thế giới của Gemini để xây dựng video chân thực. Mô hình này hiện hỗ trợ tạo video 10 giây với chi phí 0,10 USD mỗi giây đầu ra. Nano Banana 2 Lite (hay gemini-3.1-flash-lite-image) là phiên bản hình ảnh nhanh và tiết kiệm chi phí. Nó có thể tạo hình ảnh độ phân giải 1K chỉ trong khoảng 4 giây với giá khoảng 0,034 USD mỗi hình, giữ lại khả năng kết xuất văn bản xuất sắc. Điểm đáng chú ý là hai mô hình này có thể được kết hợp để tạo ra quy trình làm việc liền mạch: tạo hình ảnh nhanh chóng với Nano Banana 2 Lite, sau đó sử dụng hình ảnh đó làm tài liệu tham chiếu để Gemini Omni Flash tạo ra video động. Google đã minh họa tiềm năng này qua các ứng dụng demo như du lịch ảo (Anywhere), thiết kế nội thất (Space Lift) và tạo nội dung tiếp thị thương mại điện tử (Omni Product Studio). Những phát triển này cho thấy chiến lược của Google là tập trung vào việc áp dụng AI đa phương thức vào các ngành dọc cụ thể như thương mại điện tử, quảng cáo và sáng tạo nội dung, tận dụng lợi thế hệ sinh thái Android để thúc đẩy thương mại hóa.

marsbit07/01 01:56

Bản Nano Banana phiên bản video đã ra mắt: Tích hợp kiến thức thế giới của Gemini, tạo ảnh bản gốc chỉ mất 4 giây

marsbit07/01 01:56

Nhóm của Lý Phi Phi làm rõ khái niệm 'Mô hình thế giới', Sora chỉ có thể tính là trình kết xuất

Nhóm của Giáo sư Lý Phi Phi từ World Labs và Đại học Stanford đã công bố một bài phân tích khái niệm, chỉ ra sự lạm dụng thuật ngữ "mô hình thế giới" trong AI. Bài viết phân loại các hệ thống được gọi là "mô hình thế giới" thành ba chức năng chiếu theo vòng lặp nhận thức POMDP: bộ kết xuất, bộ mô phỏng và bộ lập kế hoạch. Theo phân loại này, các mô hình tạo video như Sora của OpenAI thuộc nhóm "bộ kết xuất". Chúng tập trung tạo ra đầu ra pixel chân thực cho thị giác con người từ trạng thái hoặc mô tả, nhưng không thực sự tính toán các quy luật vật lý chính xác để dự đoán sự thay đổi trạng thái dựa trên hành động. Do đó, chúng không phải là mô hình thế giới đầy đủ hay bộ mô phỏng thế giới. Ngược lại, "bộ mô phỏng" (ví dụ: NVIDIA Omniverse) tập trung vào việc tạo ra trạng thái vật lý-chính xác cho các tính toán, còn "bộ lập kế hoạch" chuyển đổi quan sát thành hành động. Sự nhầm lẫn khái niệm này, thường được thúc đẩy bởi tiếp thị, có thể dẫn đến đánh giá sai lệch về khả năng công nghệ, ảnh hưởng đến lựa chọn kỹ thuật và đầu tư. Việc làm rõ này có giá trị thực tiễn, giúp các doanh nghiệp và nhà đầu tư đánh giá đúng năng lực của từng loại hệ thống. Tương lai có thể hướng tới sự hợp nhất của ba chức năng, nhưng hiện tại, việc nhận biết ranh giới của chúng là rất quan trọng.

marsbit06/04 03:19

Nhóm của Lý Phi Phi làm rõ khái niệm 'Mô hình thế giới', Sora chỉ có thể tính là trình kết xuất

marsbit06/04 03:19

Trong lĩnh vực tạo video bằng AI, 'tiên phong vượt trội' đã thành hiện thực

Các công ty AI Trung Quốc, đặc biệt là ByteDance (với mô hình Seedance 2.0) và Kuaishou (với mô hình Kling 3.0), đang dẫn đầu thế giới về công nghệ tạo video bằng AI. Sự vượt trội này được thể hiện qua các bảng xếp hạng đánh giá của người dùng và nhận định từ các chuyên gia, nhà sáng tạo quốc tế. Lợi thế chính đến từ nguồn dữ liệu video chất lượng cao, được gắn nhãn hành vi người dùng tự nhiên từ các nền tảng như Douyin và Kwai, cùng với vòng phản hồi liên tục từ hàng chục triệu người dùng sáng tạo nội dung. Hơn nữa, các mô hình này có các kịch bản ứng dụng thương mại rõ ràng và hiệu quả như video thương mại điện tử, quảng cáo và phim ngắn, tạo ra vòng lặp doanh thu và cải tiến sản phẩm bền vững. Tuy nhiên, ngành công nghiệp AI video Trung Quốc vẫn đối mặt với thách thức. Khoảng cách về sức mạnh tính toán (điện toán) so với các công ty Mỹ như OpenAI và Anthropic đang ngày càng lớn. Các vấn đề về bản quyền đã khiến ByteDance tạm dừng kế hoạch phát hành Seedance 2.0 toàn cầu và hạn chế khả năng tạo ra nhân vật có IP. Chi phí vận hành cao khiến các công ty phải cân nhắc giữa tăng trưởng người dùng và tính bền vững tài chính. Ngoài ra, vẫn tồn tại khoảng cách về năng lực ở các mô hình ngôn ngữ lớn nền tảng so với các đối thủ Mỹ hàng đầu. Tóm lại, sự dẫn đầu của Trung Quốc trong lĩnh vực tạo video AI là có thực, dựa trên lợi thế dữ liệu và hệ sinh thái ứng dụng, nhưng vẫn phải đối mặt với những thách thức cốt lõi về điện toán, bản quyền và mô hình cơ bản.

marsbit05/21 04:38

Trong lĩnh vực tạo video bằng AI, 'tiên phong vượt trội' đã thành hiện thực

marsbit05/21 04:38

Gemini 3.5 đã đến! Đêm nay, chính Google tự đào thải Google

Bài viết tóm tắt các sản phẩm và công nghệ chính được giới thiệu tại Google I/O 2026: 1. **Gemini Omni**: Một mô hình AI đa năng, có thể nhận đầu vào dưới mọi hình thức (hình ảnh, âm thanh, video, văn bản) và tạo ra video chất lượng cao. Nó thực sự hiểu biết thế giới vật lý, cho phép người dùng chỉnh sửa video thông qua trò chuyện và duy trì tính nhất quán của đối tượng và logic xuyên suốt các cảnh. 2. **Gemini 3.5 Flash**: Được quảng cáo là mô hình mã hóa và tác nhân AI mạnh mẽ nhất của Google, vượt trội so với Gemini 3.1 Pro và các đối thủ khác trong nhiều bài kiểm tra tiêu chuẩn. Nó nhanh hơn đáng kể và đã được tích hợp vào Gemini App và chế độ AI của Google Tìm kiếm. 3. **Antigravity 2.0**: Nền tảng phát triển tác nhân AI độc lập mới, được nâng cấp thành ứng dụng máy tính để bàn. Một bản demo ấn tượng cho thấy 93 tác nhân con, sử dụng 3.5 Flash, đã xây dựng được một hệ điều hành hoạt động đầy đủ từ đầu trong vòng 12 giờ. 4. **Gemini Spark**: Một tác nhân AI cá nhân, chạy 24/7 trên đám mây. Nó có thể tự động xử lý các tác vụ phức tạp bằng cách tích hợp với bộ công cụ Google Workspace (như Gmail, Docs, Sheets, Slides) và hỗ trợ lệnh bằng giọng nói để tạo và quản lý nhiều tác vụ song song. 5. **Các thông báo khác**: Bao gồm thiết kế lại Gemini App với mã lực tính phí, kế hoạch đăng ký AI Ultra mới với giá cả được điều chỉnh, và bản nâng cấp lớn cho Google Tìm kiếm với việc tích hợp 3.5 Flash. Bài viết kết luận rằng sự kết hợp đồng thời của các khả năng AI tiên tiến này (hiểu và tạo đa phương thức, tác nhân tự hành) đánh dấu một bước tiến lớn, thu hẹp khoảng cách về mặt kỹ thuật để tiến tới Trí tuệ Siêu việt (ASI).

链捕手05/20 07:01

Gemini 3.5 đã đến! Đêm nay, chính Google tự đào thải Google

链捕手05/20 07:01

Google dùng AI 'giết chết' Google, buổi ra mắt này khiến người xem cảm thấy ngộp thở

Tại Google I/O, Sundar Pichai công bố Gemini đạt hơn 900 triệu người dùng hàng tháng. Sự kiện tập trung vào hai mô hình lõi: Gemini Omni và Gemini 3.5 Flash. Gemini Omni là mô hình đa phương thức hướng tới "mô hình thế giới", có khả năng tạo và chỉnh sửa video nâng cao từ các lệnh đơn giản, thậm chí mô phỏng các hiệu ứng vật lý. Nó sẽ được tích hợp vào các sản phẩm như Gemini App và Google Flow. Gemini 3.5 Flash được tối ưu cho tốc độ, chi phí thấp và khả năng thực thi, đặc biệt trong lập trình. Cùng với công cụ phát triển Antigravity 2.0, nó cho phép các tác nhân AI (Agent) xây dựng các dự án phức tạp như một hệ điều hành với chi phí hiệu quả. Google cũng công bố nhiều bản cập nhật lớn: * **Tìm kiếm:** Nâng cấp lên Gemini 3.5, tích hợp tính năng AI Overviews và giới thiệu "Tác nhân Thông tin" có thể theo dõi chủ đề theo thời gian. * **Gemini Spark:** Một tác nhân AI cá nhân chạy 24/7 trên đám mây, có thể xử lý nhiều tác vụ phức tạp tự động, ngay cả khi thiết bị tắt. * **Gemini App:** Thiết kế lại với giao diện Neural Expressive và thêm tính năng "Daily Brief" – một bản tóm tắt cá nhân hóa cho buổi sáng. * **Công cụ sáng tạo:** Ra mắt Google Pics để chỉnh sửa ảnh, cập nhật Stitch cho thiết kế giao diện, và bổ sung nhiều tính năng AI mạnh mẽ vào Google Flow cho chỉnh sửa video, âm nhạc. * **Phần cứng:** Giới thiệu kính thông minh chạy Android XR, có cả phiên bản hiển thị hình ảnh và phiên bản chỉ âm thanh (ra mắt trước vào mùa thu), cho phép tương tác với Gemini qua âm thanh riêng tư. * **Bảo mật:** Giới thiệu CodeMender, một tác nhân tự động phát hiện và sửa lỗi bảo mật trong mã nguồn. Bài báo chỉ ra rằng, đằng sau những nâng cấp trải nghiệm miễn phí, Google đang chuyển hướng sang mô hình kinh doanh dựa trên thuê bao AI cao cấp và dịch vụ cơ sở hạ tầng doanh nghiệp để trang trải chi phí điện toán khổng lồ cho các mô hình và tác nhân AI phức tạp này. Câu hỏi then chốt là liệu người dùng có sẵn sàng trả tiền cho một "trợ lý toàn năng" AI hay không.

marsbit05/19 23:57

Google dùng AI 'giết chết' Google, buổi ra mắt này khiến người xem cảm thấy ngộp thở

marsbit05/19 23:57

活动图片