# 生成式AI的所有文章

在 HTX 新聞中心流覽與「生成式AI」相關的最新資訊與深度分析。潘蓋市場趨勢、專案動態、技術進展及監管政策,提供權威的加密行業洞察。

李飞飞最新长文:当视频生成、机器人和 NVIDIA 都自称世界模型,我们需要一个分类法

李飞飞发表文章,针对当前AI领域中“世界模型”一词被广泛滥用的现象提出一个清晰的功能分类法。她指出,尽管视频生成、机器人和NVIDIA等不同领域都自称构建“世界模型”,但它们实际指的是强化学习闭环(POMDP)中三种不同的功能模块。 **分类法如下:** 1. **渲染器**:输出**观测**(如像素),追求视觉保真度,例如Sora、Genie等视频生成模型。其局限在于“好看不等于物理正确”。 2. **模拟器**:输出**状态**,即在几何、物理和动力学层面忠实的世界表征,服务于建筑设计、机器人训练等需要精确模拟的场景。李飞飞认为这是连接渲染和规划的关键枢纽,被严重低估。 3. **规划器**:输出**动作**,根据观测和目标决定智能体(如机器人)应执行的动作,是感知-行动回路的闭环。 **现状与趋势:** * **渲染器**商业化最成熟,但有物理准确性天花板。 * **规划器**最令人兴奋但最不成熟,实验室演示与实际部署存在巨大鸿沟。 * **模拟器**是核心桥梁,掌握了模拟就同时为渲染和规划提供了基础。 当前最重要的趋势是这三类功能的边界正在消融,因为它们共享对世界底层运作(几何、物理、动力学)的同一套理解。例如,World Labs的Marble模型能同时输出用于视觉的高斯泼溅和用于物理模拟的碰撞网格。 逻辑终点是构建一个**统一的世界基础模型**,能根据下游需求在渲染、模拟和规划模式间自由切换。尽管面临数据不均衡、优化目标冲突等挑战,但三者的融合将重新定义机器智能与物理世界的关系,推动空间智能的发展。

链捕手07/05 09:12

李飞飞最新长文:当视频生成、机器人和 NVIDIA 都自称世界模型,我们需要一个分类法

链捕手07/05 09:12

世界模型概念入门:一个从心理学烧到 AI 主战场的故事

世界模型是当前AI领域的热门概念,旨在让机器像人类一样,在行动前通过“脑内沙盘”预演和推演未来。其核心思想可追溯至1943年心理学家Kenneth Craik提出的“心智模型”,以及AI先驱Marvin Minsky的“框架理论”。2018年,David Ha与Jürgen Schmidhuber的论文将这一概念带入深度学习主流。 当前,学界和产业界对世界模型的定义尚未统一。Yann LeCun强调其应理解物理规律,提出JEPA架构;李飞飞则基于POMDP框架,将世界模型分为渲染器、模拟器和规划器三类;清华大学FIB-Lab将其功能归纳为“理解世界”与“预测未来”。OpenAI的Sora、Google DeepMind的Genie 3、英伟达的Cosmos等大厂产品,分别从视频生成、3D交互、物理仿真等角度切入。 技术路线主要分为三类:一是“画画”路线,即生成式视频模型,视觉逼真但物理一致性弱;二是“心算”路线,预测抽象表征,效率高但可解释性差;三是“搭积木”路线,生成精确的三维环境,可控但泛化能力有限。发展趋势是三者融合,并向World Action Model(WAM)演进,实现状态预测与动作生成的联合学习。 产业链已形成基础支撑层、技术平台层和场景应用层三层结构,在自动驾驶、具身智能等领域应用广泛。尽管概念尚未统一,但这反映了技术早期的多元探索,最终目标都是让机器拥有可推演、可泛化的内部世界模型,以实现更安全、高效和通用的智能行为。

marsbit06/29 05:08

世界模型概念入门:一个从心理学烧到 AI 主战场的故事

marsbit06/29 05:08

没有统一名字的战争:国内各家大厂的世界模型版图

世界模型是AI领域的关键方向,但业内尚未有统一命名,常被称为世界基座模型、物理AI或融入自动驾驶大模型等。其核心目标是让机器在行动前,在内部构建可推演、复盘的动态环境,将真实世界压缩为可无限生成和测试的数据引擎,从而减少对真实数据的依赖。 国内各大厂商已积极布局。**互联网巨头**中,阿里推出了面向语言、虚拟和物理世界的三个模型;腾讯侧重3D可编辑世界,服务于游戏和社交;字节跳动依托短视频数据秘密研发;华为、百度则将其作为智能汽车与自动驾驶的底层能力,不单独强调概念。**车企**将世界模型视为“驾校和考场”,用于生成和测试驾驶场景,提升智能驾驶系统能力,如蔚来、理想、小鹏、吉利等均有具体布局。**智驾供应商**如Momenta、地平线、毫末智行等,则将世界模型作为“隐形引擎”,嵌入端到端系统中,以强化仿真训练和闭环验证。 创业公司虽专注灵活,但面临数据、算力和商业化闭环的挑战;而大厂凭借数据、算力和现有业务体系,正将世界模型从研究项目转化为业务底座。竞争正从“能否做出模型”转向“能否实现规模化应用”。世界模型并非短暂风口,而是语言大模型、视频生成、自动驾驶等技术在物理世界交汇的必然升级,成为未来产业基础设施的核心。

marsbit06/25 06:51

没有统一名字的战争:国内各家大厂的世界模型版图

marsbit06/25 06:51

红杉对话黄仁勋:计算模式迎来60年巨变,你不会被AI取代,但会被“善用AI的人”降维打击

来源:红杉资本 编译:Yuliya, PANews 红杉资本合伙人康斯坦丁·布勒与英伟达创始人兼CEO黄仁勋展开对话,探讨计算技术的根本变革。黄仁勋指出,计算模式正经历60年来的巨变:从过去的数据存储与检索,转向实时生成与定制。未来的每个像素、声音、视频都将根据用户上下文实时生成,这催生了“AI工厂”——大规模生产智能的计算设施。 黄仁勋将AI工厂比作新时代的“发电机”,它输入电能,输出数字化的智能(Token)。他预测,未来智能网络将像电网和互联网一样包裹全球,不仅人类使用,还会有上千亿个AI智能体在互联网上协作工作。 针对AI对就业的影响,黄仁勋反驳了“AI取代人类”的恐慌论。他强调,自动化提升的是效率,而非消灭职业。他以放射科医生和软件工程师为例:AI辅助反而扩大了行业规模与人才需求。真正的风险在于,“人们不会因AI失去工作,但可能被善用AI的人取代”。他鼓励所有人积极拥抱AI,将其作为能力升维的工具。 在投资层面,黄仁勋提出“五层蛋糕”模型:能源、芯片与计算设施、基础设施、模型层、应用层。AI生态当前年投入约1万亿美元,未来规模可能达20万亿美元,涵盖能源、硬件、软件及各行业应用,创造大量新机会。 黄仁勋总结,AI是赋予人类超级能力的技术,当前关于失业的叙事多为误导。企业与国家应聚焦AI带来的确定性机遇,加速融入智能时代。

marsbit06/12 02:59

红杉对话黄仁勋:计算模式迎来60年巨变,你不会被AI取代,但会被“善用AI的人”降维打击

marsbit06/12 02:59

AI黑话词典(2026年3月版),建议收藏

《AI黑话词典(2026年3月版》是一份面向AI初学者的实用指南,旨在帮助读者快速理解AI领域的高频术语。文章分为基础词汇和进阶词汇两部分,共收录30个核心概念。 基础词汇包括: - **LLM(大语言模型)**:基于海量数据训练的深度学习模型,擅长处理文本和多模态内容。 - **AI Agent**:能理解目标、调用工具并执行任务的智能系统。 - **多模态**:模型处理文本、图像、音频等多种输入输出的能力。 - **Prompt**:用户与模型交互的指令。 - **生成式AI(AIGC)**:专注于生成文本、代码等内容的AI技术。 - **Token**:模型处理输入输出的基本单位,影响计费和响应速度。 - **上下文窗口**:模型单次处理可考虑的Token总量。 - **记忆**:模型保留用户偏好和历史状态的能力。 - **训练与推理**:模型学习参数的过程及上线后生成输出的阶段。 - **工具调用**:模型调用外部API或数据库的能力。 - **API**:连接AI产品与第三方服务的基础设施。 进阶词汇涵盖: - **Transformer架构**:大语言模型的技术基础,擅长理解上下文关系。 - **注意力机制**:模型重点处理关键信息的核心机制。 - **Agent化工作流**:系统自主拆解任务并执行的智能化流程。 - **子智能体与可复用能力**:Agent分解任务及模块化能力单元。 - **机器幻觉**:模型生成错误或荒谬输出的现象。 - **延迟与护栏**:模型响应时间及安全限制机制。 - **氛围编程**:通过对话让AI直接生成代码的方式。 - **参数与强推理模型**:模型规模衡量标准及复杂任务处理能力。 - **模型上下文协议(MCP)**:模型与外部工具的通用接口标准。 - **微调与蒸馏**:模型适应特定任务及能力压缩技术。 - **RAG与事实对齐**:通过外部数据增强生成答案并确保依据真实。 - **向量嵌入与基准测试**:内容语义化表示及模型能力评估方法。 文章建议收藏,便于随时查阅学习。

marsbit03/11 11:52

AI黑话词典(2026年3月版),建议收藏

marsbit03/11 11:52

活动图片