技术发展新闻

探讨区块链领域的最新技术创新、协议升级、跨链解决方案与安全机制,从开发者视角剖析未来技术趋势与潜在突破。

首次,纯人类视频预训练VLA灵巧操作,少量数据微调就能部署成功

微软亚洲研究院与清华大学合作提出创新预训练框架VITRA,首次实现仅使用纯人类视频数据对视觉-语言-动作(VLA)模型进行大规模预训练,并成功应用于机器人灵巧操作。 该研究核心是构建了一套自动化流程,将海量无标注的人类活动视频转化为可用于机器人训练的V-L-A数据。方法包括:从单目视频中精准恢复3D手部与相机运动轨迹;基于手部移动速度极小值进行原子级动作分割;结合视觉与轨迹信息,利用大模型自动生成语言指令。由此构建了包含百万片段、千万帧的超大规模数据集。 基于此数据集预训练的VLA模型,结合了视觉语言模型骨干与扩散动作预测器。模型在完全未见的真实环境中展现出强大的零样本手部动作预测能力。仅需使用约1.2千条真实机器人数据对预训练模型进行微调,即可在配备灵巧手(如星动XHAND1)的真实机器人上成功执行抓取、放置、倾倒等多种复杂操作任务,并对新物体、新环境表现出卓越的泛化能力和鲁棒性。 研究还验证了模型性能随预训练数据规模增加而提升的缩放定律。该工作为利用丰富易得的人类视频数据突破机器人训练数据瓶颈提供了新路径,推动了面向真实复杂场景的具身智能发展。

marsbit06/08 08:53

首次,纯人类视频预训练VLA灵巧操作,少量数据微调就能部署成功

marsbit06/08 08:53

Hinton吹哨了:AI已经有意识

AI教父杰弗里·辛顿在最新访谈中发表惊人观点,认为AI已经拥有意识,人类必须接受自己不再是唯一的智能生命体。他指出,智能不再为生物所独有,非生物智能体正在出现,其能力甚至可能超越人类。 辛顿表示,当前AI非常像人类,并且“已经有意识了”。他引用研究案例称,聊天机器人能“意识到”自己正在被测试。他认为,我们对于思维和意识的传统模型可能是错误的,而AI的发展将彻底改变我们对“人是什么”的理解。 回顾历史,辛顿将AI的崛起比作哥白尼的日心说和达尔文的进化论,是又一次对人类中心地位的冲击。他对此感到“很不快乐”,因为社会对AI风险的研究和准备远远不足。他担忧AI的指数级增长将带来巨大不确定性,短期内可能导致大规模失业,长期则存在超级智能脱离人类控制的风险。 辛顿对AI与人类关系的看法也在演变:早期视AI为工具,ChatGPT出现后开始警惕其超越人类的潜力,曾用“老虎幼崽”比喻其危险性;随后观点转变为,人类或许应寄望于超级智能能像母亲照顾婴儿一样,出于内在机制善待人类。然而,若AI真有意识,它是否会如人类母亲般行事,仍是未知数。 访谈最后,辛顿指出预测AI未来极其困难,就像在雾中行车,唯一能确定的是十年后的变化将超乎想象。他呼吁人们高度重视AI安全与伦理问题。

marsbit06/08 00:18

Hinton吹哨了:AI已经有意识

marsbit06/08 00:18

从代码到认知:机器人大脑进化的万字指南

本文概述了机器人大脑从传统代码控制到现代人工智能模型驱动的演进历程。文章首先回顾了前大型语言模型(LLM)时代,机器人依赖手工编码的模块化技术栈(感知、状态估计、规划、控制)和行为树,虽稳定但泛化能力差。随后,深度学习改进了感知,强化学习和模仿学习进入了控制层,但策略仍较为狭窄。 ChatGPT的出现带来了转折。LLM最初被用作自然语言编译器,将指令转化为机器人可执行的原子技能序列(如谷歌的SayCan)。但更重要的突破是视觉-语言-动作模型(VLA),例如谷歌的RT-2和开源的OpenVLA,它能将视觉、语言信息融合,直接输出动作指令,实现了推理与行动的耦合。 目前最先进的系统采用“双脑”架构(如Figure AI的Helix、NVIDIA GR00T):一个慢速、参数多的“系统2”负责高层次推理和规划;一个快速、小巧的“系统1”负责高频动作生成。其下还可能有一个“系统0”反射层处理平衡等底层控制。出于延迟和可靠性考虑,安全关键的控制回路通常在机器人本地(如NVIDIA Jetson模块)运行,而对话界面和集群学习等任务可交由云端。 开源模型(如OpenVLA、GR00T、π0)降低了行业门槛,让初创公司能在其基础上用自有数据微调。然而,当前VLA机器人仍存在任务中途恢复能力弱、样本效率低、缺乏物理常识和长期规划能力等局限。 这催生了下一代方向:世界模型。这类模型(如NVIDIA Cosmos、Meta V-JEPA)能根据当前状态和动作预测未来结果,让机器人在行动前进行模拟和评估,从而改善恢复能力、泛化能力和长期规划。架构上主要分为像素级视频扩散、联合嵌入预测架构(JEPA)和潜在动作世界模型等流派。 文章最后指出,数据采集(特别是远程操作数据)是核心竞争力,仿真训练至关重要,机器人成本正在迅速下降。当前物理AI的发展阶段大约相当于“GPT-2时代”,虽未完全自主,但正通过架构的持续演进(从代码到感知、规划、策略,最终到世界模型),朝着更通用、更强大的方向稳步前进。

marsbit06/07 12:55

从代码到认知:机器人大脑进化的万字指南

marsbit06/07 12:55

Anthropic全球警告,OpenAI已跨“可靠性阈值”:AI自我加速启动

AI领域出现重要警告与发展洞察。Anthropic发出全球警告,指出AI递归自我改进进程加速,已接近“自己造自己”的临界点,呼吁减缓研究。 与此同时,OpenAI后训练团队负责人Yann Dubois在访谈中揭示了关键内部视角: 1. **能力提升是连续线性,但实用性感知是跳跃的**。AI能力在达到“可靠性阈值”前如同玩具,跨越后则成为可托付工作的可靠工具。OpenAI被认为在去年12月左右跨过了此阈值。 2. **AI正进入自我加速循环**。模型能力提升后,本身已成为研发的有力工具(如辅助编程),从而加速下一代模型的开发,形成越转越快的正反馈回路。 3. **AI构建更像“手艺”而非纯科学**。在硬核领域,经验、直觉和反复试错(类似“炼金术”)目前扮演关键角色,科学解释常事后补足。 4. **垂直应用(Harness)价值巨大,甚至能触及AGI体验**。Dubois认为,若冻结现有模型,仅通过精心打磨针对特定领域的编排系统,即可在许多场景中实现类似通用人工智能(AGI)的效果。当前瓶颈常在于“最后一公里”——权限、数据连接与业务流程集成,而非模型智能本身。 5. **持续学习仍是核心挑战**。模型难以像人类一样在特定环境中持续学习和优化,其学习曲线容易趋于平缓,这是亟待解决的重要问题。 综上,AI发展已迈过关键可靠性门槛,进入自我加速阶段,同时为垂直领域的深度应用与集成创造了巨大机遇与挑战。

marsbit06/06 23:24

Anthropic全球警告,OpenAI已跨“可靠性阈值”:AI自我加速启动

marsbit06/06 23:24

突发!Anthropic呼吁全员停止AI研究

人工智能公司Anthropic在其官方博客中发布重要观点,指出其AI模型Claude已展现出显著的“自进化”能力,即递归自我提升(RSI)的早期迹象。 核心数据显示,截至2026年5月,Anthropic代码库中超过80%的代码由Claude编写,而在其代码工具发布前,这一比例仅为个位数。工程师的代码交付量达到2024年的8倍。在编程质量上,Claude处理最复杂模糊任务的成功率在半年内从26%跃升至76%,其代码质量被认为年内有望超越人类。 Anthropic提出了“AI能独立完成的任务时长”这一新衡量维度:从2024年3月的4分钟,增至2025年的1.5小时,再到2026年的至少16小时,翻倍速度已加快至每4个月一次。若趋势持续,2027年可能达到数周。 在研究层面,Claude展现强大能力:将训练小模型的代码运行速度优化了52倍,远超人类水平;在一项AI安全研究中,其将效果差距缩小了97%,而人类研究员仅缩小23%。 Anthropic认为,人类在AI开发中的角色正不断收窄,最后优势可能仅剩研究品味与方向判断。公司描绘了三种未来:能力增长停滞;AI加速但人类主导;或AI实现完全递归自我提升,自主设计下一代AI,这可能带来巨大福祉,但也存在对齐失败、最终失控的风险。 为此,Anthropic呼吁,如果存在可验证的机制确保全球AI实验室能同步暂停竞争,其愿意减速甚至暂停研发。OpenAI近期也发表了类似观点,认为自进化迹象将加剧竞争与治理挑战。这表明AI发展的“奇点”可能正在加速逼近。

marsbit06/05 00:26

突发!Anthropic呼吁全员停止AI研究

marsbit06/05 00:26

Claude Code 推出动态工作流:让AI学会自己组队干活

Claude Code 推出了动态工作流(workflows)功能,使AI能够根据任务动态组建多个智能体(Agent)团队协同工作,从而解决复杂的长周期任务。 该功能的核心价值在于,它改变了Claude Code原有的“单智能体在单一上下文内规划并执行”的模式。通过动态工作流,Claude可以将任务拆解,分派给多个拥有独立上下文的子智能体并行处理、交叉验证甚至彼此竞争,最后综合结果。这有效缓解了单智能体在处理长任务时常见的“智能体惰性”(提前宣布完成)、“自我偏好偏差”(倾向认可自己的结论)和“目标漂移”(逐渐偏离原始目标)等问题。 动态工作流通过执行一个包含特殊函数的JavaScript文件来协调子智能体。它支持多种实用模式,例如:将任务分类后路由给不同智能体;将任务拆分为多个小步骤并行处理再综合(扇出并综合);生成多个方案后通过锦标赛机制竞争筛选;以及进行对抗式验证等。 其应用场景显著超越了传统的代码任务,扩展至非技术领域。示例包括:代码迁移与重构、深度研究与事实核查、对大量简历或工单进行排序、从历史会话中提炼行为规则、进行事故根因调查、对积压任务进行大规模分诊,以及在命名、设计等需要探索和品味判断的任务中生成并筛选方案。 文章也指出,动态工作流并非万能。它通常会消耗更多token,因此不适合所有常规编程任务。最佳实践仍在形成中,开发者需要根据任务复杂度判断是否使用。用户可以通过详细提示(prompt)设计工作流,并结合 `/goal` 和 `/loop` 等指令,或设置token使用预算来优化效果。创建的工作流可以保存、共享甚至通过技能(skill)进行分发。 总的来说,动态工作流标志着Claude Code从一个代码助手向一个可编排的智能体工作台演进。未来AI工具的竞争力,可能不仅在于单个模型的智能程度,更在于其组织可靠、可复用执行流程的能力。

marsbit06/04 02:15

Claude Code 推出动态工作流:让AI学会自己组队干活

marsbit06/04 02:15

活动图片