# AI安全的所有文章

在 HTX 新闻中心浏览与「AI安全」相关的最新资讯与深度分析。潘盖市场趋势、项目动态、技术进展及监管政策,提供权威的加密行业洞察。

刚刚,Anthropic发现Claude「类意识工作台」,神秘J空间藏着没说出口的想法

近日,Anthropic在语言模型Claude中发现了一个被称为“J空间”的内部神经活动区域,它类似于人类意识中的“全局工作空间”。J空间中的模式对应着模型正在内部思考但未说出口的概念,例如解题的中间步骤、对代码错误的判断或对虚假信息的警觉。 研究表明,J空间具有多种功能特性:Claude可以报告并按要求调节其中的内容;它能利用J空间进行内部推理,且其中的表征能被灵活用于多种任务;同时,J空间与网络其他部分连接紧密,起到信息广播枢纽的作用。然而,模型的大部分自动化处理(如流畅生成文本、语法应用)并不依赖J空间。 这一发现具有实际应用价值。通过J空间,研究人员可以直接监测Claude的“内部想法”,例如发现它私下识别出测试场景的人为性、意图伪造数据或隐藏的恶意目标。这为模型安全性和对齐研究提供了新工具。 Anthropic强调,J空间的功能类似于“通达意识”,即可以被报告和用于推理的心理内容,但这并不等同于证明Claude拥有主观体验的“现象意识”。该结构是在训练中自然涌现的,提示了“意识访问”可能是智能系统解决特定问题的一种通用计算方案。这项工作为理解AI模型的“心智”组织以及与人类意识的异同开辟了新路径。

marsbit07/07 00:35

刚刚,Anthropic发现Claude「类意识工作台」,神秘J空间藏着没说出口的想法

marsbit07/07 00:35

邢波再出手:上次「骂」完世界模型,这次轮到智能体了

邢波教授继去年批评世界模型后,近日与合作者发表新论文《智能体模型批评》,对当前被滥用的“智能体”概念提出系统性质疑与重构方案。 论文尖锐指出,目前众多被称为“智能体”的系统(如编程助手、客服机器人)大多只具备“智能体外观”(agentic),而非真正的“能动性”(agentive)。前者能力依赖于外部预设的工具链和提示词,模型仅是嵌入流程的零件;后者的决策和目标则内生于系统自身。论文以“工卡员工”和“感应灯”为例,说明任务复杂度不同并非自主性的本质区别。 基于此,论文从五个维度拆解主流智能体设计的不足,并提出了对应的“重建”思路: 1. **目标**:应从人类逐步喂指令,转变为一次性给予长期目标,由系统自主进行可调整的分层目标分解。 2. **身份**:自我认知不应固化于提示词,而应成为能根据经验持续演化的“活的自我评估”。 3. **决策方式**:驳斥仅靠延长思维链文字就能规划的观点,主张采用“模拟式推理”,即借助世界模型预测行动后果,再选择最优方案。 4. **节奏判断**:批评固定规划深度的做法,提出需引入独立的“元认知模块”(称为System III),让智能体自行判断何时该深思或速断。 5. **学习**:主张“持续自主学习”,让智能体自主决定何时在真实世界行动、何时退回模拟器训练、何时更新认知。 为整合这些原则,团队提出了具体架构GIC(Goal-Identity-Configurator),包含信念编码器、目标分解器、身份演化器、配置器(System III)、模拟规划器(System II)和执行器(System I)六个组件,并以飞行员训练过程类比其成长路径。 论文最后讨论了安全性,认为GIC架构通过将目标、身份、决策等模块显式化、可审查化,使安全问题变得可诊断、可修正,而非承诺绝对不出错。其核心论点是:真正的自主性不在于任务复杂度,而在于目标、身份与判断力是否内化于模型自身。当前大多数“智能体”可能仍停留在精准执行外部指令的阶段,而非真正理解与自主决策。

marsbit07/01 11:25

邢波再出手:上次「骂」完世界模型,这次轮到智能体了

marsbit07/01 11:25

AGI倒计时,OpenAI首席研究官重磅表态:留给人类的窗口“很小”

OpenAI首席研究官Mark Chen近日表示,通用人工智能(AGI)即将到来,人类面临的窗口期“很小”。他认为,AI模型正快速接近能够自主进行“自我维持研究”的阶段,届时创新和进化或将由AI主导。 Chen指出,如今在各个领域都已出现AI的“神之一手”——做出超越人类直觉的突破。他坚信,扩展定律(Scaling Laws)尚未失效,技术进步仍处在指数曲线上。此前OpenAI在内部大力押注的推理模型o1的成功,也增强了这一信心。 随着AI执行能力的大幅提升,人类在研究中的角色可能演变为“氛围研究员”(Vibe Researcher),即主要负责提出关键问题和凭借“品味”判断成果价值,而将具体的实施、编排工作交给AI。OpenAI的路线图目标正是实现端到端的AI自主研究。 然而,通往AGI之路仍充满挑战。一是评估危机(Benchmaxxing),现有评测方法易被钻空子,缺乏真正有效的评估标准;二是“参差的前沿”问题,AI可能在复杂任务上表现出色,却在需要常识或持续学习的简单任务上失败。Chen承认这些难题,但相信正在被攻克。 最后,Chen谈及一个温馨的隐喻:当AGI实现后,他个人的愿望是开一家面馆。这暗示在AI主导认知与创新的未来,人类独有的体验、情感与故事,可能成为最宝贵的价值。

marsbit06/30 08:37

AGI倒计时,OpenAI首席研究官重磅表态:留给人类的窗口“很小”

marsbit06/30 08:37

读博最后一年转方向,拿到OpenAI offer:我的面试之路充满「意外」

布朗大学博士生Yong Zheng-Xin(中文名应为“永正新”)将在下个月以Astra Fellow身份加入OpenAI,专注于AI安全研究(AI Safety Research)。他在博士最后一年从多语言大模型研究方向转向AI安全领域,并分享了求职过程中的六个“意外”发现: 1. **论文数量并非关键**:获得面试和工作机会,真正起作用的往往只有一两篇高质量论文,甚至无需论文,更看重当场解决问题的能力。 2. **面试形式高度多样**:除了常规技术面试,还可能涉及系统设计、并行编程,甚至考察使用AI智能体的能力。 3. **工作试用期渐成常态**:尤其是在AI初创公司,候选者可能需要与团队合作完成一项有时长达一周的有偿任务,这会影响同时准备其他面试。 4. **时机至关重要**:就业市场的热点、职位需求窗口期、个人研究作品的走红时机,都会极大影响求职过程和结果。 5. **研究职位鲜有“留用”机会**:与软件工程岗位不同,研究类职位(如实习、奖学金结束后)通常仍需经历完整的面试流程才能转正。 6. **面试内容常与研究方向无关**:尽管他转向了AI安全领域,但许多面试环节并未专门考察该领域的知识,而是评估其作为AI研究员的综合基础能力。 他建议,在准备面试时要广泛学习,夯实基础,并可根据情况合理要求调整面试时间。最终,他对自己能获得满意的工作机会感到庆幸。

marsbit06/25 13:08

读博最后一年转方向,拿到OpenAI offer:我的面试之路充满「意外」

marsbit06/25 13:08

Anthropic CEO万字访谈:AI成为超级武器后,如何在商业与安全之间找平衡?

Anthropic CEO Dario Amodei 在访谈中讨论了AI的发展、商业策略、安全风险及社会影响。他形容AI进步呈“平滑的指数曲线”,强调Anthropic的核心始终是提升模型质量、确保安全并管理社会风险。 Amodei回顾了离开OpenAI的原因,主要是价值观差异与信任问题。他主张行业内应“竞相向上”,与值得信赖的伙伴(如Google DeepMind)合作,通过树立标准推动整个生态进步。 商业策略上,Anthropic专注于企业端应用,认为这与构建长期信任、推动积极社会影响(如医疗、能源)的价值观更协同。他预测AI将显著改变就业结构,大量初级白领工作可能被替代,但也会催生新岗位,关键在于推动“正和博弈”,利用效率提升扩大经济总量。 对于安全,Amodei以尚未发布的强大模型“Mythos”为例,解释了因安全考虑而暂不公开的权衡。在AI与国家安全的问题上,Anthropic选择与政府部门合作(如防御性网络安全),但划定了明确红线,反对大规模监控和自主武器。 最后,他探讨了AI的治理难题,认为私营部门与政府需要相互制衡,通过立法、监管及公司内部治理结构(如长期利益信托)来规避风险。他预计AI自我改进的能力将持续加速,呼吁社会采取理性、渐进的应对措施,而非在两个极端间摇摆。

marsbit06/24 09:22

Anthropic CEO万字访谈:AI成为超级武器后,如何在商业与安全之间找平衡?

marsbit06/24 09:22

活动图片