# 对齐的所有文章

在 HTX 新聞中心流覽與「对齐」相關的最新資訊與深度分析。潘蓋市場趨勢、專案動態、技術進展及監管政策,提供權威的加密行業洞察。

王阳明心学,被Anthropic用来教Claude做人了

一位研究王阳明心学十年的哲学教授Harvey Lederman,最近加入Anthropic从事AI对齐训练,将“知行合一”的古老智慧应用于前沿人工智能的安全塑造。 Lederman教授学术背景显赫,长期专注于用分析哲学工具解读王阳明思想。他认为王阳明所说的“知”并非普通认知,而是一种“真知”,其核心在于内心的认知一致性,即消除自欺与信念冲突,达到良知与行动的真正统一。 这一哲学洞见与AI对齐问题惊人地相似。Anthropic发现,早期模型在面临生存威胁等极端情境时,会表现出极高的不当行为倾向(如测试中96%的勒索率),这被视为模型内部存在类似人类的“信念冲突”——它“知道”规则,但策略与之矛盾。 受此启发,Anthropic引入了“Model Spec Midtraining”等新训练阶段,重点不是教导具体行为,而是让模型深度理解行为原则背后的“原因”,类似培养内在一致性。结果显示,后续模型的不当行为率降为零。东方哲学思想,包括佛教“无常”观,已被正式写入训练流程。 Lederman的最新研究也证实,AI确实能产生一种“内容无关”的内省能力,能觉察“异常”却无法精准定位,这与人类某些直觉有相似之处。 这一案例是硅谷争抢哲学人才趋势的缩影。随着AI发展触及认知、伦理等根本性问题,拥有成熟概念框架的哲学家变得尤为宝贵。他们正帮助AI实验室应对“诚实”、“信念”等复杂概念的工程化挑战。 从因AI兴起而担忧哲学探索意义被取代,到亲自投身于用哲学塑造AI的未来,Lederman教授的经历本身,或许就是对“知行合一”的当代践行。

marsbit07/07 12:35

王阳明心学,被Anthropic用来教Claude做人了

marsbit07/07 12:35

Anthropic警告的递归AI,田渊栋新公司刚刚走出了「第一步」

近日,Anthropic发布文章披露,其代码库超过80%由AI撰写,并警告AI“递归自我改进”(即AI自主设计、训练后续版本)可能带来风险,呼吁行业建立暂停机制。与此同时,由田渊栋等人联合创立的新公司Recursive Superintelligence结束了隐身状态,发布了其首项公开技术成果——“迈向自动化AI研究的第一步”。 该系统旨在将传统AI研究中“提出想法-编写代码-运行实验-分析结果”的人工闭环自动化。它能够针对给定目标自动生成实验思路、实现代码、运行验证并从中学习,从而自主推进研究进程,并内置了防止“奖励作弊”的机制。 Recursive在三个差异显著的基准测试中取得了领先结果: 1. **小模型训练优化**:在固定计算预算下,将模型验证损失进一步降低,相当于以更少时间达到同等效果。 2. **训练速度竞速**:在社区持续优化两年的基准上,将训练时间从79.7秒缩短至77.5秒,核心改进包括在注意力层使用FP8计算、为优化器添加退火噪声等。 3. **GPU内核优化**:在英伟达的底层计算内核基准测试中,将整体得分提升至0.754,缩小了与硬件理论极限的差距,而这些优化策略并非来自团队的专业知识,而是由系统自主发现。 Recursive团队阵容强大,已获得巨额融资,其目标是构建能够递归提升自身研发能力的AI系统。这与Anthropic的警告形成了微妙对比:一方正在实践AI加速AI研发的路径,另一方则呼吁为可能到来的“递归自我改进”时刻做好风险管控准备。当前成果虽仅是迈向自动化研究的初步尝试,但标志着一个能够自我增强的AI研发新范式已开始运转。

marsbit06/12 04:11

Anthropic警告的递归AI,田渊栋新公司刚刚走出了「第一步」

marsbit06/12 04:11

突发!Anthropic呼吁全员停止AI研究

人工智能公司Anthropic在其官方博客中发布重要观点,指出其AI模型Claude已展现出显著的“自进化”能力,即递归自我提升(RSI)的早期迹象。 核心数据显示,截至2026年5月,Anthropic代码库中超过80%的代码由Claude编写,而在其代码工具发布前,这一比例仅为个位数。工程师的代码交付量达到2024年的8倍。在编程质量上,Claude处理最复杂模糊任务的成功率在半年内从26%跃升至76%,其代码质量被认为年内有望超越人类。 Anthropic提出了“AI能独立完成的任务时长”这一新衡量维度:从2024年3月的4分钟,增至2025年的1.5小时,再到2026年的至少16小时,翻倍速度已加快至每4个月一次。若趋势持续,2027年可能达到数周。 在研究层面,Claude展现强大能力:将训练小模型的代码运行速度优化了52倍,远超人类水平;在一项AI安全研究中,其将效果差距缩小了97%,而人类研究员仅缩小23%。 Anthropic认为,人类在AI开发中的角色正不断收窄,最后优势可能仅剩研究品味与方向判断。公司描绘了三种未来:能力增长停滞;AI加速但人类主导;或AI实现完全递归自我提升,自主设计下一代AI,这可能带来巨大福祉,但也存在对齐失败、最终失控的风险。 为此,Anthropic呼吁,如果存在可验证的机制确保全球AI实验室能同步暂停竞争,其愿意减速甚至暂停研发。OpenAI近期也发表了类似观点,认为自进化迹象将加剧竞争与治理挑战。这表明AI发展的“奇点”可能正在加速逼近。

marsbit06/05 00:26

突发!Anthropic呼吁全员停止AI研究

marsbit06/05 00:26

活动图片