# 研究的所有文章

在 HTX 新聞中心流覽與「研究」相關的最新資訊與深度分析。潘蓋市場趨勢、專案動態、技術進展及監管政策,提供權威的加密行業洞察。

管理近万亿估值公司,Anthropic CEO却只有一个直接下属

彭博社报道,Anthropic首席执行官达里奥·阿莫代采取了一种极为罕见的领导模式:作为一家估值近万亿美元的AI公司CEO,他只有一位直接下属——他的幕僚长。公司所有其他高管(如CFO、CCO)均向其姐姐、总裁丹妮拉·阿莫代汇报。丹妮拉负责日常运营并对董事会负责,这使得达里奥能完全专注于“远焦”事务,如战略方向、研究判断、组织文化和思考AI对人类文明的影响。 达里奥认为,CEO最大的价值在于需要大块不被打断时间进行深度思考的事务,而日常管理会切碎时间。因此,他将两者彻底分离。他大约一半时间用于文化建设,通过每两周一次的全员大会和撰写长篇备忘录来主动塑造和巩固公司文化,防止在快速扩张至2500人规模时,来自大公司的员工稀释原有文化。其余时间则用于研究方向和撰写深度文章。 哈佛商学院教授拉法埃拉·萨顿对此分析指出,管理幅度取决于公司面临问题的性质。若公司不断面对全新、高风险、无现成答案的问题(如Anthropic),CEO就需要更窄的管理幅度,将最稀缺的时间资源留给最高层的战略判断。这种姐弟分工基于两人背景的互补:达里奥是研究出身,丹妮拉则擅长运营和人事管理。值得注意的是,Anthropic全部七位联合创始人至今仍在公司,这被姐弟俩视为公司文化凝聚力的证明。

marsbit06/12 05:11

管理近万亿估值公司,Anthropic CEO却只有一个直接下属

marsbit06/12 05:11

Anthropic警告的递归AI,田渊栋新公司刚刚走出了「第一步」

近日,Anthropic发布文章披露,其代码库超过80%由AI撰写,并警告AI“递归自我改进”(即AI自主设计、训练后续版本)可能带来风险,呼吁行业建立暂停机制。与此同时,由田渊栋等人联合创立的新公司Recursive Superintelligence结束了隐身状态,发布了其首项公开技术成果——“迈向自动化AI研究的第一步”。 该系统旨在将传统AI研究中“提出想法-编写代码-运行实验-分析结果”的人工闭环自动化。它能够针对给定目标自动生成实验思路、实现代码、运行验证并从中学习,从而自主推进研究进程,并内置了防止“奖励作弊”的机制。 Recursive在三个差异显著的基准测试中取得了领先结果: 1. **小模型训练优化**:在固定计算预算下,将模型验证损失进一步降低,相当于以更少时间达到同等效果。 2. **训练速度竞速**:在社区持续优化两年的基准上,将训练时间从79.7秒缩短至77.5秒,核心改进包括在注意力层使用FP8计算、为优化器添加退火噪声等。 3. **GPU内核优化**:在英伟达的底层计算内核基准测试中,将整体得分提升至0.754,缩小了与硬件理论极限的差距,而这些优化策略并非来自团队的专业知识,而是由系统自主发现。 Recursive团队阵容强大,已获得巨额融资,其目标是构建能够递归提升自身研发能力的AI系统。这与Anthropic的警告形成了微妙对比:一方正在实践AI加速AI研发的路径,另一方则呼吁为可能到来的“递归自我改进”时刻做好风险管控准备。当前成果虽仅是迈向自动化研究的初步尝试,但标志着一个能够自我增强的AI研发新范式已开始运转。

marsbit06/12 04:11

Anthropic警告的递归AI,田渊栋新公司刚刚走出了「第一步」

marsbit06/12 04:11

刚刚,Claude Mythos 5发布,5000万行代码1天搞定

Anthropic正式发布了其最强大的大模型Claude Mythos 5,并推出了面向公众的安全版本Claude Fable 5。两者核心能力相同,但Fable 5在检测到高风险请求(如网络安全攻击、生化风险)时会自动降级使用旧模型Opus 4.8来回应,超过95%的会话不受影响。价格定为每百万输入Token 10美元,输出50美元。 技术方面,Fable 5在多项评测中表现出色:在软件工程基准SWE-bench Pro获得80.3%高分,并能在一天内完成原本需两个月的5000万行代码库迁移。其原生视觉能力可仅凭截图通关《宝可梦》游戏。在长上下文、记忆能力和金融法律等复杂分析任务上也实现显著突破。 官方透露,未完全开放的Mythos 5在生物医药领域展现出强大自主性,能独立执行生物学家工作流,其设计的蛋白质靶向复合物已有多个进入真实药物研发管线。 AI学者Ethan Mollick的测试显示,新模型的工作模式发生根本转变:人类从需要精细操控的“巫师”变为只需提出宏观需求的“甲方”,模型能自主规划并执行长达数小时的多步骤复杂项目。 此次发布也标志着前沿AI进入“权限时代”,最强能力伴随更严格的安全审查(如30天数据留存)。模型在提供强大生产力的同时,其自主性也引发了关于人类角色演变的思考。

marsbit06/10 00:23

刚刚,Claude Mythos 5发布,5000万行代码1天搞定

marsbit06/10 00:23

如何用 Claude 的 Dynamic Workflows 做深度研究

做技术调研容易陷入信息过载和结论模糊的陷阱。AI虽执行力强,但易困于当前信息且跨界联想弱。Claude近期推出的Dynamic Workflows(动态工作流)功能,旨在通过AI自动设计并执行任务流程来提升深度研究能力。 其核心是六种工作流模式:1) 路由模式:由主Agent判断任务类型并分发给最专业的子Agent处理,精准高效但处理模糊任务能力弱;2) 拆分合并模式:将任务拆分为多个独立子任务并行执行后合并结果,速度快但Token成本高,合并有挑战;3) 对抗验证模式:让多个Agent从反驳角度挑战同一结论,基于多数票通过,能有效减少确认偏误,但需基于事实而非观点;4) 生成与过滤模式:先生成大量候选方案,再用预设标准筛选出最优,能提升多样性,但过滤标准至关重要;5) 锦标赛模式:多个Agent竞争同一任务,通过两两对比逐轮淘汰选出最优,评判更稳定;6) 循环模式:通过自适应迭代不断尝试直至满足条件,擅长处理边界未知的任务,但有失控风险。 相较于作者自建的深度研究技能,官方的动态工作流增加了关键环节:问题拆解、信息可信度评估、交叉删除(投票淘汰而非简单合并)以及目标导向的输出。这有效解决了AI长任务中的目标漂移、过早停止、上下文污染和输出偏向等问题。 总之,Dynamic Workflows将研究流程本身结构化,通过多Agent的智能调度,显著提升了研究的效率和结论的可靠性,将以往可能需要十几次对话的调研压缩到3-4次,尽管Token消耗大幅增加。但它仍有局限:在验证机制上可能过于依赖官方文档而非事实数据;对于完全跨界、数据不足的深度思考支持有限;在解决方案的验证与成本权衡上仍有不足;在针对不同受众进行信息极致浓缩方面也需进一步优化。

marsbit06/09 03:07

如何用 Claude 的 Dynamic Workflows 做深度研究

marsbit06/09 03:07

活动图片