# 代理的所有文章

在 HTX 新闻中心浏览与「代理」相关的最新资讯与深度分析。潘盖市场趋势、项目动态、技术进展及监管政策,提供权威的加密行业洞察。

谷歌风雨飘摇,市值蒸发数千亿美元,Gemini Spark能救场吗?

最近,谷歌陷入内忧外患,核心人才接连流失:Transformer架构师Noam Shazeer、AlphaFold主导者John Jumper,以及Gemini预训练和编程核心贡献者Jonas Adler、Alexander Pritzel相继离职,分别投身OpenAI和Anthropic。资本市场迅速反应,Alphabet股价两天内下跌5%-6%,市值蒸发数千亿美元,反映出市场对谷歌能否留住顶尖人才的深层担忧。 与此同时,谷歌产品节奏也面临挑战,备受期待的Gemini 3.5 Pro再次推迟发布。在此背景下,谷歌推出了新的AI产品Gemini Spark。与普通聊天机器人不同,Spark作为云端持续运行的智能体,能深度集成Gmail、日历、文档等谷歌Workspace套件,根据用户设定的目标自动分解任务、跨应用执行工作流,并能通过协议连接外部服务。其目标是为用户提供一个“永不停机的数字员工”。然而,其目前仅面向每月100美元的Google AI Ultra用户开放,高价策略引发争议。 分析认为,谷歌手握最完善的生产力工具生态,本应是开发“AI劳动力”或智能体的天然赢家,但因大公司的谨慎和对风险的规避,反而在Agent竞赛中落后于OpenAI、Anthropic及众多创业公司。Spark的推出标志着谷歌终于放手让AI深入生产力环节,但能否借此挽回颓势、弥补人才流失的损失,并支撑其下一个十年,仍是巨大疑问。

marsbit07/01 10:18

谷歌风雨飘摇,市值蒸发数千亿美元,Gemini Spark能救场吗?

marsbit07/01 10:18

刚刚,Anthropic发布Sonnet 5,性能接近Opus 4.8,但不一定更便宜

Anthropic 正式发布了 Claude Sonnet 5 模型,称其为迄今为止最具 Agent 属性的 Sonnet 模型,能够在制定计划、使用工具(如浏览器、终端)方面自主运行,其能力水平接近数月前需要更大、更昂贵模型(如 Opus 4.8)才能达到的程度。 相比前代 Sonnet 4.6,Sonnet 5 在推理、工具使用、编程和知识工作等关键维度性能有显著提升。在智能体搜索和计算机使用评测中,其性能曲线表明,在中等努力程度下成本效率显著提升,在更高努力程度下某些任务性能可媲美 Opus 4.8。用户可根据任务需求灵活调整“努力程度”以平衡成本与性能。 安全评估显示,Sonnet 5 在拒绝恶意请求、抵御提示注入攻击、降低幻觉和谄媚行为率方面整体优于 Sonnet 4.6,但失当行为率仍略高于 Opus 4.8 和 Mythos Preview。该模型未针对网络安全任务专门训练,其开发软件漏洞等危险网络能力显著弱于 Opus 4.8,因此 Anthropic 为其默认启用了网络安全护栏。 定价方面,即日起至2026年8月31日提供尝鲜价:输入每百万token 2美元,输出每百万token 10美元。之后恢复为标准定价:输入3美元,输出15美元。Anthropic 同步上调了各平台的速率限制以适应更高“努力程度”模式。需注意,Sonnet 5 采用了新tokenizer,相同内容映射的token数量约为以前的1.0-1.35倍,尝鲜价旨在使过渡期整体使用成本大致持平。 开发者上手反馈称其速度很快且针对Agent优化,在浏览器使用场景下抵御提示注入攻击的能力(成功率仅0.93%)显著优于Opus 4.8(31.5%)和Sonnet 4.6(50.7%)。但也有分析指出,由于token使用量增加,其每项任务运行成本约为2.29美元,比Sonnet 4.6高约2倍,也比Opus 4.8高出约15%,成为运行成本最高的模型之一。

marsbit07/01 00:35

刚刚,Anthropic发布Sonnet 5,性能接近Opus 4.8,但不一定更便宜

marsbit07/01 00:35

Claude Code官宣下一版大升级,你在聊天,后台把活干完了

Claude Code 即将推出重大升级,未来版本将默认让子智能体在后台运行。这意味着用户在与 Claude 聊天讨论时,后台的子智能体可以同步执行如代码重构、测试、提交拉取请求等任务,真正实现“边聊边干活”。用户只需在对话结束后查看结果,并可随时将特定智能体切换到前台。 这一改进标志着 Claude Code 正从传统的问答式工具演变为能并行管理多条任务线的工作流引擎。其设计哲学是“不是聊天,是基建”。此前,Anthropic 已陆续推出了定时任务(Routines)和动态工作流(Dynamic workflows)功能,允许将复杂任务编排成脚本,调度大量子智能体协作完成。此次更新是将这些能力打包为开箱即用的默认行为。 实际影响显著。据报道,Claude Code 已将 Anthropic 内部工程师的有效产出提升至实际人数的三倍,导致公司更需要能决定“写什么代码”的产品思考者,而非单纯写代码的工程师。Spotify 的案例更具说服力:其超过2000万行的代码库中,73%的拉取请求由 AI 辅助完成,部署频率提升75%以上。工程副总裁可同时管理多个后台智能体并行工作,非工程师也能通过自然语言描述来生成端到端原型。 核心转变在于,当后台智能体成为标配,工程师的核心价值将从“编写代码”转向“决策与判断”——即思考下一步做什么,并评估结果是否正确。这预示着 AI 编程工具正进入一个以工作流自动化和智能协作为特征的新量级。

marsbit06/30 09:33

Claude Code官宣下一版大升级,你在聊天,后台把活干完了

marsbit06/30 09:33

老黄:Prompt已死,整个AI圈都在疯狂追Loop

近期,硅谷AI圈掀起“Loop Engineering”(循环工程)热潮,业界普遍认为传统手动编写提示词(Prompt)的模式即将被淘汰。英伟达CEO黄仁勋、吴恩达、Anthropic及OpenAI等多位专家和机构均指出,未来核心不再是设计单次指令,而是构建能够自主运行、迭代的AI循环系统。 循环工程的核心在于将人类从实时干预中解放出来,转变为系统架构师。人类只需一次性定义目标、停止条件、验证机制、记忆存储及调度规则,随后AI系统便可自动执行“发现任务→执行→验证→持久化→再发现”的闭环流程,实现24/7不间断工作。其中,独立的验证环节尤为关键,需设立专门的评估智能体对输出进行客观审查,避免自我美化。 这一转变意味着代码生成成本大幅降低,而人类的判断力成为关键稀缺资源。然而,全自动循环也可能带来验证债务、代码理解脱节、认知依赖及token消耗失控等风险。因此,成功的循环设计需融入严谨的判断与监督,否则可能放大错误或导致技术债务。 目前,相关实践指南和白皮书已在网络广泛传播,标志着AI开发正从“提示工程”迈向“循环工程”的新范式。尽管自动化能力增强,但工程师的核心角色并未消失,而是升级为循环系统的设计者与决策者,确保AI在正确方向上高效运行。

marsbit06/29 08:37

老黄:Prompt已死,整个AI圈都在疯狂追Loop

marsbit06/29 08:37

活动图片