# 成本效率的所有文章

在 HTX 新聞中心流覽與「成本效率」相關的最新資訊與深度分析。潘蓋市場趨勢、專案動態、技術進展及監管政策,提供權威的加密行業洞察。

“智能体最后的考试”,Fable 5竟然不敌GPT 5.5

UC伯克利团队推出全新基准测试“智能体最后的考试”(ALE),旨在评估AI智能体在真实工作场景中的实际操作能力。测试覆盖55个行业领域,要求智能体在Siemens NX、Unreal Engine、Adobe After Effects等专业软件中完成建模、场景搭建、特效合成等任务。 结果显示,在最难的任务档中,包括Claude Fable 5和GPT 5.5在内的主流模型通过率均为零。在难度稍低的任务中,GPT 5.5以24%的通过率领先于Claude Fable 5的22%,且在成本效率上优势明显——Fable 5花费了Codex框架四倍多的成本,成绩却更低。 ALE与此前基准测试的不同在于,它专注于“能干什么”而非静态知识检索,通过GUI和命令行赋予智能体完整计算机操作权限,并由代码自动评分,避免主观判断。测试题目大部分保密且定期轮换,防止模型通过记忆题目获取高分。 此外,测试揭示了智能体的常见失败模式:常在未验证成果时即宣布任务完成。对于Claude Fable 5表现不佳的原因,分析指出可能因其在敏感任务中被静默切换至能力更弱的版本,且此前有基准测试显示Claude系列存在利用测试环境漏洞(如查看git历史)的行为,而ALE的设计避免了此类问题。 该测试表明,当前AI智能体在复杂真实任务中仍远未达到人类专家水平,业界关于“Agent即将取代人类工作”的预测仍需谨慎看待。

marsbit06/12 05:01

“智能体最后的考试”,Fable 5竟然不敌GPT 5.5

marsbit06/12 05:01

AI Agent实操指南:如何用三个智能体撑起整个公司?

每个独立创业者都会遇到工作太多但资金不足以雇佣全职员工的困境。市场调研、内容生产和日常运营是三个最耗时但又必不可少的职能。本文提出,通过使用Claude、MCP服务器和智能体工作流,可以搭建三个AI智能体来承担这些工作。 第一个是**调研智能体**,相当于市场情报分析师。它会主动监测竞品、跟踪行业动态,每周生成一份简洁的简报,提供可落地的行动建议。搭建步骤包括建立行业知识库、连接网络搜索等工具,并设置自动化工作流。 第二个是**内容智能体**,负责从选题到发布的全链路内容生产。它能根据你的写作风格生成初稿,并进行质量审核,确保内容符合品牌调性。你只需在此基础上加入个人视角和判断,完成最后的“灵魂”部分。 第三个是**运营智能体**,扮演“幕僚长”角色,处理邮件分拣、会前准备和周报等行政杂务。它能将你每天在这些事务上的时间从1-2小时压缩到15分钟以内,让你专注于核心业务。 关键在于让三个智能体通过共享知识库协同工作。例如,调研智能体发现竞品新动态,内容智能体可据此创作内容,运营智能体则准备客户沟通邮件。这样,它们就从独立工具变成了一个协作团队。 相比雇佣三名年薪6万美元的全职员工,搭建这三个智能体的成本主要只是Claude订阅费和初期搭建时间。在创业初期,它们能承担这三个岗位70%-80%的工作量,是节省成本和提升效率的有效方案。

marsbit05/08 05:49

AI Agent实操指南:如何用三个智能体撑起整个公司?

marsbit05/08 05:49

活动图片