# 执行框架的所有文章

在 HTX 新聞中心流覽與「执行框架」相關的最新資訊與深度分析。潘蓋市場趨勢、專案動態、技術進展及監管政策,提供權威的加密行業洞察。

Anthropic全球警告,OpenAI已跨“可靠性阈值”:AI自我加速启动

AI领域出现重要警告与发展洞察。Anthropic发出全球警告,指出AI递归自我改进进程加速,已接近“自己造自己”的临界点,呼吁减缓研究。 与此同时,OpenAI后训练团队负责人Yann Dubois在访谈中揭示了关键内部视角: 1. **能力提升是连续线性,但实用性感知是跳跃的**。AI能力在达到“可靠性阈值”前如同玩具,跨越后则成为可托付工作的可靠工具。OpenAI被认为在去年12月左右跨过了此阈值。 2. **AI正进入自我加速循环**。模型能力提升后,本身已成为研发的有力工具(如辅助编程),从而加速下一代模型的开发,形成越转越快的正反馈回路。 3. **AI构建更像“手艺”而非纯科学**。在硬核领域,经验、直觉和反复试错(类似“炼金术”)目前扮演关键角色,科学解释常事后补足。 4. **垂直应用(Harness)价值巨大,甚至能触及AGI体验**。Dubois认为,若冻结现有模型,仅通过精心打磨针对特定领域的编排系统,即可在许多场景中实现类似通用人工智能(AGI)的效果。当前瓶颈常在于“最后一公里”——权限、数据连接与业务流程集成,而非模型智能本身。 5. **持续学习仍是核心挑战**。模型难以像人类一样在特定环境中持续学习和优化,其学习曲线容易趋于平缓,这是亟待解决的重要问题。 综上,AI发展已迈过关键可靠性门槛,进入自我加速阶段,同时为垂直领域的深度应用与集成创造了巨大机遇与挑战。

marsbit06/06 23:24

Anthropic全球警告,OpenAI已跨“可靠性阈值”:AI自我加速启动

marsbit06/06 23:24

知情人士:DeepSeek正在组建Harness团队,对标Claude Code

知情人士透露,DeepSeek正在内部组建一个名为“Harness”的团队,旨在开发代码智能体产品,直接对标Anthropic旗下的Claude Code。DeepSeek资深研究员陈德里在社交媒体证实了这一动向,并表示团队目标即“做DeepSeek Code Harness”。 此次招聘开放了Harness产品经理和研发工程师两个关键岗位。招聘信息揭示了一个核心公式:模型(Model) + 约束与控制层(Harness) = 智能体(Agent)。这表明DeepSeek的战略重点正从单纯的模型能力竞争,转向构建连接模型与真实工作流的“中间层”。DeepSeek认为,模型之外的上下文管理、工具调用、任务规划、代码修改、终端执行等能力,才是智能体融入开发者工作流的关键。 文章分析,DeepSeek此举并非简单打造代码助手插件,而是要“补齐模型通向真实工作流的中间层”,为强大的代码模型“装上双手”。过去,虽然DeepSeek的代码模型能力突出,但尚未形成高频使用的产品化工作流。Claude Code的成功证明,AI编程的竞争已转向争夺开发者工作流入口。 此前,一个名为DeepSeek-TUI的开源终端智能体项目在社区走红,它展示了开发者对DeepSeek版Claude Code的强烈需求,但也凸显了官方产品的缺失。官方Harness团队的优势在于能与模型团队深度协作,实现“模型与Harness的共同进化”,并将真实任务反馈系统性地注入模型迭代,形成数据闭环。 此举标志着DeepSeek在模型能力之外,开始全力构建其智能体产品的关键组成部分,正式进入以工作流为核心的“智能体战争”新阶段。

链捕手05/22 02:14

知情人士:DeepSeek正在组建Harness团队,对标Claude Code

链捕手05/22 02:14

YC眼中的五种AI Agent核心形态

本文总结了AI Agent发展中的五种核心架构形态,这些形态正从一次性提示应用转向可复用、可积累的工作流系统。 1. **Skills(技能)**:将标准作业流程抽象为可参数化的“方法调用”。同一套流程通过更换参数可处理一类问题,而非单一具体任务。 2. **Thin Harness(轻量执行框架)**:作为模型的“手脚”,负责任务循环、文件管理等基础执行功能。其设计应保持轻量,避免因功能过度堆积导致“上下文腐化”。 3. **Resolvers(解析器/路由)**:通过明确的路由规则,将任务类型映射到对应Skill,解决因技能过多而导致的模型调用混乱问题,确保输出稳定。 4. **Latent vs. Deterministic(潜在与确定性)**:需明确分工。LLM擅长判断、综合等非确定性任务;而算术、优化等需稳定输出的工作,则应交给确定性代码处理。 5. **Memory(记忆)**:系统积累知识的基础。可采用Markdown文件夹等形式,记录“当前可信结论”和只增不减的时间线,使经验得以沉淀并可被自动关联与更新。 这些模块共同构成了一种“流程能力”,将经验转化为结构化、参数化的工作流。相比容易被复制的一次性应用,这种深度集成的系统更难被模仿,有望成为个人或组织在AI时代构建长期竞争优势的基础。其本质是将服务产品化,通过编码流程、分离关注点与持续积累记忆,实现更高效、更优质且更具壁垒的产出。

marsbit05/20 07:46

YC眼中的五种AI Agent核心形态

marsbit05/20 07:46

Agent已进入Harness驱动时代

近日,Anthropic公司意外泄露了其AI编程工具Claude Code的源代码,总量超过51.2万行。虽然未包含颠覆性算法,但完整展示了其Agent工程实践的核心架构——Harness系统。Harness可理解为驱动模型的整套工程架构,其核心作用在于最大化模型能力,而不仅是输出文本。 Claude Code的Harness系统包含六大核心组件:多层级系统提示(System Prompt)、工具规范(Tool Schema)、工具调用循环(Tool Call Loop)、上下文管理器(Context Manager)、子智能体(Sub Agent)和验证钩子(Verification Hooks)。这些组件共同实现了模型行为的精准控制、工具调用与执行的一体化、上下文高效管理、多智能体协同及结果客观验证。 Harness架构将训练与推理环境深度融合,推动后训练(Post-training)朝六大方向发展:系统提示驱动行为对齐、长链路工具调用端到端训练、规划与执行一体化训练、记忆压缩专项训练、子智能体协同编排训练,以及多目标联合强化学习。 这一转变意味着行业需求正从纯模型能力转向工程架构与系统整合。复合型人才(兼具AI、工程与架构能力)将更受青睐,而“模型外壳公司”生存空间收窄,必须依靠顶尖基础设施或垂直领域壁垒。Agent落地更强调私有化、高安全与端到端一体化,企业应优先复用成熟Harness设计,结合场景做定制,以实现真正规模化应用。

marsbit04/15 10:10

Agent已进入Harness驱动时代

marsbit04/15 10:10

活动图片