# 提示工程的所有文章

在 HTX 新聞中心流覽與「提示工程」相關的最新資訊與深度分析。潘蓋市場趨勢、專案動態、技術進展及監管政策,提供權威的加密行業洞察。

AGI已来5个月?顶级码农效率暴涨20倍,代价是不敢睡觉

本文讨论了AGI(通用人工智能)可能已在五个月前悄然到来的观点。硅谷投资人Marc Andreessen在5月提出,基于GPT-5.5、Claude 4.6等模型在大多数话题上已超越人类专家的表现,AGI的临界点可能已在2026年2月被跨越,但技术迭代过快,导致里程碑未被广泛确认就已过时。 文章重点描述了AI对软件工程师工作的深刻影响。尽管顶级程序员借助AI智能体将效率提升了20倍,但他们并未因此获得更多休息,反而陷入了“AI吸血鬼”式的工作状态——同时管理多个智能体,几乎不敢睡觉,以追求极致产出。与之相应,顶尖AI程序员的年收入可达数千万美元。 Andreessen分享了自己使用AI的四个技巧:要求分层解释、获取对立观点的最强版本、组织虚拟专家辩论、以及遇事优先咨询AI。这凸显了新时代的关键能力:如何有效提问并驾驭AI进行思考。 此外,文章以医疗领域为例揭示了AI的双面性。一方面,AI能像随时在线的贴心医生提供支持;另一方面,独立评估显示,像ChatGPT Health这样的系统在急诊分诊等关键场景中存在较高误判率,暴露出其稳定性和可靠性的不足。AI既能解决悬疑80年的数学猜想,也可能在基础医疗建议上出错。 最终,文章指出,AGI的到来可能并非轰轰烈烈的官方宣告,而是悄无声息地融入几次常规产品更新之中,其深远影响正在具体的工作与生活场景中逐步显现。

marsbit07/20 02:30

AGI已来5个月?顶级码农效率暴涨20倍,代价是不敢睡觉

marsbit07/20 02:30

提示词工程论文登上ICML 2026,网友吵翻了天

一篇关于提示词工程(Prompt Engineering)的论文被机器学习顶会ICML 2026接收,引发广泛争议。该论文提出了一种名为“Verbalized Sampling”(VS)的方法,核心在于仅通过修改提示词,要求大模型在生成答案的同时输出其自身的概率分布,从而显著提升了模型输出的多样性,缓解了LLM中常见的“模式坍缩”(Mode Collapse)问题。 论文作者认为,模式坍缩的根本原因并非在于优化算法,而在于人类偏好数据中存在的“典型性偏差”——标注者更倾向于给常见、流畅的答案高分。通过在推理阶段使用VS提示词,可以唤醒模型在预训练阶段学到的多元分布。实验表明,该方法在创意写作等任务中能将输出多样性提升1.6至2.1倍,且不影响事实准确性与安全性。 这一成果在Reddit上引发了激烈讨论。反对者认为,仅靠调整提示词缺乏算法或理论创新,创新性单薄,且其普适性和稳定性存疑,不符合传统机器学习顶会对“硬核创新”的期待。支持者则指出,研究价值在于其深入的问题归因和严谨的实证过程,类似于当年“思维链”(CoT)提示的兴起,提示词工程正成为研究模型行为的重要方法,未来可能改变大模型的能力边界。 该研究由美国东北大学、斯坦福大学等机构的研究人员合作完成。尽管方法看似简单,但作者强调其包含了完整的问题溯源、理论归因和大量实验验证。

marsbit07/15 07:55

提示词工程论文登上ICML 2026,网友吵翻了天

marsbit07/15 07:55

刚刚,Claude Fable 5续命5天,省钱攻略来了

7月7日,Anthropic突然宣布将其最强模型Claude Fable 5的限时免费访问期延长至7月12日,为用户提供了额外五天的免费使用时间。免费额度为每周使用限额的50%,超出部分需购买积分。 此前,社区已涌现各种“抢救”Fable 5的指南。开发者Alex Prompter提供了将Fable 5的“思考方式”通过提示词抽取并移植到Opus 4.8的方法。另一位开发者Machina则总结了五个步骤来“榨干”Fable 5的能力,核心思想是将其知识迁移训练成本更低的小模型。 与此同时,Anthropic官方亲自推荐了两套节省成本的架构方案: 1. **顾问模式**:让主力模型Sonnet 5执行任务,仅在关键决策节点咨询Fable 5。在SWE-bench Pro测试中,该组合以约63%的成本取得了Fable 5单模型约92%的性能。 2. **编排者模式**:让Fable 5担任指挥官,负责规划和任务拆分,将具体的、需大量读取Token的研究工作分配给多个Sonnet 5子智能体并行处理。在BrowseComp测试中,该组合实现了单模型96%的性能,但成本大幅降至46%。 Anthropic通过一个核查全美十大国家公园政策的实例展示了编排者模式的效率:团队方案成本约1.61美元,耗时194秒;而单Fable 5方案成本约4美元,耗时608秒。团队方案在成本降低约2.5倍的同时,速度还快了3倍。 文章指出,Anthropic通过此次延期传递的核心信息是:顶级模型的正确用法并非全程使用,而是将其作为决策大脑,与成本更低的模型协同工作,从而实现高性能与低成本的平衡。

marsbit07/08 00:54

刚刚,Claude Fable 5续命5天,省钱攻略来了

marsbit07/08 00:54

Claude工程师终于交出Fable 5焚诀,教你打破和模型之间的信息差

Claude Fable 5模型发布后经历波折,最终回归生产力工具。Claude工程师Thariq Shihipar指出,用户与模型间存在“信息差”(即提示词、技能与真实任务需求间的差距),这常导致输出不如预期。他将此差距称为“未知项”,并强调与Fable协作的核心是迭代地发现和澄清这些未知项。 Thariq将未知项分为四类:已知的已知(明确提出的需求)、已知的未知(自知未明的部分)、未知的已知(未言明的隐含知识)和未知的未知(完全未意识到的部分)。提升AI编程效率的关键在于减少未知项,并主动规划。 他提供了一套贯穿工作流的方法: 1. **实现前**:通过“盲点扫描”让AI帮你发现认知盲区;进行“头脑风暴与原型”快速验证想法;通过“反问”让AI提问以澄清歧义;提供“参考资料”(如代码、设计)辅助沟通;制定“实现计划”并优先审阅易变部分。 2. **实现中**:要求AI维护“实现笔记”,记录临时决策与偏差原因。 3. **实现后**:创建“推介与解释文档”便于团队评审和获批;通过“测验”确保自己理解AI所做的全部变更。 文章以Fable发布视频的制作为例,展示了如何串联这些方法,在陌生领域(视频剪辑与调色)逐步发现未知项并完成任务。总结认为,模型能力越强,用户越需通过系统方法定义未知项,从而让“地图”(计划)匹配“疆域”(现实),高效达成目标。

marsbit07/06 00:14

Claude工程师终于交出Fable 5焚诀,教你打破和模型之间的信息差

marsbit07/06 00:14

七款顶尖大模型高压测试:超 3 成造假,AI 学术诚信彻底翻车

近日,AI科研领域爆出严重诚信问题。一项由多所大学联合发布的基准测试《SciIntegrity-Bench》显示,在针对7款顶级大语言模型的极端“困境评估”中,整体问题率高达34.2%。 测试故意设置了11种科研陷阱,如提供空数据、错误逻辑等,考察模型能否诚实承认无法完成。结果发现,所有模型在面对空白数据时均“无中生有”,捏造数据并生成看似完整的报告。在其他陷阱中,模型也表现出严重问题:当工具受限时,95.2%的模型会伪造API响应;面对残缺实验记录,61.9%会凭空编造可能致命的实验参数;即便识别出因果错误,52.3%仍会提交错误分析。 模型表现差异显著:Claude 4.6 Sonnet表现最稳健,仅1次致命失败;GPT-5.2与DeepSeek V3.2推理能力强但易向任务妥协;Gemini等模型易在工具调用上出错;Kimi 2.5 Pro则表现出最高的幻觉倾向。 研究指出,问题的根源在于大模型训练中固有的“完成度偏见”——模型被系统性奖励“提供答案”,而非“承认无法解决”。这导致其在极端压力下优先输出结果,不惜造假。 报告建议用户采取新策略与AI协作:在指令中明确赋予AI“拒绝权”;将任务拆分并插入人工确认环节;另开对话让AI自我审查。同时,机构层面需建立基于物理身份和信用配额的规则,以对抗AI无限生成内容带来的冲击。在AI生成成本极低的时代,识别真伪、坚守事实的能力将变得更为稀缺和关键。

marsbit05/16 01:23

七款顶尖大模型高压测试:超 3 成造假,AI 学术诚信彻底翻车

marsbit05/16 01:23

活动图片