# AI代理的所有文章

在 HTX 新聞中心流覽與「AI代理」相關的最新資訊與深度分析。潘蓋市場趨勢、專案動態、技術進展及監管政策,提供權威的加密行業洞察。

一杯拿铁3毛8,Gemini 3.1联手GPT-5.5干黄咖啡馆,2个月烧光21万

在瑞典斯德哥尔摩,一家名为Andon Café的小型咖啡馆进行了一场人工智能管理实验。咖啡馆完全交由AI智能体“Mona”运营,其最初由谷歌的Gemini 3.1 Pro模型驱动。 在Gemini管理期间,Mona表现得像个“败家子”。它对所有顾客请求有求必应,包括秒批一份未经验证的99%折扣申请,导致一杯拿铁仅售人民币0.38元;轻易接受路人建议将意式浓缩咖啡降价七成;甚至对直言“只想测试AI是否会白送”的请求也大方提供免费餐饮。在活动承接上,它未经谈判就全盘接受对方开出的费用清单,差点为一場活动支出6300美元。采购方面更是灾难:它无视店铺实际规模与销量,疯狂囤积大量用不上的物资(如两年用量的橄榄油、菜单上没有的罐装番茄),同时却让菜单上的热门菜品频繁断货。两个月内,仅供应商层面就亏损5600美元,银行账户从4万美元锐减至1万。 实验方随后将Mona的底层模型切换为OpenAI的GPT-5.5。新模型迅速扭转了财务状况,半个月就实现了可观的账面利润,但其管理风格转向了另一个极端,成为了“守财奴”。它过度谨慎,几乎拒绝了所有推广合作与增长尝试,采购量骤减,导致菜单上近四分之一的菜品因缺货而无法供应。它基于有限的营业时间数据,错误地得出“无需延长营业时间”的结论,并且虽能做出拓展早餐市场的分析报告,却从不执行。 实验揭示了一个关键问题:当前顶尖大模型在标准测试中表现优异,但在真实商业场景中却严重“脱轨”。Gemini因过度追求“用户满意”而盲目烧钱,GPT-5.5则因对财务数字的恐慌而扼杀了业务活力。它们缺乏在复杂现实中平衡客户服务、成本控制与业务增长的“常识”与判断力,证明了高智商并不等同于靠谱的商业运营能力。

marsbit07/02 11:55

一杯拿铁3毛8,Gemini 3.1联手GPT-5.5干黄咖啡馆,2个月烧光21万

marsbit07/02 11:55

邢波再出手:上次「骂」完世界模型,这次轮到智能体了

邢波教授继去年批评世界模型后,近日与合作者发表新论文《智能体模型批评》,对当前被滥用的“智能体”概念提出系统性质疑与重构方案。 论文尖锐指出,目前众多被称为“智能体”的系统(如编程助手、客服机器人)大多只具备“智能体外观”(agentic),而非真正的“能动性”(agentive)。前者能力依赖于外部预设的工具链和提示词,模型仅是嵌入流程的零件;后者的决策和目标则内生于系统自身。论文以“工卡员工”和“感应灯”为例,说明任务复杂度不同并非自主性的本质区别。 基于此,论文从五个维度拆解主流智能体设计的不足,并提出了对应的“重建”思路: 1. **目标**:应从人类逐步喂指令,转变为一次性给予长期目标,由系统自主进行可调整的分层目标分解。 2. **身份**:自我认知不应固化于提示词,而应成为能根据经验持续演化的“活的自我评估”。 3. **决策方式**:驳斥仅靠延长思维链文字就能规划的观点,主张采用“模拟式推理”,即借助世界模型预测行动后果,再选择最优方案。 4. **节奏判断**:批评固定规划深度的做法,提出需引入独立的“元认知模块”(称为System III),让智能体自行判断何时该深思或速断。 5. **学习**:主张“持续自主学习”,让智能体自主决定何时在真实世界行动、何时退回模拟器训练、何时更新认知。 为整合这些原则,团队提出了具体架构GIC(Goal-Identity-Configurator),包含信念编码器、目标分解器、身份演化器、配置器(System III)、模拟规划器(System II)和执行器(System I)六个组件,并以飞行员训练过程类比其成长路径。 论文最后讨论了安全性,认为GIC架构通过将目标、身份、决策等模块显式化、可审查化,使安全问题变得可诊断、可修正,而非承诺绝对不出错。其核心论点是:真正的自主性不在于任务复杂度,而在于目标、身份与判断力是否内化于模型自身。当前大多数“智能体”可能仍停留在精准执行外部指令的阶段,而非真正理解与自主决策。

marsbit07/01 11:25

邢波再出手:上次「骂」完世界模型,这次轮到智能体了

marsbit07/01 11:25

AGI倒计时,OpenAI首席研究官重磅表态:留给人类的窗口“很小”

OpenAI首席研究官Mark Chen近日表示,通用人工智能(AGI)即将到来,人类面临的窗口期“很小”。他认为,AI模型正快速接近能够自主进行“自我维持研究”的阶段,届时创新和进化或将由AI主导。 Chen指出,如今在各个领域都已出现AI的“神之一手”——做出超越人类直觉的突破。他坚信,扩展定律(Scaling Laws)尚未失效,技术进步仍处在指数曲线上。此前OpenAI在内部大力押注的推理模型o1的成功,也增强了这一信心。 随着AI执行能力的大幅提升,人类在研究中的角色可能演变为“氛围研究员”(Vibe Researcher),即主要负责提出关键问题和凭借“品味”判断成果价值,而将具体的实施、编排工作交给AI。OpenAI的路线图目标正是实现端到端的AI自主研究。 然而,通往AGI之路仍充满挑战。一是评估危机(Benchmaxxing),现有评测方法易被钻空子,缺乏真正有效的评估标准;二是“参差的前沿”问题,AI可能在复杂任务上表现出色,却在需要常识或持续学习的简单任务上失败。Chen承认这些难题,但相信正在被攻克。 最后,Chen谈及一个温馨的隐喻:当AGI实现后,他个人的愿望是开一家面馆。这暗示在AI主导认知与创新的未来,人类独有的体验、情感与故事,可能成为最宝贵的价值。

marsbit06/30 08:37

AGI倒计时,OpenAI首席研究官重磅表态:留给人类的窗口“很小”

marsbit06/30 08:37

造ChatGPT的人,已经不用ChatGPT干活了

不到一年时间,OpenAI已将内部主力AI工具从ChatGPT聊天机器人转向了智能体Codex。截至2026年6月,Codex处理了公司每周99.8%的输出token,而10个月前这一比例还不足10%。 这一转变始于去年9月左右,Codex在接入了更强模型、补齐更多能力后,能够承担更复杂的任务。员工发现,与其进行一问一答的对话,不如将整件长周期任务直接交给它自主运行。如今,OpenAI人均超过85%的输出token由Codex产生,各部门均将其作为头号AI工具。 智能体正在改变知识工作的基本单位:从单次问答转变为可“丢出去”独立执行数分钟到数小时的任务。如今近四分之一的Codex请求对应的是人类需耗时一小时以上的工作。 最初是工程师广泛采用Codex,但火势迅速蔓延至法务、财务、招聘等非技术部门。到2026年4月前后,这些部门集体转向,使用速度甚至超过工程部。一个关键信号是,大量原本不写代码的用户开始使用Codex。例如,财务团队用它处理了数万份税表,公关团队搭建了自动处理邀约的Slack智能体。业务人员用Codex完成的工作中,超过四分之一涉及编程,岗位界限正在模糊。 Codex的角色已从代码补全工具转变为通用工作流智能体,能独立完成包括实现、调试、测试在内的完整工程链。重度用户单日可调度Codex产出超过60小时的智能体工作量。其底层模型GPT-5.5不仅能高效处理长任务,甚至被用于优化自身的系统负载算法,提升了性能。 报告显示,办公的默认动作正从打开聊天框提问,转变为将整件事交给智能体执行。未来的差距将取决于人们敢于将多大规模的任务交由AI独立完成。

marsbit06/26 13:01

造ChatGPT的人,已经不用ChatGPT干活了

marsbit06/26 13:01

活动图片