# 基准的所有文章

在 HTX 新聞中心流覽與「基准」相關的最新資訊與深度分析。潘蓋市場趨勢、專案動態、技術進展及監管政策,提供權威的加密行業洞察。

从混元到微信AI,腾讯的慢节奏走到交付关口

2026年6月8日,微信AI进入内测阶段,用户可通过自然语言对话直接调用和操作微信小程序。开放平台提供“自动模式”和“开发模式”两种接入方式。自动模式允许平台读取小程序源码,实现零开发成本接入,旨在吸引微信生态内数十万中小开发者;开发模式则允许服务商自定义技能。此举标志着腾讯AI从技术储备、独立产品验证走向在超级应用内的场景交付。 微信AI的底层能力依赖于腾讯自研的混元大模型。该模型在中文大模型评测中基础能力排名国内第二,但在应用与Agent能力上领先。腾讯坚持季度级稳健迭代,而非追逐高频发布,旨在为微信AI所需的稳定、可靠的操作型任务提供支撑。 此前,腾讯的独立AI应用“元宝”在2026年春节凭借红包活动实现日活峰值超5000万、月活破亿,但节后数据回落,常态日活约900万。这验证了微信社交链的拉新能力,也凸显了独立App在留存上的挑战。因此,微信选择将AI原生集成至应用内,通过绑定实际使用场景来提升用户黏性。 微信AI的目标是实现小程序的“龙虾化”(即智能体化),使其能自主执行跨应用任务。但这引发了生态平衡的核心矛盾:高效的中心化AI调度可能削弱服务商的页面流量、品牌曝光与用户沉淀。腾讯管理层承认需兼顾“中心化调度与去中心化流量保护”,具体规则尚未公布。 目前,腾讯AI已形成混元(底座)、元宝(C端验证)、微信AI(场景交付)三条并进的路径。微信AI内测是整合与交付的关键一步,但其成功取决于三个变量:开发者对源码授权的信任、生态流量的合理分配以及AI操作的准确性与责任界定。腾讯的AI战略是一场马拉松,内测仅是中途标记,最终体验与市场接受度仍需时间验证。

marsbit06/08 10:23

从混元到微信AI,腾讯的慢节奏走到交付关口

marsbit06/08 10:23

自动化的悖论:AI越强,人类越忙

本文探讨了AI自动化发展中的一个核心悖论:尽管AI能力快速提升,但人类的工作量并未减少,反而可能增加。文章以作者所在公司Every为例,说明AI工具已深度嵌入编码、写作、客服等流程,但并未导致裁员,而是重组了工作形态。人类从重复执行者转变为框架设计者、系统维护者和质量判断者。 AI擅长将过去已沉淀的能力(如代码、文案、客服回复)商品化,使其变得廉价且人人可用。这导致市场出现大量同质化的“默认输出”。然而,真正稀缺的是面对具体当下问题时的判断力、差异化创造和意义定义能力。因此,自动化并未消灭专家,反而创造了更多需要专家介入的场景,例如工程师需要审查AI生成的代码,编辑需要打磨AI起草的文稿。 文章进一步指出,基准测试(如高级工程师编码测试)衡量的只是模型在特定人类设定的“框架”内的表现。模型可以快速攻克一个框架,但人类会不断将问题推进到更复杂的新框架中。AI可以高效执行目标,但缺乏真正的主体性——它回应人类设定的问题,而非自主产生目标。知识工作的未来在于人类持续扮演“框定者”的角色。 因此,AI让“执行”变便宜,却让“判断什么值得做、为何做、做到何种程度”变得更为珍贵。自动化没有消除人类工作的价值,而是使其变得更前沿、更依赖人类的独特判断。

marsbit05/24 07:06

自动化的悖论:AI越强,人类越忙

marsbit05/24 07:06

Gemini 3.5来了!今夜,谷歌亲手淘汰谷歌

在谷歌I/O 2026大会上,谷歌发布了多项重磅AI进展。核心产品包括全新的全能多模态模型“Gemini Omni”,它可以接收任意形式的输入(如图片、音频、视频、文字)并生成高质量视频,且能通过聊天方式进行实时编辑,其生成内容在物理逻辑和场景连贯性上表现突出。 同时,谷歌推出了新一代旗舰模型“Gemini 3.5 Flash”。该模型在编码、智能体任务等多项基准测试中,性能全面超越了前代旗舰Gemini 3.1 Pro,输出速度极快,并对标甚至超越了竞争对手的同类模型。与之配套的“Antigravity 2.0”代理开发平台也升级为独立桌面应用,现场演示了由93个子代理在12小时内从零编写出一个功能完整的操作系统内核。 此外,谷歌发布了个人AI代理“Gemini Spark”。它由Gemini 3.5驱动,深度集成谷歌办公套件,能够7×24小时在云端运行,根据用户指令自动跨应用(如Gmail、Docs、Sheets)处理复杂任务,如汇总信息、起草邮件、规划活动等。 其他重要发布还包括:Gemini App改版并改为算力计费、AI Ultra订阅计划调整以及谷歌搜索25年来最大升级(接入Gemini 3.5 Flash)。 整场大会展示了谷歌在实现全模态理解与生成、以及全天候自主智能代理方面的重大突破,标志着AI技术正朝着更强大、更自主的方向加速演进。

链捕手05/20 06:54

Gemini 3.5来了!今夜,谷歌亲手淘汰谷歌

链捕手05/20 06:54

Auto Research时代,47个没有标准答案的任务成了Agent能力必测榜

AI Agent的能力正面临新的考验。近期,Einsia AI旗下Navers lab发布了名为Frontier-Eng Bench的Agent评测基准,它包含了47个多学科交叉、没有标准答案的真实工程任务,旨在评估AI在闭环反馈中持续优化和解决复杂问题的能力。 与以往AI在固定知识库中寻找答案的模式不同,这套基准要求AI扮演“工程师”角色:提出方案、接入仿真器、根据报错反馈调整参数、重新运行并持续迭代。任务涵盖水下机器人控制、动力电池快充优化、量子线路噪声抑制等硬核领域,AI需要在功耗、安全、性能等多重约束下寻找最优解。 评测结果显示,当前AI(如GPT-5.4)虽能表现出一定的优化能力,但距离完全解决这些工程问题仍有很长的路要走。研究还总结出两条关键规律:一是优化过程遵循幂律衰减,后期性能提升越来越难;二是在有限预算下,探索的深度比宽度更为重要,持续的深度迭代比简单的并行试错更能带来突破。 这项工作的深远意义在于,它标志着AI开始从“答题者”向能够在真实反馈循环中“自我进化”的系统转变。它预示着一个“Auto Research”时代的可能:未来,人类研究者提出目标和方向,AI则不知疲倦地负责执行仿真、实验和优化迭代,从而极大加速科研与工程进程。 论文及相关资源已公开。

marsbit05/13 07:05

Auto Research时代,47个没有标准答案的任务成了Agent能力必测榜

marsbit05/13 07:05

活动图片