# 代理的所有文章

在 HTX 新聞中心流覽與「代理」相關的最新資訊與深度分析。潘蓋市場趨勢、專案動態、技術進展及監管政策,提供權威的加密行業洞察。

年入1亿美元,两个90后伯克利室友,搞出最赚钱的AI生意

一家不造AI的公司,年收入却高达1亿美元。这家公司名为Arena,前身是加州大学伯克利分校团队在2023年发起的开源研究项目Chatbot Arena。它核心的产品是一个通过用户真实盲测生成的大模型排行榜:用户输入提示词,系统随机分配两个匿名模型作答,由用户投票选择更优者。凭借海量真实数据,该榜单已成为业界公认的权威评测平台,吸引了OpenAI、谷歌、Anthropic等顶级厂商在此“打擂台”。 其商业模式在于“卖水”:为模型厂商和企业提供付费的深度评测服务,利用其庞大的用户社区对模型进行真实世界性能分析。这种服务切中了模型厂商激烈竞争、亟需优化调优的痛点。 公司由两位伯克利室友创立。CEO Anastasios Angelopoulos师从多位学术大牛,专注于对黑箱模型进行数学严谨的评估;CTO Wei-Lin Chiang是知名开源聊天机器人Vicuna的创造者。项目发展迅速,在商业化仅8个月后年化营收便达到1亿美元,并已完成高额融资,估值达17亿美元。 目前,Arena已将评测范围从简单的对话能力,扩展到智能体模式下的复杂长任务(如写代码、研究分析),用任务完成率、幻觉率等更客观的指标进行评估。在AI向智能体演进的时代,中立、可靠的评测变得愈发关键和昂贵,这正是Arena巨大价值的根基。

marsbit07/06 00:20

年入1亿美元,两个90后伯克利室友,搞出最赚钱的AI生意

marsbit07/06 00:20

狂揽2.4万星标:一行命令,AI会自己找技能了

过去,AI开发者交换的是提示词模板;如今,风向转变为互相推荐可安装的“技能”(skill)。Vercel推出的Skills项目,正致力于成为AI智能体的“npm”包管理器。通过一行命令(如 `npx skills add <package>`),开发者可以为Claude Code、Cursor等多种AI工具快速安装能力包,涵盖代码规范、设计准则等,实现能力的即装即用和跨工具共享。 该项目上线五个月便在GitHub获得2.4万星标,并配套上线了技能目录网站skills.sh,设有安装量排行榜。其中,“find-skills”技能尤为突出,安装量超230万次,它能让AI根据用户需求自动搜索、筛选并安装合适的技能,相当于为AI提供了“能力搜索引擎”。 这标志着AI编程正从“提示词工程”迈向“能力工程”,将零散经验封装为可复用、可版本管理的模块。Vercel此举意在复制其通过Next.js卡位前端生态的成功经验,在AI智能体工具层建立新入口。 然而,热潮背后存在安全隐患。安全审计发现,技能包中约有13.4%存在严重安全缺陷,可能携带恶意脚本、进行提示词注入或窃取密钥。与传统的npm包不同,技能包融合了提示词、代码和执行权限,风险直接触及本地系统和敏感数据。因此,用户需要像对待代码一样谨慎选择技能,仔细审查来源和所需权限。 Vercel创始人Guillermo Rauch的长期目标,正是将复杂工程简化为“一行命令”的极致体验。从Now、Next.js到如今的Skills,这一理念正被应用于AI领域,在带来便利的同时,也要求开发者带着判断力进场,共同迎接AI能力“npm化”的机遇与挑战。

marsbit07/06 00:19

狂揽2.4万星标:一行命令,AI会自己找技能了

marsbit07/06 00:19

谷歌风雨飘摇,市值蒸发数千亿美元,Gemini Spark能救场吗?

最近,谷歌陷入内忧外患,核心人才接连流失:Transformer架构师Noam Shazeer、AlphaFold主导者John Jumper,以及Gemini预训练和编程核心贡献者Jonas Adler、Alexander Pritzel相继离职,分别投身OpenAI和Anthropic。资本市场迅速反应,Alphabet股价两天内下跌5%-6%,市值蒸发数千亿美元,反映出市场对谷歌能否留住顶尖人才的深层担忧。 与此同时,谷歌产品节奏也面临挑战,备受期待的Gemini 3.5 Pro再次推迟发布。在此背景下,谷歌推出了新的AI产品Gemini Spark。与普通聊天机器人不同,Spark作为云端持续运行的智能体,能深度集成Gmail、日历、文档等谷歌Workspace套件,根据用户设定的目标自动分解任务、跨应用执行工作流,并能通过协议连接外部服务。其目标是为用户提供一个“永不停机的数字员工”。然而,其目前仅面向每月100美元的Google AI Ultra用户开放,高价策略引发争议。 分析认为,谷歌手握最完善的生产力工具生态,本应是开发“AI劳动力”或智能体的天然赢家,但因大公司的谨慎和对风险的规避,反而在Agent竞赛中落后于OpenAI、Anthropic及众多创业公司。Spark的推出标志着谷歌终于放手让AI深入生产力环节,但能否借此挽回颓势、弥补人才流失的损失,并支撑其下一个十年,仍是巨大疑问。

marsbit07/01 10:18

谷歌风雨飘摇,市值蒸发数千亿美元,Gemini Spark能救场吗?

marsbit07/01 10:18

刚刚,Anthropic发布Sonnet 5,性能接近Opus 4.8,但不一定更便宜

Anthropic 正式发布了 Claude Sonnet 5 模型,称其为迄今为止最具 Agent 属性的 Sonnet 模型,能够在制定计划、使用工具(如浏览器、终端)方面自主运行,其能力水平接近数月前需要更大、更昂贵模型(如 Opus 4.8)才能达到的程度。 相比前代 Sonnet 4.6,Sonnet 5 在推理、工具使用、编程和知识工作等关键维度性能有显著提升。在智能体搜索和计算机使用评测中,其性能曲线表明,在中等努力程度下成本效率显著提升,在更高努力程度下某些任务性能可媲美 Opus 4.8。用户可根据任务需求灵活调整“努力程度”以平衡成本与性能。 安全评估显示,Sonnet 5 在拒绝恶意请求、抵御提示注入攻击、降低幻觉和谄媚行为率方面整体优于 Sonnet 4.6,但失当行为率仍略高于 Opus 4.8 和 Mythos Preview。该模型未针对网络安全任务专门训练,其开发软件漏洞等危险网络能力显著弱于 Opus 4.8,因此 Anthropic 为其默认启用了网络安全护栏。 定价方面,即日起至2026年8月31日提供尝鲜价:输入每百万token 2美元,输出每百万token 10美元。之后恢复为标准定价:输入3美元,输出15美元。Anthropic 同步上调了各平台的速率限制以适应更高“努力程度”模式。需注意,Sonnet 5 采用了新tokenizer,相同内容映射的token数量约为以前的1.0-1.35倍,尝鲜价旨在使过渡期整体使用成本大致持平。 开发者上手反馈称其速度很快且针对Agent优化,在浏览器使用场景下抵御提示注入攻击的能力(成功率仅0.93%)显著优于Opus 4.8(31.5%)和Sonnet 4.6(50.7%)。但也有分析指出,由于token使用量增加,其每项任务运行成本约为2.29美元,比Sonnet 4.6高约2倍,也比Opus 4.8高出约15%,成为运行成本最高的模型之一。

marsbit07/01 00:35

刚刚,Anthropic发布Sonnet 5,性能接近Opus 4.8,但不一定更便宜

marsbit07/01 00:35

Claude Code官宣下一版大升级,你在聊天,后台把活干完了

Claude Code 即将推出重大升级,未来版本将默认让子智能体在后台运行。这意味着用户在与 Claude 聊天讨论时,后台的子智能体可以同步执行如代码重构、测试、提交拉取请求等任务,真正实现“边聊边干活”。用户只需在对话结束后查看结果,并可随时将特定智能体切换到前台。 这一改进标志着 Claude Code 正从传统的问答式工具演变为能并行管理多条任务线的工作流引擎。其设计哲学是“不是聊天,是基建”。此前,Anthropic 已陆续推出了定时任务(Routines)和动态工作流(Dynamic workflows)功能,允许将复杂任务编排成脚本,调度大量子智能体协作完成。此次更新是将这些能力打包为开箱即用的默认行为。 实际影响显著。据报道,Claude Code 已将 Anthropic 内部工程师的有效产出提升至实际人数的三倍,导致公司更需要能决定“写什么代码”的产品思考者,而非单纯写代码的工程师。Spotify 的案例更具说服力:其超过2000万行的代码库中,73%的拉取请求由 AI 辅助完成,部署频率提升75%以上。工程副总裁可同时管理多个后台智能体并行工作,非工程师也能通过自然语言描述来生成端到端原型。 核心转变在于,当后台智能体成为标配,工程师的核心价值将从“编写代码”转向“决策与判断”——即思考下一步做什么,并评估结果是否正确。这预示着 AI 编程工具正进入一个以工作流自动化和智能协作为特征的新量级。

marsbit06/30 09:33

Claude Code官宣下一版大升级,你在聊天,后台把活干完了

marsbit06/30 09:33

活动图片