AI2发布全开源网络代理 MolmoWeb:仅凭“视觉”即可掌控网页

marsbit發佈於 2026-03-26更新於 2026-03-26

文章摘要

艾伦人工智能研究所(AI2)近日发布全开源网络代理 MolmoWeb。与传统依赖网页底层代码(DOM)的方式不同,MolmoWeb 仅通过读取屏幕截图进行决策,实现了纯视觉驱动的网络导航,标志着技术上的重大突破。 MolmoWeb 的工作原理是捕获浏览器窗口截图,通过视觉分析决定下一步操作(如点击、滚动、翻页),并循环执行。这种方式使其比传统代理更稳定,因为视觉布局通常比代码更统一,且决策过程对人类而言更透明、可解释。 尽管模型规模较小(4B 和 8B 参数),但性能表现突出:在 WebVoyager 测试中,8B 版本得分达 78.2%,接近 OpenAI 的专有模型 o3(79.3%)。通过多次运行筛选最佳结果,成功率可进一步提升至 94.7%,在 UI 元素定位测试中甚至超越了 Anthropic 的 Claude3.7。 AI2 同时开源了大规模数据集 MolmoWebMix,包含 3.6 万次真实浏览任务和超过 220 万个截图-问答对,部分合成数据经 GPT-4o 验证,显示在引导智能体方面优于人类轨迹。 MolmoWeb 已在 Hugging Face 和 GitHub 上通过 Apache 2.0 协议完全开放。尽管在复杂指令、登录验证和法律合规等方面仍存在挑战,但 AI2 强调开源与社区协作对对抗大型科技公司数据垄断的重要性。

艾伦人工智能研究所(AI2)近日发布了突破性的全开源网络代理 MolmoWeb 。与传统依赖网页底层代码(DOM)的代理不同,MolmoWeb 仅通过读取屏幕截图进行决策,标志着“视觉驱动”网络导航技术的重大飞跃。

核心技术:像人类一样“看”网页

MolmoWeb 的运作逻辑非常直观:它捕获当前浏览器窗口的截图,通过视觉分析决定下一步操作(如点击、滚动、翻页),然后执行并重复。这种“所见即所得”的模式使其比传统代理更具鲁棒性,因为网页的视觉布局通常比底层代码更稳定,且其决策过程对人类用户而言完全透明、可解释。

性能飞跃:小模型击败巨头

尽管 MolmoWeb 的参数规模仅为4B 和8B,但在性能表现上却展现出“以小博大”的实力:

  • 榜单领跑:WebVoyager 测试中,8B 版本的得分高达 78.2%,不仅在开源模型中名列前茅,更逼近了 OpenAI 的专有模型 o3(79.3%)。

  • 潜力巨大: 研究发现,通过多次运行任务并筛选最优结果,其成功率可进一步跃升至 94.7%

  • 定位精准: 在 UI 元素定位基准测试中,它甚至超越了 Anthropic 的 Claude3.7。

数据支撑:史上最大的开放数据集

AI2此次不仅开源了模型权重,还贡献了名为 MolmoWebMix 的庞大数据集。该数据集包含:

  • 由人类志愿者完成的 3.6万次真实浏览任务

  • 超过 220万个 屏幕截图-问答对。

  • 通过 GPT-4o 验证的自动化合成数据。实验证明,合成数据在引导智能体寻找“最优路径”方面甚至优于人类轨迹。

开源精神与未来挑战

目前,MolmoWeb 已在 Hugging Face GitHub 上通过 Apache2.0协议完全开放。尽管在处理复杂指令、登录验证及法律合规(如服务条款)方面仍面临挑战,但 AI2坚信,只有通过完全的透明和社区协作,才能真正对抗大型科技公司的数据垄断。

相關問答

QMolmoWeb 与传统网络代理的主要区别是什么?

AMolmoWeb 与传统依赖网页底层代码(DOM)的代理不同,它仅通过读取屏幕截图进行决策,采用“视觉驱动”的网络导航方式。

QMolmoWeb 在 WebVoyager 测试中的表现如何?

A在 WebVoyager 测试中,MolmoWeb 的8B版本得分高达78.2%,逼近OpenAI的专有模型o3(79.3%),在开源模型中名列前茅。

QMolmoWebMix 数据集包含哪些内容?

AMolmoWebMix 数据集包含3.6万次人类志愿者完成的真实浏览任务、超过220万个屏幕截图-问答对,以及通过GPT-4o验证的自动化合成数据。

QMolmoWeb 的开源协议是什么?在哪里可以获取?

AMolmoWeb 使用 Apache2.0 协议完全开放,可以在 Hugging Face 和 GitHub 上获取。

QMolmoWeb 目前面临哪些挑战?

AMolmoWeb 在处理复杂指令、登录验证以及法律合规(如服务条款)方面仍面临挑战。

你可能也喜歡

Coinbase副总裁:加密货币监管之战已经结束

Coinbase新任副总裁Ryan VanGrak表示,加密货币行业的监管之战已经结束。自2026年7月9日上任以来,他已将公司监管策略的重点从诉讼和对抗转向增长与创新,使得行业可以专注于发展,而非生存权之争。 VanGrak指出,《数字资产市场清晰度法案》(CLARITY法案)获得了巨大推动力。该法案旨在建立联邦监管框架,明确划分SEC与CFTC在数字资产领域的职责,以期通过明确的联邦规则确保适当监督、保护投资者并维持美国在数字资产领域的领导地位。 Coinbase前首席法务官Paul Grewal曾参与加密货币史上最重要的法律战之一,即SEC于2023年6月对Coinbase提起的诉讼(该案已被驳回)。VanGrak的任命标志着公司从“战时顾问”转向了“和平时期外交官”。 VanGrak拥有在Citadel Securities和美国SEC工作的经验,深谙监管机制和日益吸引Coinbase的机构金融世界。Coinbase正致力于超越单纯的加密货币交易所,通过拓展股票、期货、预测市场及人工智能工具等业务,成为全面的金融服务提供商。 对投资者而言,加密货币立法获得两党支持在SEC执法浪潮时期是不可想象的。CLARITY法案获得的两党支持表明,立法者已不再质疑加密货币是否应该存在,而是专注于如何监管。然而风险犹存,法案“接近通过”意味着尚未最终完成,VanGrak的足球比喻提醒人们,许多进攻可能在红区受阻。

cryptonews.ru15 分鐘前

Coinbase副总裁:加密货币监管之战已经结束

cryptonews.ru15 分鐘前

深度解读 FWA:把 NFT 变成"链上扭蛋"的有趣实验

FWA(Fake World Assets)是一个基于以太坊的创新型项目,它将NFT与“链上扭蛋机”机制结合,为闲置NFT提供了新的流动性解决方案。 **核心玩法:** 项目中有两种主要角色: 1. **存款人(庄家)**:将白名单内的NFT与一笔自选的ETH保证金(Backing)一起存入,形成一个“仓位”。保证金越高,该NFT被抽中的概率越低,但能持续分享手续费收益;保证金越低,则越容易被抽走。 2. **抽奖人(玩家)**:支付由系统实时计算的统一价格进行抽奖,必随机获得一个仓位。抽中后,玩家可选择留下NFT,或按该仓位保证金85%的“常设回购价”将NFT卖还给原主人,获得ETH或项目代币$FWA。 **关键机制与代币经济:** * **定价与概率**:抽奖价格由所有仓位保证金的调和平均数决定,这使得池中即使有高价值NFT,抽奖成本也能保持较低。被抽中的概率与保证金成反比。 * **收益分配**:抽奖费用的一部分会均分给所有活跃存款人,保证金最高的“皇冠”仓位可获得额外奖励。 * **$FWA代币**:代币主要通过参与协议获得。当抽奖人选择以$FWA结算回购款时,系统会用ETH在市场上买入$FWA,形成持续买盘,将协议活跃度与代币价值绑定。 * **协议收入**:主要来自抽奖费用抽成、NFT被留下时的结算费,以及卖回时的结算折扣。 **设计亮点:** 该项目通过“反向权重+均分收益”平衡大小额存款人利益;用“常设回购”机制降低参与风险;并通过代币的“非对称买卖”(早期只能卖出)确保$FWA主要流向真实用户,助力协议冷启动。

marsbit29 分鐘前

深度解读 FWA:把 NFT 变成"链上扭蛋"的有趣实验

marsbit29 分鐘前

三星旗下公司与Upbit运营商探讨稳定币基础设施建设

三星集团IT服务子公司三星SDS正与韩国最大加密货币交易所Upbit的运营商Dunamu探讨合作,涉及稳定币基础设施、数字资产系统及基于AI的支付模式。三星SDS首席执行官李俊熙在第二季度财报电话会议上表示,公司已通过韩国证券存管机构的代币化证券平台项目及对稳定币从发行到结算的全流程验证,积累了差异化的数字资产基础设施能力。他预计此次合作将助力三星SDS拓展数字资产基础设施市场。 此前,三星电子已宣布计划在三星钱包中增加稳定币支持。今年5月,三星证券、三星SDS和三星信用卡联合收购了Dunamu 4%的股份,加深了三星附属公司与韩国数字资产领域的联系。李俊熙强调,此次投资是战略举措而非财务投资,双方计划共同完善数字金融基础设施的潜在商业模式,结合三星SDS的IT服务、云和安全能力与Dunamu的区块链技术,以引领市场。 与此同时,三星SDS在AI和云服务领域的扩张持续推动业绩增长,第二季度收入同比增长5.9%至3.72万亿韩元(约26亿美元),其中外部云业务收入激增75%。公司还计划大幅扩展AI基础设施,从当前的110兆瓦增至2029年的230兆瓦,并在2031年超过800兆瓦,彰显其在数字金融服务之外构建AI基础设施的雄心。

cointelegraph30 分鐘前

三星旗下公司与Upbit运营商探讨稳定币基础设施建设

cointelegraph30 分鐘前

10万科学家免费用1年,OpenAI把科研流水线搬进ChatGPT

OpenAI于7月29日推出“ChatGPT for Academic Researchers”计划,旨在为10万名高校科研人员提供为期一年的免费高级模型使用权。首批名额1万个,目标在2027年达到10万。入选机构包括巴黎高师、普林斯顿高等研究院等知名学府。 获批研究者将获得包含ChatGPT、ChatGPT Work、Codex在内的一整套集成工作区,并配备扩容版Deep Research、更高使用限额和更大上下文窗口。该工作区集成了超过75个生命科学专用技能,并能连接Zotero、GitHub、公共数据库等多种科研常用工具。模型方面,GPT-5.6系列分工明确,其中旗舰型号Sol Pro在专业数学和生物数据分析基准测试中表现出色。 OpenAI数据显示,每周约有130万人使用ChatGPT进行高等科学与数学研究,相关论文致谢ChatGPT的数量亦快速增长。分析认为,该计划旨在培养科研人员的工作习惯,通过深度绑定其工作流程,在免费期结束后形成高迁移成本。 此次免费提供的是产品使用权,而非无限额度或API访问,更不包含模型权重。申请者需为高校教职或博士后,通过机构验证并提交近期学术论文。此举被指绕开了AI基础研究人员对模型权重和训练数据的核心诉求。 相比之下,Anthropic的“AI for Science”计划主要提供API额度。两者均未开放模型权重,理由是为防止滥用。最终,这份工具红利虽能显著提升科研效率,但也引发了关于用户依赖性和AI研究透明度的思考。

marsbit34 分鐘前

10万科学家免费用1年,OpenAI把科研流水线搬进ChatGPT

marsbit34 分鐘前

交易

現貨
活动图片