AI2发布全开源网络代理 MolmoWeb:仅凭“视觉”即可掌控网页

marsbit发布于2026-03-26更新于2026-03-26

文章摘要

艾伦人工智能研究所(AI2)近日发布全开源网络代理 MolmoWeb。与传统依赖网页底层代码(DOM)的方式不同,MolmoWeb 仅通过读取屏幕截图进行决策,实现了纯视觉驱动的网络导航,标志着技术上的重大突破。 MolmoWeb 的工作原理是捕获浏览器窗口截图,通过视觉分析决定下一步操作(如点击、滚动、翻页),并循环执行。这种方式使其比传统代理更稳定,因为视觉布局通常比代码更统一,且决策过程对人类而言更透明、可解释。 尽管模型规模较小(4B 和 8B 参数),但性能表现突出:在 WebVoyager 测试中,8B 版本得分达 78.2%,接近 OpenAI 的专有模型 o3(79.3%)。通过多次运行筛选最佳结果,成功率可进一步提升至 94.7%,在 UI 元素定位测试中甚至超越了 Anthropic 的 Claude3.7。 AI2 同时开源了大规模数据集 MolmoWebMix,包含 3.6 万次真实浏览任务和超过 220 万个截图-问答对,部分合成数据经 GPT-4o 验证,显示在引导智能体方面优于人类轨迹。 MolmoWeb 已在 Hugging Face 和 GitHub 上通过 Apache 2.0 协议完全开放。尽管在复杂指令、登录验证和法律合规等方面仍存在挑战,但 AI2 强调开源与社区协作对对抗大型科技公司数据垄断的重要性。

艾伦人工智能研究所(AI2)近日发布了突破性的全开源网络代理 MolmoWeb 。与传统依赖网页底层代码(DOM)的代理不同,MolmoWeb 仅通过读取屏幕截图进行决策,标志着“视觉驱动”网络导航技术的重大飞跃。

核心技术:像人类一样“看”网页

MolmoWeb 的运作逻辑非常直观:它捕获当前浏览器窗口的截图,通过视觉分析决定下一步操作(如点击、滚动、翻页),然后执行并重复。这种“所见即所得”的模式使其比传统代理更具鲁棒性,因为网页的视觉布局通常比底层代码更稳定,且其决策过程对人类用户而言完全透明、可解释。

性能飞跃:小模型击败巨头

尽管 MolmoWeb 的参数规模仅为4B 和8B,但在性能表现上却展现出“以小博大”的实力:

  • 榜单领跑:WebVoyager 测试中,8B 版本的得分高达 78.2%,不仅在开源模型中名列前茅,更逼近了 OpenAI 的专有模型 o3(79.3%)。

  • 潜力巨大: 研究发现,通过多次运行任务并筛选最优结果,其成功率可进一步跃升至 94.7%

  • 定位精准: 在 UI 元素定位基准测试中,它甚至超越了 Anthropic 的 Claude3.7。

数据支撑:史上最大的开放数据集

AI2此次不仅开源了模型权重,还贡献了名为 MolmoWebMix 的庞大数据集。该数据集包含:

  • 由人类志愿者完成的 3.6万次真实浏览任务

  • 超过 220万个 屏幕截图-问答对。

  • 通过 GPT-4o 验证的自动化合成数据。实验证明,合成数据在引导智能体寻找“最优路径”方面甚至优于人类轨迹。

开源精神与未来挑战

目前,MolmoWeb 已在 Hugging Face GitHub 上通过 Apache2.0协议完全开放。尽管在处理复杂指令、登录验证及法律合规(如服务条款)方面仍面临挑战,但 AI2坚信,只有通过完全的透明和社区协作,才能真正对抗大型科技公司的数据垄断。

相关问答

QMolmoWeb 与传统网络代理的主要区别是什么?

AMolmoWeb 与传统依赖网页底层代码(DOM)的代理不同,它仅通过读取屏幕截图进行决策,采用“视觉驱动”的网络导航方式。

QMolmoWeb 在 WebVoyager 测试中的表现如何?

A在 WebVoyager 测试中,MolmoWeb 的8B版本得分高达78.2%,逼近OpenAI的专有模型o3(79.3%),在开源模型中名列前茅。

QMolmoWebMix 数据集包含哪些内容?

AMolmoWebMix 数据集包含3.6万次人类志愿者完成的真实浏览任务、超过220万个屏幕截图-问答对,以及通过GPT-4o验证的自动化合成数据。

QMolmoWeb 的开源协议是什么?在哪里可以获取?

AMolmoWeb 使用 Apache2.0 协议完全开放,可以在 Hugging Face 和 GitHub 上获取。

QMolmoWeb 目前面临哪些挑战?

AMolmoWeb 在处理复杂指令、登录验证以及法律合规(如服务条款)方面仍面临挑战。

你可能也喜欢

如何让自己变得让人工智能永远也无法取代

面对人工智能的冲击,许多人担心工作被取代。然而,真正的威胁在于个人对他人和系统的依赖,以及由此产生的“薪资奴役”——即为生存而从事无意义、枯燥的工作。摆脱这种困境的关键,不是抵制技术,而是成为拥有高自主性的“不可受雇”个体。 文章提出了成功抵御AI替代的五个核心要素:自主性(主动行动的能力)、品味(判断事物价值的经验)、说服力(让他人关注你工作的能力)、毅力(坚持并从错误中学习)和迭代(根据反馈持续改进)。这些能力无法仅通过理论学习获得,必须通过实践来培养。 要启动转变,首先要彻底改变环境,重塑身份认同。其次,应选择一个能获得真实、快速反馈的实践领域,例如创业。在众多技能中,内容创作(媒体)比编写代码更具优势,因为其价值是主观的,需要独特的审美和判断力,这正是AI目前难以完全复制的。 具体行动上,可以从三个步骤开始: 1. **挖掘原始素材**:反思自己长期痴迷的知识领域、轻松解决的难题或童年被压抑的兴趣,找到独特的个人经验。 2. **确立反向思考主轴**:找出你坚信但主流观点错误的地方,或行业内普遍忽视的“皇帝新衣”,形成独特的批判性视角。 3. **立即发布**:将前两步的思考融合,撰写并发布第一个核心内容(如帖子、视频),勇敢接受真实世界的反馈,并在此基础上持续学习和迭代。 最终,抵御AI的关键在于构建一份与自身身份深度契合的毕生事业,通过持续的内容创作和真实互动,建立无法被自动化取代的独特价值和影响力。行动,从今天发布第一个想法开始。

marsbit6小时前

如何让自己变得让人工智能永远也无法取代

marsbit6小时前

通过掷骰子离线保管比特币密钥:并非人人愿意为之

文章探讨了通过投掷骰子生成比特币钱包种子短语的安全方法及其现实挑战。核心观点如下: **1. 骰子提供物理熵源** 骰子结果由众多微小变量决定,理论上虽可预测,但实践中无法被攻击者复制或计算,从而提供高质量的随机性。每个六面骰子投掷约产生2.585比特熵,50次投掷即可满足典型12词助记词(128比特熵)的安全需求。 **2. Coldcard漏洞事件凸显手工熵源的价值** 近期Coldcard硬件钱包因固件漏洞导致其内部随机数生成器存在缺陷,致使约1128枚比特币被盗。但那些**完全**通过足量骰子投掷生成种子短语的用户未受此漏洞影响,因为他们的主密钥未使用有缺陷的生成器。 **3. 重要警示:手工种子并非万能保护** 安全研究员指出,即使用户使用骰子生成了安全的种子,若他们使用了Coldcard的其他功能(如生成纸钱包、克隆密钥、共享签名密钥、密码等),这些**衍生密钥**仍可能调用有漏洞的随机数生成器,从而存在风险。安全种子不保证设备生成的所有秘密都安全。 **4. 手工生成熵源的现实局限性** 尽管数学上可靠,但该方法对大多数用户并不友好: * **过程繁琐易错**:需投掷50-99次,精确记录,任何输入错误都会导致钱包完全不同。 * **引入新风险**:用户可能在记录、转换过程中泄露信息,或使用有偏的骰子/投掷方式。 * **用户体验差**:难以想象大规模推广需要用户手动投掷近百次骰子。安全措施需适应现实生活场景和普通用户的知识水平。 **5. 给用户的建议** 受影响的Coldcard用户应: * 更新固件至最新版。 * 检查是否使用过有漏洞的功能生成了次级密钥或密码,如有则需立即更换。 * 考虑采用多签方案,使用不同厂商的设备分散风险。 **结论**:手工投掷骰子生成熵源是技术娴熟用户的一个有效安全选项,但其过程复杂、容易出错,不适合作为主流用户的默认方法。长远目标是依赖安全、透明且无需专业知识的硬件/软件随机数生成方案。

cryptonews.ru9小时前

通过掷骰子离线保管比特币密钥:并非人人愿意为之

cryptonews.ru9小时前

交易

现货
活动图片