# 基准的所有文章

在 HTX 新聞中心流覽與「基准」相關的最新資訊與深度分析。潘蓋市場趨勢、專案動態、技術進展及監管政策,提供權威的加密行業洞察。

AI 成绩单背后,藏着一位华人“出题人”

AI领域重要的基准评测MMLU-Pro、MMMU、MMMU-Pro背后,都站着同一位“出题人”——加拿大滑铁卢大学助理教授陈文虎。 随着大语言模型能力快速提升,旧的评测基准如MMLU逐渐“失灵”,顶尖模型得分趋近满分,难以区分高下。为此,陈文虎团队于2024年推出MMLU-Pro。它通过将选项扩至10个、增加推理题比例、剔除简单题等方式,使模型准确率相较旧基准显著下降16%-33%,成绩波动更小,有效拉开了模型间的真实差距。 在多模态评测方面,陈文虎团队推出的MMMU基准包含1.15万道需结合图像与专业知识的复杂题目,即便是当时最强的GPT-4V和Gemini Ultra准确率也未超过60%。后续的MMMU-Pro则进一步堵住模型仅凭文本猜答案的漏洞,强制其进行真正的多模态理解。 陈文虎的研究方向长期聚焦于复杂信息理解与推理。他曾于谷歌DeepMind参与Gemini多模态模型的研发与评估工作,这让他深谙模型能力增长路径与评估盲区。他创立的“老虎实验室”不仅做评测,也研发视频理解与生成等模型,这种“既做题也出题”的经历,使其能更精准地设计出触及模型能力边界的评估体系。 如今,陈文虎已加入Meta超级智能实验室,继续专注于多模态预训练与评估工作。他的故事反映了在AI浪潮中,众多华人研究者正深度参与并塑造着行业发展的核心基础工作。

marsbit06/20 03:51

AI 成绩单背后,藏着一位华人“出题人”

marsbit06/20 03:51

AI成绩单背后,藏着一位华人“出题人”

每次前沿AI模型发布,业界都会关注MMLU-Pro、MMMU等基准测试的成绩单。这些评测已成为衡量模型能力的“标准科目”,但其背后的关键人物却鲜为人知——华人学者陈文虎。 陈文虎是加拿大滑铁卢大学助理教授,“老虎实验室”(TIGERLab)创始人。随着模型能力快速提升,旧评测体系如MMLU逐渐“失灵”,模型分数趋同,难以区分高下。为此,陈文虎团队推出了MMLU-Pro,通过增加选项、强化推理题、清理简单题目等方式,使新基准更难、更稳定,有效拉开了模型间的差距。 在多模态领域,陈文虎团队创建的MMMU基准包含1.15万道需结合图像与专业知识进行推理的题目,即便顶尖模型初期准确率也仅约60%。后续的MMMU-Pro进一步堵住模型“只看文字猜答案”的漏洞,强调真正的多模态理解能力。 陈文虎的研究始终围绕复杂信息理解与推理。他拥有产业界研发经验,曾参与谷歌Gemini项目,如今在Meta超级智能实验室继续专注于多模态评估。他相信,好的评估源于对模型能力边界的深刻理解,而“老虎实验室”同时进行模型研发,正是为了更懂如何出题。 在AI行业的光环常聚焦于明星公司与产品之时,陈文虎的工作在底层塑造着行业评估模型的共同语言,展现了华人才智在关键基础环节的深远影响。

marsbit06/19 09:18

AI成绩单背后,藏着一位华人“出题人”

marsbit06/19 09:18

Anthropic警告的递归AI,田渊栋新公司刚刚走出了「第一步」

近日,Anthropic发布文章披露,其代码库超过80%由AI撰写,并警告AI“递归自我改进”(即AI自主设计、训练后续版本)可能带来风险,呼吁行业建立暂停机制。与此同时,由田渊栋等人联合创立的新公司Recursive Superintelligence结束了隐身状态,发布了其首项公开技术成果——“迈向自动化AI研究的第一步”。 该系统旨在将传统AI研究中“提出想法-编写代码-运行实验-分析结果”的人工闭环自动化。它能够针对给定目标自动生成实验思路、实现代码、运行验证并从中学习,从而自主推进研究进程,并内置了防止“奖励作弊”的机制。 Recursive在三个差异显著的基准测试中取得了领先结果: 1. **小模型训练优化**:在固定计算预算下,将模型验证损失进一步降低,相当于以更少时间达到同等效果。 2. **训练速度竞速**:在社区持续优化两年的基准上,将训练时间从79.7秒缩短至77.5秒,核心改进包括在注意力层使用FP8计算、为优化器添加退火噪声等。 3. **GPU内核优化**:在英伟达的底层计算内核基准测试中,将整体得分提升至0.754,缩小了与硬件理论极限的差距,而这些优化策略并非来自团队的专业知识,而是由系统自主发现。 Recursive团队阵容强大,已获得巨额融资,其目标是构建能够递归提升自身研发能力的AI系统。这与Anthropic的警告形成了微妙对比:一方正在实践AI加速AI研发的路径,另一方则呼吁为可能到来的“递归自我改进”时刻做好风险管控准备。当前成果虽仅是迈向自动化研究的初步尝试,但标志着一个能够自我增强的AI研发新范式已开始运转。

marsbit06/12 04:11

Anthropic警告的递归AI,田渊栋新公司刚刚走出了「第一步」

marsbit06/12 04:11

“我不需要更好的模型了”:Reddit 热帖下的 AI 众生相

Anthropic发布了新一代旗舰AI模型Claude Fable 5,在基准测试中表现卓越,但用户反响冷淡。Reddit上一篇题为“我不需要更好的模型了”的热帖引发广泛讨论,反映了当前用户的主流情绪。 许多用户认为,现有模型(如Opus 4.8)的能力已足够应对日常工作和代码编写,对新模型带来的边际效益提升感觉不明显,同时对其更高的使用成本和Token消耗感到不满,认为AI模型能力可能已进入平台期。 此外,Fable 5内置的偏保守的安全护栏成为主要槽点。用户抱怨在处理与安全相关(如代码安全审查)的请求时,触发拒绝的频率远高于官方宣称的5%,导致请求被降级回旧模型处理,付费用户对此尤其不满。 然而,也存在反对声音,主要来自处理极端复杂任务的深度用户。他们表示,在需要超长上下文理解、处理万行级别代码或复杂仿真的场景中,Fable 5的能力提升是“革命性”的,带来了实质性的效率突破。 这场争论揭示了AI行业的一个现状:基准测试衡量的是能力上限,而大众市场更关注日常需求的天花板。当多数普通用户的需求已被现有模型满足,更强模型的价值主要在特定专业领域凸显。文章最后指出,未来公开模型的发展,将取决于厂商如何平衡能力、成本、安全与可用性,以及重度用户是否愿意为之买单。

marsbit06/12 02:52

“我不需要更好的模型了”:Reddit 热帖下的 AI 众生相

marsbit06/12 02:52

刚刚,Claude Mythos 5发布,5000万行代码1天搞定

Anthropic正式发布了其最强大的大模型Claude Mythos 5,并推出了面向公众的安全版本Claude Fable 5。两者核心能力相同,但Fable 5在检测到高风险请求(如网络安全攻击、生化风险)时会自动降级使用旧模型Opus 4.8来回应,超过95%的会话不受影响。价格定为每百万输入Token 10美元,输出50美元。 技术方面,Fable 5在多项评测中表现出色:在软件工程基准SWE-bench Pro获得80.3%高分,并能在一天内完成原本需两个月的5000万行代码库迁移。其原生视觉能力可仅凭截图通关《宝可梦》游戏。在长上下文、记忆能力和金融法律等复杂分析任务上也实现显著突破。 官方透露,未完全开放的Mythos 5在生物医药领域展现出强大自主性,能独立执行生物学家工作流,其设计的蛋白质靶向复合物已有多个进入真实药物研发管线。 AI学者Ethan Mollick的测试显示,新模型的工作模式发生根本转变:人类从需要精细操控的“巫师”变为只需提出宏观需求的“甲方”,模型能自主规划并执行长达数小时的多步骤复杂项目。 此次发布也标志着前沿AI进入“权限时代”,最强能力伴随更严格的安全审查(如30天数据留存)。模型在提供强大生产力的同时,其自主性也引发了关于人类角色演变的思考。

marsbit06/10 00:23

刚刚,Claude Mythos 5发布,5000万行代码1天搞定

marsbit06/10 00:23

活动图片