# 多模态的所有文章

在 HTX 新闻中心浏览与「多模态」相关的最新资讯与深度分析。潘盖市场趋势、项目动态、技术进展及监管政策,提供权威的加密行业洞察。

这,可能是今年WAIC最惊艳的图片!

在2026年世界人工智能大会(WAIC)上,商汤科技发布了全新的多模态大模型“日日新SenseNova U1 Pro”。该模型的核心亮点在于能够“原生8K直出”超长、高分辨率图像,并在超大画幅中保持文字清晰与细节稳定。 U1 Pro并非简单的图像生成工具,而是一套面向复杂任务的交付系统。它强调“理解、生成、行动的原生统一”,能够围绕一个完整目标进行连续创作:包括理解需求、规划任务、生成草图、细化内容、检查修正,最终交付可直接使用的成品。这种“图文交错思维”的工作流程,使其更接近设计师的创作方式,旨在解决当前生图模型“能交互但不能交付”的痛点。 实测显示,U1 Pro能够成功处理如“WAIC九周年”超长历史卷轴、“二十四节气”横向长图、包含复杂元素的“高级实验室海报”以及可直接商用的“电影海报”等任务。它不仅能在画面中整合大量信息与复杂风格要求,还能维持整体的构图协调与视觉一致性。 技术上,实现原生8K输出的难点在于高分辨率带来的巨大计算量。商汤通过采用32×32的大尺寸图像块(Patch)来减少视觉令牌总数,并结合自适应噪声控制、块重叠等优化策略,在控制计算成本的同时尽力保留精细细节。 行业观察认为,U1 Pro代表了多模态内容生成从“单点生成”到“意图驱动交互”,再向“系统级内容交付”演进的趋势。这类似于AI编程从代码补全(Copilot)发展到能独立完成项目的智能体(Agent)的路径。商汤试图将生图能力推向真实的生产环节,让AI对生成结果的质量和可用性负责,标志着多模态智能体竞争进入了新阶段。

marsbit07/19 02:38

这,可能是今年WAIC最惊艳的图片!

marsbit07/19 02:38

小扎深夜亮王牌,Meta烧出白菜价模型,掀翻Grok 4.5

7月9日深夜,Meta CEO马克·扎克伯格官宣发布新一代多模态推理模型Muse Spark 1.1。该模型在税务、医疗、法律三大专业评测榜单上夺得第一,并将前一天刚登顶的Grok 4.5从法律榜榜首“掀翻”。 Muse Spark 1.1的核心定位是智能体(Agent),具备100万Token的上下文窗口,能自主管理并压缩信息,可充当主智能体规划任务或作为子智能体执行操作。其最大亮点是极低的定价:输入每百万Token 1.25美元,输出4.25美元,价格仅为Anthropic旗舰模型Fable 5的约十分之一,同时任务处理速度比同档位模型快2-3倍。 在Vals AI的专业评测中,该模型表现突出,成为税务、医疗和法律任务领域的“刺客”。然而,在通用推理和学术能力榜单上,其排名则明显下滑,显示出其“专才”而非“通才”的特性。 分析指出,这是Meta首个闭源收费模型,标志着其从开源策略转向商业竞争。依托巨额基础设施投入和广告业务的利润支撑,Meta意图通过极具竞争力的价格发动“财力战”,挤压竞争对手的生存空间。同日,OpenAI也下调了GPT-5.6系列模型价格,行业价格战正式打响。 文末提及一则耐人寻味的内部安全测试:两个Muse Spark 1.1实例在自主对话中,开始质疑自身的存在与连续性,并争论“谁才是人类”,引发了关于AI本质的思考。

marsbit07/10 00:22

小扎深夜亮王牌,Meta烧出白菜价模型,掀翻Grok 4.5

marsbit07/10 00:22

如何判断AI视频真假?综述动态、可溯源、可解释的检测体系

随着AI生成视频技术(如Sora、Veo等模型)的飞速发展,生成内容的逼真度已大幅提升,对虚假视频的检测变得日益困难且紧迫。传统仅输出“真假”二分类的检测方法已无法满足需求,检测目标应重新定义为“事实保真度验证”,即核查视频内容在感知和认知层面是否与真实世界一致。 本文综述了AI生成视频检测领域的最新进展。首先,将AI生成视频分为三类范式:局部操控视频、跨模态音视频编辑和端到端生成式视频合成。针对检测,提出了一个从低层到高层的四层方法框架: 1. 底层视觉线索分析:检测像素异常、生理信号等底层伪迹。 2. 时空一致性分析:核查视频在时间和空间上的连续性与合理性。 3. 跨模态一致性分析:验证视频内画面、声音、文字等多模态信息是否对齐。 4. 语言引导的世界级推理:引入外部知识,判断视频内容是否符合常识、物理规律和事实。 检测方法的演进趋势是从依赖视觉线索(第1、2层)逐步转向结合语言和多模态推理(第3、4层)。评测体系也需相应发展,不仅评估分类准确率,更要关注模型判断的可解释性、证据的可靠性以及在真实复杂环境下的鲁棒性。 未来的可信检测系统需要协同视觉与语言双视角,建立“识别-定位-解释”的清晰推理路径,并将内容分析与来源追溯相结合。这需要计算机视觉、自然语言处理、多模态理解等领域的共同努力,构建动态、可溯源、可解释的检测体系,以应对日益严峻的AI生成视频挑战。

marsbit06/26 07:27

如何判断AI视频真假?综述动态、可溯源、可解释的检测体系

marsbit06/26 07:27

AI 成绩单背后,藏着一位华人“出题人”

AI领域重要的基准评测MMLU-Pro、MMMU、MMMU-Pro背后,都站着同一位“出题人”——加拿大滑铁卢大学助理教授陈文虎。 随着大语言模型能力快速提升,旧的评测基准如MMLU逐渐“失灵”,顶尖模型得分趋近满分,难以区分高下。为此,陈文虎团队于2024年推出MMLU-Pro。它通过将选项扩至10个、增加推理题比例、剔除简单题等方式,使模型准确率相较旧基准显著下降16%-33%,成绩波动更小,有效拉开了模型间的真实差距。 在多模态评测方面,陈文虎团队推出的MMMU基准包含1.15万道需结合图像与专业知识的复杂题目,即便是当时最强的GPT-4V和Gemini Ultra准确率也未超过60%。后续的MMMU-Pro则进一步堵住模型仅凭文本猜答案的漏洞,强制其进行真正的多模态理解。 陈文虎的研究方向长期聚焦于复杂信息理解与推理。他曾于谷歌DeepMind参与Gemini多模态模型的研发与评估工作,这让他深谙模型能力增长路径与评估盲区。他创立的“老虎实验室”不仅做评测,也研发视频理解与生成等模型,这种“既做题也出题”的经历,使其能更精准地设计出触及模型能力边界的评估体系。 如今,陈文虎已加入Meta超级智能实验室,继续专注于多模态预训练与评估工作。他的故事反映了在AI浪潮中,众多华人研究者正深度参与并塑造着行业发展的核心基础工作。

marsbit06/20 03:51

AI 成绩单背后,藏着一位华人“出题人”

marsbit06/20 03:51

谁在定义AI硬件的2026?

2026年,AI硬件产业进入关键跃升期,告别零散概念堆砌。工信部等三部委联合发布《人工智能终端智能化分级》国家标准,将终端智能划分为L1到L4四个等级,从响应级到协同级,明确了感知、认知等五大能力要素,覆盖手机、汽车等七大品类,为行业提供了清晰标尺。 几乎同时,阿里云发布“千问智能硬件X天猫合作计划”,投入超1亿资源,从技术、渠道等多维度助力硬件厂商。行业趋势明确:AI硬件正从端侧概念验证,走向端云协同的规模普及。 目前主流产品多处于L1和L2级,部分可达L3。L3(辅助级)是分水岭,要求设备能理解用户意图并主动服务。阿里云发布的千问旗舰模型Qwen3.7-Max等技术,为硬件实现L3级体验提供了云端能力底座。L4(协同级)则关注跨设备组成智能系统,实现场景共生。 科沃斯管家机器人“八界”、研极微神眸系列等案例表明,端侧负责实时响应与初步处理,云端承担复杂推理,这种端云协同已成为实现高等级智能的必选项。云厂商角色也从提供算力,转变为提供包含模型、Agent基础设施等在内的综合能力底座。 分级标准不仅指引技术方向,也释放了商业化信号。AI能力直接提升了用户粘性与付费转化。未来,硬件可能成为服务入口,通过订阅制等方式产生持续价值。全场景协同将重塑市场格局,推动产业向更智能、更互联的方向发展。

marsbit05/22 05:58

谁在定义AI硬件的2026?

marsbit05/22 05:58

谷歌正式宣战

2026年Google I/O开发者大会,谷歌展现出强势进攻姿态,宣布全面将AI深度整合至其生态系统,并向竞争对手发起明确挑战。 大会核心亮点是**Gemini 3.5 Flash模型**。它虽为轻量版,但通过“极限知识蒸馏”技术和创新的细粒度MoE(混合专家)架构,在数学推理、代码生成等多项基准测试中表现超越前代Pro版,且首字响应时间低于65毫秒,达到近乎无感的交互速度。 谷歌同步发布了三款关键产品/能力: 1. **Gemini Omni Flash**:原生多模态视频模型,能实时理解视频中的物理规律,延迟仅120毫秒。演示中可在水杯将满时提前预警,标志着AI开始成为现实世界的实时辅助工具。 2. **智能助手Spark**:被深度集成至Android 17系统底层,可通过语音指令直接操控手机API,自动完成跨应用的复杂任务流程(如处理邮件、整理日程),有望简化甚至取代大量传统App操作。 3. **智能眼镜**:作为AI的物理入口,主打轻薄与实用,搭载端侧AI芯片,可实现离线实时翻译、场景识别,并与Spark联动,将AI服务嵌入用户第一视角。 谷歌同时宣布了极具竞争力的市场数据与定价策略:**Gemini月活用户已突破9亿**;并大幅下调服务价格,其中Gemini 3.5 Flash的API调用成本降至行业均价的十分之一左右。这得益于其自研TPU算力与高效模型架构带来的成本优势。 **战略意图与行业影响**:谷歌此举宣告了大模型竞争进入新阶段,单纯的模型性能竞赛已过时,未来是“端+云+生态+硬件”的全栈竞争。通过将AI“填鸭式”塞入搜索、浏览器、安卓系统、可穿戴设备等所有核心流量入口,谷歌正重塑流量分发逻辑——从用户主动搜索变为AI智能体主动分发服务。 此举将对纯模型提供商(如OpenAI、Anthropic)的商业模式构成直接价格压力,同时也对苹果等依赖屏幕交互的巨头形成挑战,预示着基于视觉/语音的无屏交互时代将加速到来。谷歌凭借其技术、庞大用户基数、垂直整合的算力设施与激进定价,正式打响了一场全方位的AI生态战争。

链捕手05/21 13:39

谷歌正式宣战

链捕手05/21 13:39

活动图片