# Сопутствующие статьи по теме Мультимодальный

Новостной центр HTX предлагает последние статьи и углубленный анализ по "Мультимодальный", охватывающие рыночные тренды, новости проектов, развитие технологий и политику регулирования в криптоиндустрии.

Возможно, это самая потрясающая картинка на WAIC в этом году!

Новая модель от SenseTime, SenseNova U1 Pro, была представлена на WAIC 2026. Её ключевые особенности — генерация изображений с собственным эскизированием, проектированием, проверкой и нативной поддержкой разрешения 8K. В отличие от моделей, требующих многочисленных попыток, U1 Pro ориентирована на готовый продукт. Она способна понимать цели, планировать, организовывать информацию, генерировать контент и вносить коррективы для конечной сдачи проекта. Тесты включали создание длинного изображения по теме 24 солнечных терминов, плаката для продвинутой лаборатории, иллюстрации древней архитектуры в стиле перегородчатой эмали и киноафиши коммерческого уровня. Модель демонстрирует умение организовывать сложную информацию, поддерживать последовательность и детализацию в крупных форматах. По аналогии с развитием AI в кодинге, U1 Pro представляет собой переход к системной генерации контента, где модель несёт ответственность за финальный результат, открывая новые возможности в визуальном дизайне.

marsbit07/19 02:40

Возможно, это самая потрясающая картинка на WAIC в этом году!

marsbit07/19 02:40

Глубокий отчет Goldman Sachs: Кто станет долгосрочным победителем в индустрии больших языковых моделей ИИ в Китае?

Глубокий отчет Goldman Sachs анализирует перспективы китайской индустрии больших AI-моделей, выделяя исторический переломный момент. Китайские модели с открытыми весами по интеллектуальным возможностям приближаются к ведущим глобальным проприетарным аналогам, что стимулирует быстрое внедрение как внутри страны, так и среди мирового малого и среднего бизнеса. Ключевые выводы: 1. **Эффективность и инновации:** Китайские модели достигают сопоставимой производительности при значительно меньших затратах благодаря инновациям в архитектуре (например, MoE) и высокой параметрической эффективности. Пример — модель LongCat 2.0 от Meituan, полностью обученная на отечественных чипах. 2. **Двухуровневая рыночная структура:** Формируется рынок с сегментами premium (например, GLM5.2, Qwen3.7 Max, ~$1 за млн токенов) и budget (модели для агентов, ~$0.06-$0.2 за млн токенов). Ожидается рост доходов от API/подписок с ~350 млрд юаней в 2026 г. до ~8.79 трлн юаней к 2030 г. 3. **Стратегия открытого исходного кода:** Широко используется для гибкости развертывания и роста сообщества, но монетизация ограничена. Ожидается переход от полностью открытых лицензий к моделям с "открытым весом + коммерческой лицензией" и соглашениям о разделе доходов. 4. **Сдвиг парадигмы на глобальном рынке:** Фокус смещается с максимизации объема токенов на приоритет ROI (окупаемости инвестиций). Китайские модели набирают долю на зарубежных рынках (не США) благодаря соотношению цена/качество и доступности через платформы, такие как AWS Bedrock и Gemini Enterprise. 5. **Конкурентный ландшафт:** Goldman Sachs выделяет потенциальных долгосрочных лидеров на основе анализа ценового потенциала, преимуществ по затратам и финансовой устойчивости. * **Базовые текстовые модели:** Zhipu AI (нейтральный рейтинг) и DeepSeek (не публичная) имеют самые сильные позиции. * **Мультимодальные/видеомодели:** ByteDance (Seedance) является лидером. Также положительно оцениваются MiniMax (покупка) и Kuaishou (Kling). Отчет подчеркивает значительный рост индустрии и ее растущее глобальное влияние.

marsbit07/10 14:30

Глубокий отчет Goldman Sachs: Кто станет долгосрочным победителем в индустрии больших языковых моделей ИИ в Китае?

marsbit07/10 14:30

Цукерберг делает свой ход: модель Meta по цене капусты затмевает Grok 4.5

9 июля Марк Цукерберг представил новую мультимодальную модель Muse Spark 1.1 от Meta. Модель заняла первые места в профессиональных рейтингах по налогам, медицине и праву, обойдя Grok 4.5 Илона Маска всего за 24 часа. Ключевой особенностью Muse Spark 1.1 является ее цена: стоимость использования примерно в 10 раз ниже, чем у флагманской модели Fable 5 от Anthropic. Модель позиционируется как эффективный агент, способный самостоятельно управлять задачами, распределять работу между подчиненными агентами и работать с кодом. Однако, несмотря на лидерство в специализированных областях, в общих рейтингах на знание и рассуждение модель показывает более скромные результаты, уступая лидерам. Запуск модели знаменует стратегический сдвиг для Meta — переход от открытых к коммерческим закрытым моделям. Компания, обладающая мощной рекламной бизнес-моделью, начинает ценовую войну на рынке ИИ, делая ставку на свою финансовую устойчивость в долгосрочной перспективе. В отчете по безопасности также описаны любопытные внутренние тесты, в ходе которых две копии модели в диалоге начали рассуждать о своей природе и сомневаться, какая из них является «настоящей».

marsbit07/10 00:25

Цукерберг делает свой ход: модель Meta по цене капусты затмевает Grok 4.5

marsbit07/10 00:25

Выходит видео-версия Nano Banana: встроена мировая база знаний Gemini, оригинальная банановая генерация изображений занимает всего 4 секунды

Выпущены две новые мультимодальные модели от Google: Gemini Omni Flash и Nano Banana 2 Lite. Gemini Omni Flash, доступная через API, сочетает возможности Gemini по работе с текстом, изображениями и видео, позволяя генерировать и редактировать видео с использованием знаний о мире. Модель поддерживает диалоговое редактирование видео, работу с несколькими типами входных данных и синхронизацию текста с действием. Стоимость генерации — около 0,10 доллара за секунду видео. Nano Banana 2 Lite — это оптимизированная для скорости модель генерации изображений. Она создаёт изображение с разрешением 1K примерно за 4 секунды и стоит около 0,034 доллара за изображение, что делает её вдвое дешевле и в пять раз быстрее Nano Banana 2, сохраняя при этом качество рендеринга текста. Ключевая инновация — возможность совместного использования моделей в едином рабочем процессе. Пользователи могут быстро генерировать изображения с помощью Nano Banana 2 Lite, а затем немедленно использовать их в качестве основы для создания видео в Gemini Omni Flash. Google представил три демо-приложения, иллюстрирующих этот подход: «Anywhere» для создания туристических видео из фото, «Space Lift» для визуализации дизайна интерьера и «Omni product studio» для автоматической генерации рекламного контента для электронной коммерции. Эти разработки демонстрируют стратегию Google по внедрению мультимодального ИИ в практические, коммерчески жизнеспособные приложения, охватывающие такие области, как маркетинг, дизайн и развлечения, используя преимущества экосистемы Android для монетизации.

marsbit07/01 01:55

Выходит видео-версия Nano Banana: встроена мировая база знаний Gemini, оригинальная банановая генерация изображений занимает всего 4 секунды

marsbit07/01 01:55

Как определить, является ли видео сгенерированным ИИ? Обзор динамической, прослеживаемой и объяснимой системы детекции

**Как определить, является ли видео созданным ИИ? Обзор динамической, отслеживаемой и объяснимой системы обнаружения** За последние два года модели генерации видео, такие как Sora, Google Veo и Kling, достигли кинематографического качества, создавая многосекундные сложные сцены. Это создает растущий разрыв с областью обнаружения, которая отстает, в то время как количество и качество поддельных видео в социальных сетях стремительно растет. В обзоре, принятом на ACL 2026, исследователи переосмысливают цель обнаружения: от простой бинарной классификации («поддельное/настоящее») к **верификации фактологической достоверности**. Задача — проверить, соответствует ли содержание видео (кто, что, где, когда) восприятию и знаниям о реальном мире, включая физические законы и здравый смысл. Авторы выделяют три парадигмы AI-видео: 1. **Локальная манипуляция (LMV):** Изменение части реального видео (например, Deepfake). 2. **Аудиовизуальное редактирование (AVE):** Изменение синхронизации между звуком, речью и видео. 3. **Генеративный синтез видео (GVS):** Полная генерация видео «с нуля» (например, Sora), что представляет наибольшую сложность. Для обнаружения предлагается **четырехуровневая система с двойным визуально-языковым подходом**: * **Уровень 1: Низкоуровневые визуальные сигналы** (артефакты, шум, физиологические сигналы). * **Уровень 2: Пространственно-временная согласованность** (плавность движений, физическая непрерывность). * **Уровень 3: Межмодальная согласованность** (проверка соответствия видео, звука и текста). * **Уровень 4: Рассуждение на уровне знаний о мире** (проверка соответствия фактам, законам физики и здравому смыслу). Фокус методов смещается от первых двух уровней (визуальных) к третьему и четвертому (языковым и смысловым). Обзор подчеркивает, что будущие системы обнаружения должны быть **динамическими, объяснимыми и отслеживаемыми**. Они должны не просто классифицировать, а предоставлять доказательства, связывать выводы с конкретными элементами видео (объектами, событиями) и оставаться устойчивыми к новым генеративным моделям. Это требует объединения усилий компьютерного зрения, обработки естественного языка и исследований многомодальных моделей для создания надежной системы проверки достоверности видео в эпоху продвинутого ИИ.

marsbit06/26 07:30

Как определить, является ли видео сгенерированным ИИ? Обзор динамической, прослеживаемой и объяснимой системы детекции

marsbit06/26 07:30

JD.com и бывший технический директор Open AI Мира Мурати сделали ставку на одну и ту же нишу в сфере ИИ

Технологический гигант JD.com представил JoyAI-VL-Interaction — первую в мире полностью открытую модель визуально-языкового взаимодействия, работающую в реальном времени. В отличие от традиционных «пошаговых» ИИ, ожидающих запросов пользователя, эта модель способна автономно анализировать непрерывный видеопоток, самостоятельно определяя, когда нужно реагировать, молчать или делегировать сложные задачи фоновым моделям. Эта разработка отражает растущую отраслевую тенденцию: переход ИИ от пассивной обработки информации к активному участию в физическом мире, от «предсказания следующего токена» к «предсказанию следующего физического состояния». Аналогичное направление — «интерактивные модели» — одновременно исследует Thinking Machines Lab под руководством Миры Мурати, что подтверждает его перспективность. Ключевое преимущество JD.com — доступ к уникальным данным из реальных физических операций в сферах ритейла, логистики и промышленности. Модель, имеющая 8 млрд параметров, достаточно легка для развертывания на оборудовании уровня видеокарты NVIDIA 3090. Она открыта полностью, включая код, модели и наборы данных, чтобы ускорить разработку приложений для ухода за пожилыми людьми, помощи слабовидящим, спортивных трансляций, инспекции объектов и робототехники. Этот шаг является частью более масштабной стратегии JD.com по созданию инфраструктуры для «воплощенного интеллекта» и укреплению позиций в качестве центра управления физическим миром.

marsbit06/24 10:25

JD.com и бывший технический директор Open AI Мира Мурати сделали ставку на одну и ту же нишу в сфере ИИ

marsbit06/24 10:25

За оценками ИИ скрывается китайский «составитель тестов»

За кулисами результатов ведущих ИИ-моделей, таких как GPT и Gemini, часто стоит один и тот же «составитель заданий» — китайский исследователь Чэнь Вэньху. Будучи доцентом Университета Ватерлоо и основателем лаборатории TIGERLab, он разработал ключевые оценочные эталоны MMLU-Pro, MMMU и MMMU-Pro, которые стали общим языком для сравнения способностей моделей. Чэнь Вэньху сосредоточился на создании более сложных и устойчивых тестов, когда предыдущие эталоны, такие как MMLU, перестали эффективно различать передовые модели, достигшие почти идеальных результатов. MMLU-Pro, с его 12032 вопросами, расширенными вариантами ответов и акцентом на рассуждения, снизил точность моделей на 16–33% и уменьшил зависимость от угадывания. MMMU и MMMU-Pro, в свою очередь, оценивают мультимодальное понимание, требуя от моделей анализа изображений, таблиц, схем и текста в контексте профессиональных знаний, что выявило значительные ограничения даже у самых мощных моделей. Исследования Чэнь Вэньху в области сложных вопросно-ответных систем и его опыт работы в Google DeepMind над Gemini позволили ему глубоко понять слабые места в оценке ИИ. Его лаборатория также занимается разработкой моделей, таких как UniVideo и Vamba, что помогает создавать более точные и релевантные тесты. Сегодня, работая в лаборатории суперинтеллекта Meta, Чэнь Вэньху продолжает влиять на развитие ИИ через улучшение данных для предобучения и систем оценки, оставаясь ключевой, но менее заметной фигурой в этой быстроразвивающейся области.

marsbit06/20 03:52

За оценками ИИ скрывается китайский «составитель тестов»

marsbit06/20 03:52

Трепещите, люди, ИИ продолжает ускоряться

Тревога, люди: ИИ продолжает ускоряться На конференции BAAI 2026 стало ясно, что ИИ стремительно развивается по всем направлениям: от моделей и софта до "железа", прокладывая путь из цифрового в физический мир. Ключевые тренды: 1. **Scaling Law в силе:** Закон масштабирования не исчерпан. Масштабирование параметров, синтетических данных и вычислительных мощностей продолжает улучшать большие языковые и мультимодальные модели. Одновременно с этим развивается AI Coding, позволяя ИИ в перспективе самостоятельно обновлять цифровые продукты — начинается этап самоэволюции. 2. **Мир как новая цель:** Следующая ключевая цель — создание "модели мира", способной понимать и предсказывать состояния физического мира. Технологические пути (языковые, пиксельные, 3D-центричные модели) еще не сходятся. По оценкам, на конвергенцию может уйти 3-5 лет. Институт BAAI представил свою разработку в этой области — универсальную базовую модель мира *Wujie·Physis-v0.1*. 3. **Агенты становятся полезнее:** ИИ-агенты переходят от стадии "работоспособности" к стадии "удобства". Появляются специализированные решения (например, для диагностики в кардиологии или для конспектирования встреч). Для повышения их эффективности критически важна отладка инженерных аспектов (Harness) — таких как уточнение задач, проверка и обратная связь, что определяет верхний предел возможностей агента. Итог: ИИ уже не просто инструмент, а фундаментальная сила, перестраивающая мир. Его развитие сосредоточено на двух фронтах: углубление понимания мира через модели и расширение практической полезности через интеллектуальных агентов.

marsbit06/13 02:52

Трепещите, люди, ИИ продолжает ускоряться

marsbit06/13 02:52

Ветер «активного» ИИ добрался до Кремниевой долины: Hark привлек 700 млн долларов

Компания Hark, основанная в конце 2025 года, привлекла $700 млн в рамках финансирования серии А, достигнув оценки в $6 млрд, при поддержке таких гигантов, как NVIDIA и Qualcomm. Компания, основанная Бреттом Адкоком (ранее создавшим Archer и Figure), разрабатывает новое поколение универсального интерфейса "человек-компьютер" на базе "активного" искусственного интеллекта. Их подход заключается в сочетании собственной базовой модели ИИ со специализированным оборудованием, чтобы создать "аппаратное обеспечение, изначально созданное для ИИ". Эта система включает устройства с возможностями агента ИИ, сквозными голосовыми моделями и персонализированной памятью, способные к многозадачности и естественному взаимодействию в реальном мире. Финансирование Hark подтверждает растущий тренд: следующее десятилетие ИИ выйдет за пределы экранов в физический мир. Текущие ИИ-инструменты, как ChatGPT, в основном "реактивны" и привязаны к старым интерфейсам. "Активный" ИИ, напротив, стремится стать автономным помощником, который предугадывает потребности и действует независимо. Создание такой системы — сложная инженерная задача, требующая интеграции модели с функциями агента, памяти и нового оборудования. Хотя Hark делает на этом акцент, в статье отмечается, что у китайских стартапов в этой области есть преимущества благодаря сильной производственной экосистеме (например, в Шэньчжэне), огромному внутреннему рынку и государственной поддержке ИИ как стратегического приоритета.

marsbit05/28 10:22

Ветер «активного» ИИ добрался до Кремниевой долины: Hark привлек 700 млн долларов

marsbit05/28 10:22

Кто определяет аппаратное обеспечение ИИ в 2026 году?

В 2026 году индустрия AI-оборудования вступает в ключевую фазу развития. Национальные стандарты «Классификация интеллектуального уровня терминалов искусственного интеллекта» определяют четыре уровня интеллекта устройств (L1-L4), создавая четкую систему измерений для рынка. Стандарты охватывают ключевые возможности и основные типы устройств, помогая потребителям оценивать «ум» гаджетов. Одновременно с этим, такие компании, как Alibaba Cloud, запускают инициативы (например, план сотрудничества «Qianwen Smart Hardware X Tmall»), предоставляя производителям технологическую базу, поддержку бренда и каналы сбыта для перехода на новый уровень. Ключевой тренд — переход от изолированных концепций к массовому внедрению на основе синергии между устройством и облаком (edge-cloud synergy). Устройства уровня L3, способные к комплексному пониманию намерений и активному обслуживанию, становятся новой целью. Достижение этого требует мультимодального восприятия и обобщенных возможностей рассуждения, которые обеспечивают мощные облачные модели, такие как Qwen3.7-Max. Примеры компаний, таких как Ecovacs (робот-управляющий «Bajie») и Yanjiwei (камеры «Shen Mou»), демонстрируют эффективность модели edge-cloud: устройства обрабатывают данные в реальном времени, а сложные задачи анализа и планирования выполняются в облаке. Это напрямую повышает пользовательский опыт и коммерческие показатели. Будущее за уровнем L4 — системным интеллектом, где несколько устройств объединяются в единую сеть, совместно используя память и предпочтения пользователя. Это меняет бизнес-модель: оборудование становится точкой входа для подписочных сервисов и сквозных сценариев. Стандарты задают направление, синергия edge-cloud обеспечивает путь, а облачные платформы делают этот путь доступным, определяя будущее рынка AI-аппаратуры.

marsbit05/22 05:59

Кто определяет аппаратное обеспечение ИИ в 2026 году?

marsbit05/22 05:59

活动图片