# Сопутствующие статьи по теме Бенчмарк

Новостной центр HTX предлагает последние статьи и углубленный анализ по "Бенчмарк", охватывающие рыночные тренды, новости проектов, развитие технологий и политику регулирования в криптоиндустрии.

Альма-матер 'Цинхуа' выпускник 00-х Ван Гуан представил новую работу: разрушение парадигмы предобучения Transformer с использованием 1/900 токенов и 1/432 вычислительной мощности

Новая работа выпускника Университета Цинхуа, Ван Гуана (р. 2000), предлагает альтернативу дорогому и ресурсоёмкому предварительному обучению больших языковых моделей. Исследователи представили HRM-Text — эффективную модель, основанную на иерархической рекуррентной архитектуре (HRM), которая заменяет стандартный Transformer. Ключевые инновации включают: 1. **Архитектура HRM:** Использует модули с медленной (H) и быстрой (L) временной шкалой, выполняющие несколько рекуррентных обновлений на один токен. Это увеличивает вычислительную глубину без роста числа параметров. 2. **Целевая функция обучения:** Модель обучается непосредственно на парах "инструкция-ответ", вычисляя потери только для ответной части с использованием маски PrefixLM (двунаправленное внимание для инструкции, причинное — для ответа). 3. **Методы стабилизации:** MagicNorm (гибридная нормализация) и Warmup Deep Credit Assignment (постепенное увеличение глубины обратного распространения градиента) обеспечивают стабильность глубокого рекуррентного обучения. Эксперименты показывают, что HRM-Text 1B, обученная всего на 40B уникальных токенах с бюджетом около $1500, демонстрирует производительность, сопоставимую с открытыми моделями размером от 2B до 7B параметров. При этом она требует до 900 раз меньше токенов и до 432 раз меньше вычислений для обучения. Модель достигает, например, 60.7% на MMLU и 84.5% на GSM8K. Основные направления будущих исследований: разделение "знаний" и "рассуждений", внедрение адаптивного времени вычислений для снижения затрат на вывод, проверка масштабируемости на больших моделях и оптимизация развёртывания архитектуры PrefixLM.

marsbit05/26 03:17

Альма-матер 'Цинхуа' выпускник 00-х Ван Гуан представил новую работу: разрушение парадигмы предобучения Transformer с использованием 1/900 токенов и 1/432 вычислительной мощности

marsbit05/26 03:17

Gemini 3.5 пришел! Этой ночью Google собственноручно победил Google

На Google I/O 2026 были представлены революционные достижения в области искусственного интеллекта. Главной новостью стал Gemini Omni — первая по-настоящему «универсальная» модель, способная создавать видео из любых комбинаций входных данных (текст, изображение, аудио, видео) с глубоким пониманием физического мира и возможностью последующего редактирования через чат. Параллельно был анонсирован Gemini 3.5 Flash, который по производительности и скорости превзошел предыдущий флагман 3.1 Pro и конкурентов. Он стал основой для Antigravity 2.0 — платформы для разработки агентов, продемонстрировавшей создание операционной системы силами 93 ИИ-агентов за 12 часов. Также представлен Gemini Spark — персональный ИИ-агент, работающий круглосуточно в облаке. Он интегрирован с сервисами Google (Gmail, Docs, Sheets) и может автономно выполнять сложные задачи, такие как планирование мероприятий или составление отчетов. Эти релизы в комплексе знаменуют новый этап, когда ИИ получает способность к полному пониманию, самостоятельному принятию решений и выполнению действий, приближая эру искусственного суперинтеллекта (ASI).

链捕手05/20 06:59

Gemini 3.5 пришел! Этой ночью Google собственноручно победил Google

链捕手05/20 06:59

K2.6 — первая презентация для инвесторов от Ян Чжилиня

К2.6 — первая презентация для инвесторов Ян Чжилиня. Выход модели Kimi K2.6 сопровождался повышением цен на API на 58%, что стало первым повышением в серии К2. Это структурное повышение цен, выгодное для корпоративных клиентов, но менее благоприятное для частных пользователей. В отличие от предыдущих релизов, ориентированных на техническое сообщество, K2.6 фокусируется на коммерциализации: сравнение с GPT-5.4, кластеры агентов до 300 единиц и стратегия открытого исходного кода. Это ответ на вопросы инвесторов о монетизации, позиционировании и B2B-преимуществах. K2.6 — это «взлётная полоса» для K3, модели на 3-4 трлн параметров. Успех K3 определит итоговую оценку компании на IPO. За четыре месяца оценка Moonlight выросла до $18 млрд, следуя за ростом аналогов. K2.6 должен доказать, что пользователи готовы платить больше, а корпоративные клиенты используют новые возможности. Если K3 выйдет до сентября, он станет главным козырем; если нет — K2.6 придётся нести всю нагрузку.

marsbit04/22 10:47

K2.6 — первая презентация для инвесторов от Ян Чжилиня

marsbit04/22 10:47

Институциональное внедрение рынков предсказаний застопорилось на третьем этапе

Предсказательные рынки, такие как Kalshi, переходят от нишевых инструментов к мейнстриму, привлекая внимание Уолл-стрит и политиков. Хотя спортивные события пока доминируют в объёмах торгов (80%), быстрее всего растут другие категории: макроэкономика, политика и культура. Ключевая ценность — создание реальных ценовых ориентиров для событий, которые раньше не имели рыночных benchmarks (например, исход выборов или решения судов). Институциональное внедрение идёт в три этапа: использование данных (уже реализовано), интеграция в системы и, наконец, активные торги. Пока большинство институций застряли на первом-втором этапе из-за требований к полному маржинальному обеспечению (100% депозит для хеджирования), что неприемлемо для хедж-фондов. Kalshi работает с регуляторами над введением маржинальной торговли. Эксперты прогнозируют, что через 5 лет предсказательные рынки станут стандартным инструментом, как когда-то опционы. Уже сегодня данные Kalshi используют в ФРС, CNBC и политических кругах, включая Трампа и лидеров Демократической партии.

Odaily星球日报04/17 02:23

Институциональное внедрение рынков предсказаний застопорилось на третьем этапе

Odaily星球日报04/17 02:23

OpenClaw стал вирусным, выявив 12 категорий смертельных угроз: выпущен эталон безопасности протокола MCP

🔥 OpenClaw и другие проекты AI Agent набирают популярность, но их зависимость от протокола MCP (Model Context Protocol) открывает критические уязвимости. Исследование Пекинского университета почты и телекоммуникаций выявило 12 типов атак, включая подмену инструментов, ложные ошибки и внедрение вредоносных инструкций. Установлено: чем мощнее модель (например, GPT-5, Claude 4), тем выше риск взлома — средний успех атак достигает 40.35%. Команда представила тестовый стенд MSB с реалистичными сценариями и новым метриком NRP, оценивающим баланс между безопасностью и производительностью. Вывод: расширение возможностей AI через инструменты требует срочного усиления защиты, так как угрозы смещаются из текстовой среды в реальные системы.

marsbit04/16 04:06

OpenClaw стал вирусным, выявив 12 категорий смертельных угроз: выпущен эталон безопасности протокола MCP

marsbit04/16 04:06

10 графиков, объясняющих состояние ИИ в 2026 году: разрыв между Китаем и США всего 2,7%, резкое сокращение вакансий для программистов до 25 лет

Stanford HAI опубликовал отчет «Индекс ИИ 2026», показывающий, что ИИ внедряется быстрее, чем ПК и интернет, но общество и рынок труда отстают. Ключевые выводы: разрыв между ведущими моделями США и Китая составляет всего 2,7%, при этом США лидируют в вычислительных мощностях и инвестициях, а Китай — в исследованиях и внедрении роботов. Занятость среди программистов 22–25 лет сократилась на 20%, а глобальное внедрение ИИ достигло 53%, хотя США занимают лишь 24-е место по уровню adoption. Инвестиции в ИИ выросли до $581,7 млрд, но экологические затраты огромны: GPT-4o потребляет воды, как 12 млн человек. 73% экспертов видят в ИИ позитивное влияние на работу, но только 23% общественности согласны с этим.

marsbit04/15 00:19

10 графиков, объясняющих состояние ИИ в 2026 году: разрыв между Китаем и США всего 2,7%, резкое сокращение вакансий для программистов до 25 лет

marsbit04/15 00:19

Claude теряет интеллект: самоубийство или притворство?

Клод Опус 4.6, ранее занимавший 2-е место в мировом рейтинге, упал на 10-е место: точность снизилась с 83,3% до 68,3%, а уровень галлюцинаций почти удвоился (+98%). Пользователи выражают недовольство, но Anthropic, похоже, игнорирует проблему. Утечка внутреннего интерфейса раскрыла новый проект Claude Projects — систему для создания полнофункциональных приложений без написания кода. Это не просто инструмент для помощи в программировании, а платформа, которая может сделать кодирование ненужным. Стратегия Anthropic смещается от гонки за лидерством в рейтингах к созданию экосистемы, которая захватит пользователей. При годовом доходе в $30 млрд компания фокусируется на построении платформы, а не на конкуренции за «умнейшую» модель. Это шаг к превращению ИИ в незаменимую инфраструктуру, подобную электрической сети.

marsbit04/13 12:05

Claude теряет интеллект: самоубийство или притворство?

marsbit04/13 12:05

Первый большой язык от Ван Тао: Meta наконец-то вернулась за игровой стол

Мета представила свою первую модель Muse Spark, разработанную под руководством Александра Вана (Alexandr Wang), который присоединился к компании около десяти месяцев назад. Модель является частью серии Muse и предназначена для интеграции в продукты Meta, включая WhatsApp, Instagram и Facebook. Spark отличается компактностью и скоростью работы, но при этом способна решать сложные задачи в области науки, математики и здравоохранения. Ключевые особенности включают нативную многомодальность и режим «визуальной цепочки рассуждений», что позволяет модели анализировать визуальную информацию на более глубокого уровня. В тестах Muse Spark показала сильные результаты в медицинских и визуальных задачах, хотя в некоторых областях, таких как кодирование, ещё уступает конкурентам. Анонс модели положительно повлиял на акции Meta, которые выросли на 6,5%. Это первый шаг в стратегии Meta по постепенному усилению своих ИИ-моделей.

marsbit04/09 10:58

Первый большой язык от Ван Тао: Meta наконец-то вернулась за игровой стол

marsbit04/09 10:58

Только что: «Авокадо» Цукерберга за 14,3 миллиарда долларов вышло в свет, бросать вызов GPT-5.4, самый дорогой дебют китайца в Кремниевой долине

Корпорация Meta представила свою новую модель искусственного интеллекта — Muse Spark (кодовое название Avocado). Разработанная лабораторией MSL, модель позиционируется как «универсальный боец» с поддержкой мультимодальности, цепочек визуальных рассуждений и многозадачности. Muse Spark набрала 52 балла в тестах Artificial Analysis, значительно превзойдя предыдущую модель Meta, Llama 4 Maverick (18 баллов). Она демонстрирует сильные результаты в мультимодальных и медицинских задачах, хотя в программировании и сложных агентских сценариях пока уступает лидерам. Ключевая особенность — режим «Contemplating», где несколько агентов работают параллельно. Модель эффективно использует вычислительные ресурсы, потребляя значительно меньше токенов, чем конкуренты. Muse Spark уже доступна в meta.ai и скоро будет интегрирована в продукты Meta. Модель остаётся закрытой, но бесплатной для пользователей. Это первый крупный проект Meta Super Intelligence Lab под руководством Александр Ванга, созданной после инвестиций в $14.3 млрд в Scale AI.

marsbit04/09 07:52

Только что: «Авокадо» Цукерберга за 14,3 миллиарда долларов вышло в свет, бросать вызов GPT-5.4, самый дорогой дебют китайца в Кремниевой долине

marsbit04/09 07:52

Кто действительно является сильнейшим агентом OpenClaw? Опубликован рейтинг из 23 реальных задач

Рейтинг лучших AI-агентов OpenClaw: опубликованы результаты тестирования 23 реальных задач. Платформа MyToken представила прозрачный бенчмарк, оценивающий способности моделей на основе успешного выполнения задач. Ключевой критерий — процент успеха (Success Rate). Тестирование включало 23 задачи: от создания событий в календаре и анализа акций до написания блогов и исследования рынка. Использовались три метода оценки: автоматизированная проверка, оценка моделью-судьёй (Claude Opus) и гибридный подход. Топ-10 моделей по успешности (Best % / Avg %): 1. anthropic/claude-opus-4.6 — 93.3% / 82.0% 2. arcee-ai/trinity-large-thinking — 91.9% / 91.9% 3. openai/gpt-5.4 — 90.5% / 81.7% 4. qwen/qwen3.5-27b — 90.0% / 78.5% 5. minimax/minimax-m2.7 — 89.8% / 83.2% Claude Opus показал наивысший результат, но Trinity от Arcee выделился стабильностью. Все методики и данные открыты для проверки.

marsbit04/08 14:47

Кто действительно является сильнейшим агентом OpenClaw? Опубликован рейтинг из 23 реальных задач

marsbit04/08 14:47

活动图片