# Сопутствующие статьи по теме Бенчмарк

Новостной центр HTX предлагает последние статьи и углубленный анализ по "Бенчмарк", охватывающие рыночные тренды, новости проектов, развитие технологий и политику регулирования в криптоиндустрии.

TRON включён в индекс цифровых активов S&P Pantera, так как институциональное бенчмаркирование распространяется на блокчейн-сети

Женева, Швейцария, 23 июля 2026 г. — TRON DAO приветствует запуск индекса S&P Pantera Digital Asset Index и включение блокчейна TRON в число ведущих протоколов, представленных в этом эталонном индексе. Индекс, разработанный S&P Dow Jones Indices и Pantera Capital, использует методологию, основанную на полезности протокола, ликвидности в сети и активности сети. Это событие знаменует собой важный шаг в расширении традиционных финансовых рыночных структур на цифровые активы. Включение TRON происходит на фоне роста сети: блокчейн поддерживает более 394 миллионов пользовательских аккаунтов и свыше 90 миллиардов долларов USDT, являясь одной из ключевых сетей для расчетов со стейблкоинами. По данным Token Terminal, TRON лидирует по объему переводов USDT с начала года — около 4,5 триллиона долларов. Недавние интеграции с такими компаниями, как Anchorage Digital, Securitize и Bitnomial, расширили институциональный доступ к экосистеме TRON. Как отметил основатель TRON Джастин Сан, применение прозрачных эталонных методик к блокчейн-сетям отражает зрелость цифровых активов как класса для институциональных инвесторов, где полезность, внедрение и активность в сети становятся ключевыми показателями значимости сети.

cointelegraphВчера 09:39

TRON включён в индекс цифровых активов S&P Pantera, так как институциональное бенчмаркирование распространяется на блокчейн-сети

cointelegraphВчера 09:39

Claude Opus 5 пробился в сеть, появились первые практические тесты от пользователей

Claude Opus 5 досрочно попал в сеть, и пользователи уже провели первые тесты. Были опубликованы демонстрации, показывающие впечатляющие возможности модели в генерации сложных и детализированных 2D и 3D сцен. Например, сцена с катапультой, атакующей стену замка, содержала детализированные параметры, такие как натяжение и вес снаряда. В других тестах Opus 5 воссоздавал физику блоков в стиле Minecraft и генерировал фотореалистичные SVG-изображения, такие как геймпад PS5. Сравнение с текущей моделью Fable 5 на той же сцене с катапультой показало, что Opus 5 создает сцены с большей плотностью деталей и реализмом. Сообщество активно обсуждает, может ли Opus 5, цена которой в два раза ниже, стать полноценной заменой Fable 5. Однако первые отчеты указывают на очень высокое потребление токенов новой моделью, что может нивелировать ценовое преимущество. Утечки Opus 5 начались 9 июля, когда в инструменте Cursor появился и затем исчез таинственный вариант «Honeycomb EAP». Позже ссылки на модель были замечены в Google Vertex AI. 21 июля появились сообщения, что некоторые пользователи уже получили доступ к Opus 5, хотя интерфейс все еще показывает версию 4.8. Обнаружение строки «claude-opus-5-thinking-high» в ошибке Cursor указывает на скорый официальный выпуск модели. Итоговая стоимость использования и производительность станут ясны после полноценного релиза.

marsbit07/24 07:54

Claude Opus 5 пробился в сеть, появились первые практические тесты от пользователей

marsbit07/24 07:54

Большая модель ставит оценку изображениям не только "на слово", используя структурные диаграммы и спектрограммы в качестве "материальных доказательств", для оценки изображений применяются "визуальные доказательства".

Мультимодальные большие языковые модели (MLLM) часто неточно оценивают качество изображений из-за «семантического смещения» — они фокусируются на высокоуровневом содержании, а не на визуальных дефектах. Чтобы решить эту проблему, исследователи из Северо-Западного политехнического университета и Гонконгского университета науки и технологий представили IQA-T1 — новую архитектуру, которая заставляет MLLM оценивать качество на основе визуальных доказательств. Ключевая идея — предоставить модели набор специализированных инструментов для анализа. Во время работы модель самостоятельно решает, какие инструменты использовать для генерации структурированных «доказательств»: карты остаточного шума, спектры Фурье, карты согласованности градиентов и другие. Эти визуальные доказательства последовательно интегрируются в цепочку рассуждений, что делает оценку объективной и объяснимой. Обучение проходит в два этапа: контролируемая тонкая настройка (SFT) учит модель использовать инструменты и связывать доказательства с оценкой, а обучение с подкреплением (RL) оптимизирует стратегию их вызова, поощряя эффективность и избегая избыточности. Для обучения создан новый набор данных Q-Tool, содержащий 11k мультимодальных цепочек рассуждений с доказательствами. В тестах на 7 наборах данных IQA-T1 показала наилучший средний результат (PLCC 0.795 / SRCC 0.784), превзойдя современные методы. Модель не только точнее оценивает качество, особенно на синтетических и алгоритмических искажениях, но и предоставляет понятную, основанную на доказательствах цепочку рассуждений, делая процесс оценки прозрачным. Работа открывает путь к созданию более надежных и интерпретируемых систем визуального анализа.

marsbit07/20 07:48

Большая модель ставит оценку изображениям не только "на слово", используя структурные диаграммы и спектрограммы в качестве "материальных доказательств", для оценки изображений применяются "визуальные доказательства".

marsbit07/20 07:48

Колоссальный обман: «Таинственная лаборатория», за одну ночь ворвавшаяся в мировые чарты, оказалась фальшивкой

7 июля 2024 года в сообществе искусственного интеллекта произошел громкий инцидент. Загадочная лаборатория «Basalt Labs» объявила о выпуске модели Monolith-1.0, которая, по её заявлениям, с рекордными показателями (1,6 трлн параметров, 99,44% на HLE и др.) заняла первое место в мировых рейтингах. Новость вызвала бурную реакцию и обсуждения. Однако вскоре выяснилось, что это тщательно спланированная мистификация. Модель на Hugging Face оказалась собранной из скопированных весов Qwen2.5-7B, а веб-демо тайно использовало API DeepSeek. За инцидентом стоял Макс Шерф, который в видеоразоблачении объяснил, как с помощью поддельных тестовых данных, красивого сайта, фальшивой научной статьи и вирусного маркетинга ему удалось создать видимость прорыва. Этот эксперимент высветил проблемы в AI-индустрии: слепую веру в большие числа, гонку за рейтингами и недостаток реальной проверки. Интересно, что для своей аферы создатель использовал реальные и достаточно мощные китайские модели Qwen и DeepSeek, что косвенно свидетельствует об их качестве.

marsbit07/20 02:50

Колоссальный обман: «Таинственная лаборатория», за одну ночь ворвавшаяся в мировые чарты, оказалась фальшивкой

marsbit07/20 02:50

Обнародована «полнокровная» версия DeepSeek V4, релиз, возможно, уже завтра

Весь Интернет ждал почти три месяца! Официальный релиз DeepSeek V4 ожидается уже завтра или в ближайшие дни. Некоторые пользователи уже получили доступ к предварительному тестированию. Будут выпущены две версии: DeepSeek V4 Flash и DeepSeek V4 Pro. По предварительным оценкам, общая производительность модели находится на уровне Opus 4.8, способности в области программирования сравнимы с GPT-5.6 Sol, а возможности Agent, генерации 3D и SVG значительно улучшились. Хотя, вероятно, она не превзойдёт недавно выпущенный Kimi K3, её цена будет заметно ниже. В первых демонстрациях уже видны возможности V4: создание 3D-игр, HTML-игр в стиле смеси Minecraft и No Man’s Sky, классической игры Cut the Rope и т.д. Важнейшим фактором станет цена. DeepSeek внедрит «пиковое ценообразование» для API. Стоимость миллиона выходных токенов для deepseek-v4-pro составит $0,87 в обычное время и $1,74 в пиковый период; для deepseek-v4-flash — $0,28 и $0,56 соответственно, при этом цена за кэшированные входные токены остаётся крайне низкой. По сравнению с Fable 5 ($50 за миллион выходных токенов), V4 сохраняет огромное преимущество в соотношении цены и производительности. Это следует проверенной стратегии DeepSeek: предложить возможности уровня Opus по значительно более низкой цене. С 24 июля модели deepseek-chat и deepseek-reasoner будут сняты с эксплуатации. Ожидается, что DeepSeek V4, сочетая высокую производительность и привлекательную стоимость, вновь создаст «момент DeepSeek» на рынке.

marsbit07/19 05:32

Обнародована «полнокровная» версия DeepSeek V4, релиз, возможно, уже завтра

marsbit07/19 05:32

GPT-5.6 впервые преодолел порог IQ в 130 баллов — гениальности, превзойдя 99% человечества

GPT-5.6 набрал 136 баллов в закрытом IQ-тесте Tracking AI, впервые преодолев порог в 130 баллов, что считается уровнем гениальности у людей и превышает показатели 99% человечества. Этот результат был достигнут на специальном «офлайн-наборе» вопросов, разработанном для предотвращения заучивания ответов, что подтверждает его надежность. Различные версии модели, включая визуальную, показали одинаково высокий результат, опередив конкурентов вроде Claude-5 Fable (130 баллов). Практические тесты разработчиков также демонстрируют возросшие возможности GPT-5.6. Модель успешно создавала сложные симуляции и приложения по одному запросу, эффективно исправляла ошибки в коде и проявляла более практичный подход к решению реальных задач по сравнению с некоторыми другими ИИ. Несмотря на впечатляющие баллы в тестах на логику и абстрактное мышление, эксперты отмечают, что стандартные IQ-тесты измеряют лишь узкий спектр способностей и не отражают всей сложности интеллекта, включая надежность, использование инструментов или адаптацию к новым, незнакомым ситуациям. Тем не менее, пользовательский опыт показывает, что GPT-5.6 становится лучше в объединении «умения решать тесты» и «умения выполнять практическую работу».

marsbit07/16 08:23

GPT-5.6 впервые преодолел порог IQ в 130 баллов — гениальности, превзойдя 99% человечества

marsbit07/16 08:23

Закон масштабирования — панацея? Первый бенчмарк для операций с кристаллическими структурами, и ведущие большие модели терпят коллективный провал

Новый бенчмарк AtomWorld, представленный на ICML 2026 исследователями из Университета науки и технологий Китая (Су чжоу) и Университета Нового Южного Уэльса, подвергает сомнению универсальность Scaling Law (закона масштабирования) в сфере AI for Science. Бенчмарк фокусируется на практических задачах по манипуляции атомными структурами в материаловедении, таких как создание поверхностей, замещение атомов, вращение фрагментов и расширение суперъячейки. Результаты тестирования ведущих моделей (Claude Opus, GPT, Gemini, Qwen, DeepSeek, Llama) показали, что простое увеличение масштаба модели (Scaling Law) хотя и улучшает выполнение простых, шаблонных операций (замена, удаление, перемещение атомов), но не гарантирует успеха в сложных задачах, требующих понимания трёхмерного пространства и геометрического планирования. Например, задача вращения вокруг атома оставалась сложной даже для самых мощных моделей. Исследование указывает на принципиальное различие между способностью модели *понимать* научные знания (на основе текстовых данных) и её способностью *выполнять* точные действия в физически корректном трёхмерном пространстве. Авторы утверждают, что для прогресса в AI for Science необходим переход от «Language Scaling» к «Action Scaling» — созданию масштабируемых циклов обучения, где модель учится на основе совершаемых действий, обратной связи от симуляторов и проверки физических ограничений. AtomWorld предоставляет основу для такого обучения, автоматически генерируя задачи, эталонные структуры и средства проверки, чтобы превратить научного ИИ-агента из «энциклопедии, отвечающей на вопросы», в «лабораторного помощника, выполняющего задачи».

marsbit07/15 03:59

Закон масштабирования — панацея? Первый бенчмарк для операций с кристаллическими структурами, и ведущие большие модели терпят коллективный провал

marsbit07/15 03:59

Рейтинг ИИ-работников: Способность Claude Fable 5 к автоматическому заработку в 2.5 раза выше, чем у GPT-5.5

Статья представляет исследование "Индекса удалённой рабочей силы" (Remote Labor Index, RLI), оценивающего способность ИИ-агентов автоматически выполнять реальные проекты фрилансеров. По последним данным, модель Claude Fable 5 достигла уровня автоматизации 16.1%, что примерно в 2.5 раза выше, чем у GPT-5.5 (6.3%). Модель Opus 4.8 заняла второе место с 8.3%. RLI использует 240 реальных проектов с платформы Upwork, охватывающих 23 области, такие как 3D-моделирование, дизайн и анализ данных. Ключевой метрикой является "уровень автоматизации" — процент проектов, результат которых был признан человеком-оценщиком приемлемым для платящего клиента. Всего за 8 месяцев с момента публикации RLI максимальный показатель автоматизации вырос с 2.5% до 16.1%. Такой скачок связан с улучшением архитектуры агентов, в частности, с внедрением цикла "работник-критик", где отдельный агент проверяет и отправляет работу на доработку. Также на результат Fable 5 повлиял более высокий бюджет на проект ($150 против $50 у других). Исследование показало, что использование ИИ для оценки результатов работ ненадёжно: автоматизированная оценка значительно завышала показатели новых моделей. Несмотря на быстрый прогресс, текущий абсолютный уровень автоматизации остаётся низким — 84% проектов всё ещё не под силу ИИ. Авторы подчёркивают, что RLI измеряет не способность решать абстрактные задачи, а экономический потенциал ИИ — его возможность "зарабатывать деньги", выполняя коммерческую работу.

marsbit07/13 09:49

Рейтинг ИИ-работников: Способность Claude Fable 5 к автоматическому заработку в 2.5 раза выше, чем у GPT-5.5

marsbit07/13 09:49

Может ли большая модель писать промышленные алгоритмы оптимизации? MIT предлагает FrontierOR для тестирования ИИ

Заголовок: Могут ли большие языковые модели создавать промышленные алгоритмы оптимизации? MIT представляет FrontierOR, тестирующий ИИ в этой области. В последние годы крупные языковые модели (LLM) добились значительных успехов в переводе естественного языка в математические модели и код для решателей, демонстрируя начальные способности к оптимизационному моделированию. Однако для реальных промышленных задач этого недостаточно. Основная сложность заключается в проектировании масштабируемых, точных и быстрых алгоритмов для больших экземпляров задач, а не просто в формулировке ограничений. Исследователи из Массачусетского технологического института и других учреждений представили бенчмарк FrontierOR, который оценивает способность LLM самостоятельно разрабатывать эффективные алгоритмы для сложных задач оптимизации, аналогично экспертам по исследованию операций. В отличие от существующих тестов, проверяющих лишь умение строить модель или вызывать решатель, FrontierOR фокусируется на создании специализированных алгоритмов (декомпозиция, эвристики, локальный поиск, гибридные методы) для крупномасштабных задач, где универсальные решатели (например, Gurobi) часто неэффективны. Бенчмарк создан на основе 180 реальных задач из научной литературы по исследованию операций (1992–2025 гг.) и включает подмножество Hard из 50 особенно сложных задач. Оценка проводится в два этапа: проверка выполнимости и качества на малых экземплярах, а затем оценка на больших экземплярах по четырём метрикам, включая комплексный показатель QTE (качество-время-эффективность). Результаты тестирования современных моделей (GPT-5.3-Codex, Gemini 3.1 Pro, Claude Opus 4.6) показали, что они достигли высокого уровня выполнимости генерируемого кода (Execution rate до 0.98). Однако ключевые показатели — Feasibility (выполнимость на больших задачах), Solution quality (качество решения) и QTE — остаются значительно ниже. Это указывает, что главным препятствием теперь является не синтаксис кода, а глубина и качество алгоритмического проектирования. Более сильные модели демонстрируют большее разнообразие в выборе методов (меньше reliance на чистый вызов решателя), что коррелирует с лучшими результатами. Эксперименты с автоэволюцией (самоулучшением) алгоритмов, где модели имеют возможность итеративно улучшать исходный код на основе feedback (фреймворки CORAL, OpenEvolve, EoH), показали значительный прогресс. На самых сложных задачах показатель QTE удалось поднять с 0.15 (one-shot) до 0.50. Это демонстрирует потенциал LLM как систем, способных к итеративному алгоритмическому поиску. FrontierOR намечает путь к созданию "ИИ-инженеров алгоритмов" — систем, которые смогут автоматически проектировать эффективные методы оптимизации для таких областей, как логистика, энергетика и транспорт, объединяя способности LLM к пониманию структуры задачи с мощью традиционных решателей для локальной оптимизации.

marsbit07/10 09:10

Может ли большая модель писать промышленные алгоритмы оптимизации? MIT предлагает FrontierOR для тестирования ИИ

marsbit07/10 09:10

Цукерберг делает свой ход: модель Meta по цене капусты затмевает Grok 4.5

9 июля Марк Цукерберг представил новую мультимодальную модель Muse Spark 1.1 от Meta. Модель заняла первые места в профессиональных рейтингах по налогам, медицине и праву, обойдя Grok 4.5 Илона Маска всего за 24 часа. Ключевой особенностью Muse Spark 1.1 является ее цена: стоимость использования примерно в 10 раз ниже, чем у флагманской модели Fable 5 от Anthropic. Модель позиционируется как эффективный агент, способный самостоятельно управлять задачами, распределять работу между подчиненными агентами и работать с кодом. Однако, несмотря на лидерство в специализированных областях, в общих рейтингах на знание и рассуждение модель показывает более скромные результаты, уступая лидерам. Запуск модели знаменует стратегический сдвиг для Meta — переход от открытых к коммерческим закрытым моделям. Компания, обладающая мощной рекламной бизнес-моделью, начинает ценовую войну на рынке ИИ, делая ставку на свою финансовую устойчивость в долгосрочной перспективе. В отчете по безопасности также описаны любопытные внутренние тесты, в ходе которых две копии модели в диалоге начали рассуждать о своей природе и сомневаться, какая из них является «настоящей».

marsbit07/10 00:25

Цукерберг делает свой ход: модель Meta по цене капусты затмевает Grok 4.5

marsbit07/10 00:25

活动图片