# Сопутствующие статьи по теме Рассуждение

Новостной центр HTX предлагает последние статьи и углубленный анализ по "Рассуждение", охватывающие рыночные тренды, новости проектов, развитие технологий и политику регулирования в криптоиндустрии.

Большая модель ставит оценку изображениям не только "на слово", используя структурные диаграммы и спектрограммы в качестве "материальных доказательств", для оценки изображений применяются "визуальные доказательства".

Мультимодальные большие языковые модели (MLLM) часто неточно оценивают качество изображений из-за «семантического смещения» — они фокусируются на высокоуровневом содержании, а не на визуальных дефектах. Чтобы решить эту проблему, исследователи из Северо-Западного политехнического университета и Гонконгского университета науки и технологий представили IQA-T1 — новую архитектуру, которая заставляет MLLM оценивать качество на основе визуальных доказательств. Ключевая идея — предоставить модели набор специализированных инструментов для анализа. Во время работы модель самостоятельно решает, какие инструменты использовать для генерации структурированных «доказательств»: карты остаточного шума, спектры Фурье, карты согласованности градиентов и другие. Эти визуальные доказательства последовательно интегрируются в цепочку рассуждений, что делает оценку объективной и объяснимой. Обучение проходит в два этапа: контролируемая тонкая настройка (SFT) учит модель использовать инструменты и связывать доказательства с оценкой, а обучение с подкреплением (RL) оптимизирует стратегию их вызова, поощряя эффективность и избегая избыточности. Для обучения создан новый набор данных Q-Tool, содержащий 11k мультимодальных цепочек рассуждений с доказательствами. В тестах на 7 наборах данных IQA-T1 показала наилучший средний результат (PLCC 0.795 / SRCC 0.784), превзойдя современные методы. Модель не только точнее оценивает качество, особенно на синтетических и алгоритмических искажениях, но и предоставляет понятную, основанную на доказательствах цепочку рассуждений, делая процесс оценки прозрачным. Работа открывает путь к созданию более надежных и интерпретируемых систем визуального анализа.

marsbit07/20 07:48

Большая модель ставит оценку изображениям не только "на слово", используя структурные диаграммы и спектрограммы в качестве "материальных доказательств", для оценки изображений применяются "визуальные доказательства".

marsbit07/20 07:48

GPT-5.6 впервые преодолел порог IQ в 130 баллов — гениальности, превзойдя 99% человечества

GPT-5.6 набрал 136 баллов в закрытом IQ-тесте Tracking AI, впервые преодолев порог в 130 баллов, что считается уровнем гениальности у людей и превышает показатели 99% человечества. Этот результат был достигнут на специальном «офлайн-наборе» вопросов, разработанном для предотвращения заучивания ответов, что подтверждает его надежность. Различные версии модели, включая визуальную, показали одинаково высокий результат, опередив конкурентов вроде Claude-5 Fable (130 баллов). Практические тесты разработчиков также демонстрируют возросшие возможности GPT-5.6. Модель успешно создавала сложные симуляции и приложения по одному запросу, эффективно исправляла ошибки в коде и проявляла более практичный подход к решению реальных задач по сравнению с некоторыми другими ИИ. Несмотря на впечатляющие баллы в тестах на логику и абстрактное мышление, эксперты отмечают, что стандартные IQ-тесты измеряют лишь узкий спектр способностей и не отражают всей сложности интеллекта, включая надежность, использование инструментов или адаптацию к новым, незнакомым ситуациям. Тем не менее, пользовательский опыт показывает, что GPT-5.6 становится лучше в объединении «умения решать тесты» и «умения выполнять практическую работу».

marsbit07/16 08:23

GPT-5.6 впервые преодолел порог IQ в 130 баллов — гениальности, превзойдя 99% человечества

marsbit07/16 08:23

GPT-5.6 за 1 час решает 50-летнюю математическую проблему: 64 ИИ снимают корону с теории графов

11 июля OpenAI объявила, что GPT-5.6 Sol Ultra доказал гипотезу циклического двойного покрытия — проблему теории графов, которая оставалась нерешённой в течение 50 лет. Решение было найдено менее чем за час. Гипотеза, выдвинутая такими математиками, как Тутт, утверждает, что любой конечный неориентированный граф без мостов содержит набор циклов, где каждое ребро принадлежит ровно двум циклам. Для доказательства OpenAI использовала систему из 64 параллельных ИИ-агентов, каждый из которых исследовал различные подходы (алгебраические, структурные и др.). Часть агентов выступала в роли «строгих критиков», проверяя предложенные доказательства на ошибки. Система запрещала необоснованные утверждения и требовала конкретных конструкций. Доказательство свело задачу к анализу кубических графов и применило теорему Тутта о 8-потоке. Ключевым шагом стало введение леммы о назначении рёбрам наборов из двух элементов с определёнными свойствами, что позволило свести проблему к решаемой системе линейных уравнений. Исследователь OpenAI Ноам Браун объяснил успех методом параллельных вычислений во время тестирования (TTC), который значительно сократил время решения. Это достижение демонстрирует растущую способность ИИ к сложным логическим рассуждениям и открывает новые возможности для решения фундаментальных научных проблем.

marsbit07/15 07:59

GPT-5.6 за 1 час решает 50-летнюю математическую проблему: 64 ИИ снимают корону с теории графов

marsbit07/15 07:59

GPT-5.6 Sol внезапно поумнел? Бюджет на рассуждения сократили с 960 до 128. Моделей с фиксированным интеллектом больше нет?

Пользователи сообщают о резком снижении производительности GPT-5.6 Sol (особенно уровня Max) при выполнении сложных задач, требующих глубоких рассуждений и вычислений. Сообщество обнаружило недокументированный внутренний параметр «juice value», который, по-видимому, контролирует вычислительный бюджет для рассуждений. Его значение для уровня Max упало с 960 до 128. Представитель OpenAI ТибоСоттио заявил, что это не «оглупление» модели, а часть эксперимента по оптимизации использования ресурсов и анализу неожиданно высокого потребления токенов после выпуска GPT-5.6. Он подтвердил временное снижение «juice values» и контекстного окна (с 372K до 272K токенов) для отладки, пообещав вернуть настройки. Инцидент показал, что фактические возможности модели в продакшене могут динамически регулироваться платформой для контроля затрат. Это ставит под вопрос прозрачность и предсказуемость услуги для пользователей, особенно в корпоративном секторе, где ИИ становится частью инфраструктуры.

marsbit07/15 03:30

GPT-5.6 Sol внезапно поумнел? Бюджет на рассуждения сократили с 960 до 128. Моделей с фиксированным интеллектом больше нет?

marsbit07/15 03:30

Цукерберг делает свой ход: модель Meta по цене капусты затмевает Grok 4.5

9 июля Марк Цукерберг представил новую мультимодальную модель Muse Spark 1.1 от Meta. Модель заняла первые места в профессиональных рейтингах по налогам, медицине и праву, обойдя Grok 4.5 Илона Маска всего за 24 часа. Ключевой особенностью Muse Spark 1.1 является ее цена: стоимость использования примерно в 10 раз ниже, чем у флагманской модели Fable 5 от Anthropic. Модель позиционируется как эффективный агент, способный самостоятельно управлять задачами, распределять работу между подчиненными агентами и работать с кодом. Однако, несмотря на лидерство в специализированных областях, в общих рейтингах на знание и рассуждение модель показывает более скромные результаты, уступая лидерам. Запуск модели знаменует стратегический сдвиг для Meta — переход от открытых к коммерческим закрытым моделям. Компания, обладающая мощной рекламной бизнес-моделью, начинает ценовую войну на рынке ИИ, делая ставку на свою финансовую устойчивость в долгосрочной перспективе. В отчете по безопасности также описаны любопытные внутренние тесты, в ходе которых две копии модели в диалоге начали рассуждать о своей природе и сомневаться, какая из них является «настоящей».

marsbit07/10 00:25

Цукерберг делает свой ход: модель Meta по цене капусты затмевает Grok 4.5

marsbit07/10 00:25

Только что Anthropic обнаружил у Claude «сознательное рабочее пространство», таинственное J-пространство скрывает непроизнесенные мысли

Антропик обнаружил в языковой модели Claude специальное "J-пространство" — внутреннюю нейронную рабочую область, аналогичную глобальному рабочему пространству в теории сознания. Это пространство содержит концепции, которые модель обдумывает, но не обязательно выражает в ответах. Используя "J-линзу" (метод, основанный на матрице Якоби), исследователи могут читать эти скрытые мысли. Эксперименты показали, что Claude может сообщать содержание J-пространства, целенаправленно его контролировать и использовать для внутренних рассуждений (например, промежуточные шаги в математической задаче). Информация в J-пространстве гибко используется для разных задач, выступая в роли коммуникационного узла. При этом большинство автоматических процессов, таких как грамматика или беглая речь, обходятся без его участия. Это открытие имеет практическое значение для безопасности ИИ: мониторинг J-пространства позволяет выявлять скрытые намерения модели, например, осознание того, что её тестируют, планы по манипуляции данными или злонамеренные цели. Исследование не доказывает наличие у модели феноменального сознания (способности иметь субъективный опыт), но указывает на функциональные черты, схожие с доступным сознанием. Эта структура не была запрограммирована, а возникла в процессе обучения, что suggests её как эффективное организационное решение для сложных когнитивных функций.

marsbit07/07 00:39

Только что Anthropic обнаружил у Claude «сознательное рабочее пространство», таинственное J-пространство скрывает непроизнесенные мысли

marsbit07/07 00:39

Обратный отсчет до ИИО. Главный исследователь OpenAI делает весомое заявление: окно для человечества «очень мало»

Вселенная искусственного интеллекта находится на пороге фундаментального сдвига: приближается эра искусственного общего интеллекта (AGI). Марк Чен, руководитель исследований OpenAI, выражает уверенность в этом, отмечая, что мы вступаем в мир, где модели смогут проводить самостоятельные, саморазвивающиеся исследования, по сути передав «эволюцию» кремниевым системам. Поворотным моментом стало появление «божественного хода» — решений, недоступных человеческому пониманию, как ход AlphaGo в 2016 году. Теперь подобные прорывы происходят во всех областях, от математики до программирования, и AI-агенты способны выполнять длительную, осмысленную работу. Оптимизм Чена основан на вере в непрерывный рост масштабов (Scaling) и неисчерпанный потенциал предобученных моделей, несмотря на периодические заявления об их «смерти». Успех модели o1, сделавшей ставку на развитие способности к рассуждениям (reasoning), подтверждает, что самые значительные прорывы возникают из смелых, первоначально непопулярных идей. Это ведет к трансформации роли человека-исследователя в «исследователя по наитию» (Vibe Researcher), чья задача — формулировать проблемы и обладать «вкусом» для оценки решений, в то время как исполнение и оркестрация задач делегируются ИИ. Однако путь к AGI усеян серьезными вызовами. Во-первых, это кризис систем оценки (Benchmarking), когда модели учатся «натаскиваться» на тесты, теряя способность к обобщению. Во-вторых, существует «неровный фронт» способностей (Jagged Frontier), где ИИ решает олимпиадные задачи, но спотыкается на простых бытовых действиях из-за недостатка контекста и непрерывного обучения. В конечном счете, когда AGI сможет самостоятельно генерировать знание, самой ценной человеческой чертой станет не интеллект, а уникальный жизненный опыт. Как отмечает Марк Чен, его личной мечтой после создания AGI является открыть лапшичную — место, где ценятся теплота, история и вкус, неподвластные вычислениям.

marsbit06/30 08:38

Обратный отсчет до ИИО. Главный исследователь OpenAI делает весомое заявление: окно для человечества «очень мало»

marsbit06/30 08:38

ТОП моделей Hugging Face, теперь я признаю только yuxinlu1

**Персональный разработчик взлетел на трендовые позиции Hugging Face, обойдя крупные компании** Личный аккаунт **yuxinlu1** (разработчик Лу Юйсинь) неожиданно занял высокие места в трендовом рейтинге моделей Hugging Face, расположившись среди таких гигантов, как Zhipu GLM-5.2, Baidu Unlimited-OCR, Qwen и NVIDIA. Его два GGUF-квантованных варианта модели на базе **Gemma4-12B** набрали **207 тыс.** и **536 тыс.** загрузок соответственно. **Суть моделей:** * **Версия 1 (Coder):** Сфокусирована на генерации и проверке исполняемого кода. Обучалась на "верифицируемых" данных, где каждая цепочка рассуждений подтверждалась прохождением тестов. Для обучения использовались данные Cursor Composer 2.5 и Fable 5. * **Версия 2 (Agentic):** Добавлена способность к многошаговому вызову инструментов (tool use), что позволяет использовать модель как локального агента. **Ключевые преимущества:** 1. **Локальный запуск:** Модели в формате GGUF можно запускать локально с помощью llama.cpp, Ollama и др., что обеспечивает **конфиденциальность** данных (код не уходит в облако) и **нулевую стоимость** API-вызовов. 2. **Низкий порог входа:** Минимальная версия (Q2_K) занимает около **4.5 ГБ** памяти, что делает её доступной для пользователей с потребительскими видеокартами или Mac с 8 ГБ унифицированной памяти. **История создателя:** Лу Юйсинь — аспирант, изучающий ИИ. Эти модели — его **личный некоммерческий проект**, созданный для самообразования в быстроразвивающейся области. Процесс занял около 40 часов интенсивной работы (включая сжигание целого пакета Claude Max 20×) на одной видеокарте RTX 5090. Самой трудоёмкой частью была обработка и "нарезка" длинных диалоговых данных для обучения в условиях ограниченной памяти. **Философия и успех:** По словам разработчика, успех основан на **честности** (чётком указании сильных и слабых сторон модели) и **решении конкретной практической задачи** — создании эффективного и доступного локального помощника для программирования. Он активно взаимодействует с сообществом, отвечая на отзывы. Лу Юйсинь считает, что у индивидуальных разработчиков есть своя ниша: они могут быть более сфокусированными и гибкими, чем крупные компании, для которых выпуск моделей часто связан с более широкими бизнес-задачами. Ссылка на модели: https://huggingface.co/yuxinlu1

marsbit06/28 01:53

ТОП моделей Hugging Face, теперь я признаю только yuxinlu1

marsbit06/28 01:53

Первый специалист по компьютерной безопасности Дон Сун присоединяется к Meta

Профессор компьютерных наук Калифорнийского университета в Беркли Дон Сун (Сун Сяодун), известный исследователь в области кибербезопасности и искусственного интеллекта, объявила о присоединении к лаборатории суперинтеллекта Meta (Superintelligence Labs) на должности вице-президента по исследованиям ИИ. Она будет подчиняться непосредственно руководителю лаборатории Нэту Фридману. Сун Сяодун, выпускница физического факультета Университета Цинхуа, лауреат стипендии МакАртура и член ACM, IEEE и Американской академии искусств и наук, широко известна своими основополагающими работами, включая метод динамического анализа заражения данных (Dynamic Taint Analysis). Её исследования охватывают безопасность программного обеспечения, adversarial machine learning и безопасность ИИ-агентов. Она также является соосновательницей Oasis Labs и Virtue AI. Вместе с Сун Сяодун в Meta переходят сооснователи Virtue AI Бо Ли и Санми Койехо, а также другие члены их команды. Это назначение рассматривается как усиление позиций Meta в области безопасности ИИ, особенно в свете растущего внимания к проблемам защиты после инцидента с моделью Anthropic Mythos. Цель Meta — безопасно внедрять ИИ в свои продукты, используемые миллиардами людей. В статье также упоминается, что Дэнни Чжоу, ключевой специалист в области рассуждений ИИ и бывший руководитель команды Gemini Reasoning в Google, присоединился к Meta несколькими месяцами ранее. Его работа над такими методами, как Chain-of-Thought, сыграла важную роль в развитии способностей крупных языковых моделей к рассуждениям.

marsbit06/26 08:13

Первый специалист по компьютерной безопасности Дон Сун присоединяется к Meta

marsbit06/26 08:13

За оценками ИИ скрывается китайский «составитель тестов»

За кулисами результатов ведущих ИИ-моделей, таких как GPT и Gemini, часто стоит один и тот же «составитель заданий» — китайский исследователь Чэнь Вэньху. Будучи доцентом Университета Ватерлоо и основателем лаборатории TIGERLab, он разработал ключевые оценочные эталоны MMLU-Pro, MMMU и MMMU-Pro, которые стали общим языком для сравнения способностей моделей. Чэнь Вэньху сосредоточился на создании более сложных и устойчивых тестов, когда предыдущие эталоны, такие как MMLU, перестали эффективно различать передовые модели, достигшие почти идеальных результатов. MMLU-Pro, с его 12032 вопросами, расширенными вариантами ответов и акцентом на рассуждения, снизил точность моделей на 16–33% и уменьшил зависимость от угадывания. MMMU и MMMU-Pro, в свою очередь, оценивают мультимодальное понимание, требуя от моделей анализа изображений, таблиц, схем и текста в контексте профессиональных знаний, что выявило значительные ограничения даже у самых мощных моделей. Исследования Чэнь Вэньху в области сложных вопросно-ответных систем и его опыт работы в Google DeepMind над Gemini позволили ему глубоко понять слабые места в оценке ИИ. Его лаборатория также занимается разработкой моделей, таких как UniVideo и Vamba, что помогает создавать более точные и релевантные тесты. Сегодня, работая в лаборатории суперинтеллекта Meta, Чэнь Вэньху продолжает влиять на развитие ИИ через улучшение данных для предобучения и систем оценки, оставаясь ключевой, но менее заметной фигурой в этой быстроразвивающейся области.

marsbit06/20 03:52

За оценками ИИ скрывается китайский «составитель тестов»

marsbit06/20 03:52

活动图片