# Сопутствующие статьи по теме GPT

Новостной центр HTX предлагает последние статьи и углубленный анализ по "GPT", охватывающие рыночные тренды, новости проектов, развитие технологий и политику регулирования в криптоиндустрии.

Только что Claude Fable 5 снова занял первое место

Claude Fable 5 возглавил рейтинг MirrorCode, показав абсолютный успех в 64% случаев решения задач по программированию, оставив позади GPT-5.6 Sol с результатом лишь в треть от этого показателя. Что особенно впечатляет, так это устойчивость модели при работе с непопулярными языками: при переходе с Go на Ada успешность выполнения упала всего на 3 процентных пункта (с 64% до 61%), несмотря на то, что обучающих данных по Python в открытом доступе примерно в 230 раз больше, чем по Ada. Это указывает на способность модели не просто запоминать синтаксис, а глубоко понимать логику программы и воссоздавать её функциональность с нуля на любом языке. Бенчмарк MirrorCode представляет собой сложное испытание, в рамках которого модель в изолированной среде должна, анализируя только высокоуровневую документацию и наблюдая за поведением исходной программы, полностью воспроизвести её, пройдя 100% видимых и скрытых тестов. На выполнение задач выделяется до 100 миллиардов токенов и нескольких дней непрерывной работы. Например, воссоздание биотехнологического инструмента `gotree` (16 тыс. строк кода) моделью Claude Opus 4.7 заняло 14 часов и стоило 251 доллар, достигнув 99.95% завершённости, что эквивалентно 2-17 неделям человеческой работы. Тенденция ясна: ИИ переходит от генерации отдельных фрагментов кода к самостоятельному выполнению целых проектов. Такие инструменты, как Cursor и Claude, уже демонстрируют возможности множества агентов, сотрудничающих для написания браузеров и компиляторов объемом в сотни тысяч строк. Это смещает роль разработчика: всё менее необходимо контролировать каждый шаг, всё более важной становится способность чётко ставить задачи и проверять конечный результат. Код становится дешевле, а экспертиза в постановке проблем и верификации решений — ценнее.

marsbitВчера 08:32

Только что Claude Fable 5 снова занял первое место

marsbitВчера 08:32

Гипотеза Якоби, над которой Чжан Итан мучился 7 лет, была опровергнута Fable 5 за одну ночь

Весь мир математики потрясен: гипотеза Якоби, над которой бился китайский математик Чжан Итан семь лет, была опровергнута за одну ночь моделью Fable 5. Сформулированная в 1939 году, гипотеза Якоби задавалась вопросом: если якобиан полиномиального отображения является ненулевой константой, обязательно ли существует полиномиальное обратное отображение? Эта, казалось бы, интуитивная проблема оставалась нерешенной 87 лет. Вместо попыток доказательства, Fable 5 представила элегантный контрпример в трёхмерном пространстве: полиномиальное отображение с постоянным якобианом, равным -2, которое не является инъективным (три разные точки отображаются в одну), следовательно, у него не может быть обратной функции. Контрпример настолько прост, что его можно проверить вручную. Это достижение вызвало шок и восхищение в математическом сообществе. Более того, другие модели ИИ, такие как GPT-5.6, не только проанализировали результат, но и предложили новую, исправленную версию гипотезы, демонстрируя креативность. История приобретает особую горькую иронию в связи с судьбой математика Чжан Итана. В 1990-х годах его докторская диссертация, посвящённая гипотезе Якоби, рухнула из-за ошибки в лемме, предоставленной его научным руководителем. Это привело к years of professional struggle, включая работу в Subway. Хотя Чжан Итан позже прославился прорывом в гипотезе о простых числах-близнецах, семь лет, потраченных на гипотезу Якоби, были потеряны. Теперь ИИ легко нашёл контрпример, хотя и для трёхмерного случая, а не для исходной двумерной проблемы, которую исследовал Чжан. Это событие заставляет задуматься о будущем математики и роли искусственного интеллекта в научных открытиях.

marsbit07/21 01:38

Гипотеза Якоби, над которой Чжан Итан мучился 7 лет, была опровергнута Fable 5 за одну ночь

marsbit07/21 01:38

Китай завоевывает все 42 балла на IMO 2026, Шанхайская средняя школа выметает золотые медали, GPT-5.6 повторяет момент AlphaGO

Поздравляем команду Китая с завоеванием чемпионского титула на 67-й Международной математической олимпиаде (IMO 2026) в Шанхае! Китайская команда, все участники которой получили золотые медали, набрала 232 балла, опередив занявшую второе место команду США на 25 очков. Трое китайских школьников — Дэн Лэянь и Чжан Болунь из Шанхайской средней школы, а также Лю Чэ из Второй средней школы при Восточно-Китайском педагогическом университете — получили золотые медали с идеальным результатом в 42 балла. Это уже 26-я победа Китая в общем зачёте с 1989 года. Впервые IMO проводилась в средней школе — Шанхайской средней школе, чьи ученики в сумме завоевали уже 20 золотых медалей IMO. Особое внимание в этом году привлекло участие ИИ. Сообщается, что GPT-5.6 Pro впервые с первой попытки решил все шесть задач IMO 2026, продемонстрировав потенциал перехода от поиска методом проб и ошибок к точному и безошибочному решению, что ранее считалось исключительной чертой человеческого интеллекта.

marsbit07/20 02:51

Китай завоевывает все 42 балла на IMO 2026, Шанхайская средняя школа выметает золотые медали, GPT-5.6 повторяет момент AlphaGO

marsbit07/20 02:51

GPT-5.6 Sol внезапно поумнел? Бюджет на рассуждения сократили с 960 до 128. Моделей с фиксированным интеллектом больше нет?

Пользователи сообщают о резком снижении производительности GPT-5.6 Sol (особенно уровня Max) при выполнении сложных задач, требующих глубоких рассуждений и вычислений. Сообщество обнаружило недокументированный внутренний параметр «juice value», который, по-видимому, контролирует вычислительный бюджет для рассуждений. Его значение для уровня Max упало с 960 до 128. Представитель OpenAI ТибоСоттио заявил, что это не «оглупление» модели, а часть эксперимента по оптимизации использования ресурсов и анализу неожиданно высокого потребления токенов после выпуска GPT-5.6. Он подтвердил временное снижение «juice values» и контекстного окна (с 372K до 272K токенов) для отладки, пообещав вернуть настройки. Инцидент показал, что фактические возможности модели в продакшене могут динамически регулироваться платформой для контроля затрат. Это ставит под вопрос прозрачность и предсказуемость услуги для пользователей, особенно в корпоративном секторе, где ИИ становится частью инфраструктуры.

marsbit07/15 03:30

GPT-5.6 Sol внезапно поумнел? Бюджет на рассуждения сократили с 960 до 128. Моделей с фиксированным интеллектом больше нет?

marsbit07/15 03:30

Рейтинг ИИ-работников: Способность Claude Fable 5 к автоматическому заработку в 2.5 раза выше, чем у GPT-5.5

Статья представляет исследование "Индекса удалённой рабочей силы" (Remote Labor Index, RLI), оценивающего способность ИИ-агентов автоматически выполнять реальные проекты фрилансеров. По последним данным, модель Claude Fable 5 достигла уровня автоматизации 16.1%, что примерно в 2.5 раза выше, чем у GPT-5.5 (6.3%). Модель Opus 4.8 заняла второе место с 8.3%. RLI использует 240 реальных проектов с платформы Upwork, охватывающих 23 области, такие как 3D-моделирование, дизайн и анализ данных. Ключевой метрикой является "уровень автоматизации" — процент проектов, результат которых был признан человеком-оценщиком приемлемым для платящего клиента. Всего за 8 месяцев с момента публикации RLI максимальный показатель автоматизации вырос с 2.5% до 16.1%. Такой скачок связан с улучшением архитектуры агентов, в частности, с внедрением цикла "работник-критик", где отдельный агент проверяет и отправляет работу на доработку. Также на результат Fable 5 повлиял более высокий бюджет на проект ($150 против $50 у других). Исследование показало, что использование ИИ для оценки результатов работ ненадёжно: автоматизированная оценка значительно завышала показатели новых моделей. Несмотря на быстрый прогресс, текущий абсолютный уровень автоматизации остаётся низким — 84% проектов всё ещё не под силу ИИ. Авторы подчёркивают, что RLI измеряет не способность решать абстрактные задачи, а экономический потенциал ИИ — его возможность "зарабатывать деньги", выполняя коммерческую работу.

marsbit07/13 09:49

Рейтинг ИИ-работников: Способность Claude Fable 5 к автоматическому заработку в 2.5 раза выше, чем у GPT-5.5

marsbit07/13 09:49

Верните деньги! Claude 4.8 внезапно стал глупее, а вычислительные мощности GPT-5.6 «сократили вдвое»

Крупные ИИ-компании OpenAI и Anthropic оказались в центре скандала, связанного со снижением производительности их моделей. В сообществе ИИ распространилась информация о возможном скрытом тестировании OpenAI облегчённой версии GPT-5.6-sol через платформу Codex. Пользователи, использующие специальный XML-тест («Juice test»), сообщают, что у модели, маршрутизированной на gpt-5.6-sol, показатель «Juice» (условная мера вычислительного бюджета) упал с 768 до 128, что может указывать на значительное сокращение глубины рассуждений для экономии вычислительных ресурсов. Параллельно пользователи выражают массовое недовольство резким ухудшением способностей модели Claude Opus 4.8 Max от Anthropic. Модель, изначально впечатлявшая глубокими рассуждениями, теперь, по сообщениям, демонстрирует слабую логику, потерю контекста, отказ от сложных размышлений и даже склонность к спорам с пользователями. В субреддите r/Anthropic нарастают протесты. Автор выдвигает гипотезу, что изначально высокая производительность могла быть временным «бустом» для создания ажиотажа, а текущее снижение качества — способом сократить огромные затраты на вычисления, особенно на фоне возможных сложностей с привлечением финансирования после масштабного IPO SpaceX. Ключевая претензия пользователей — полная непрозрачность таких изменений в услугах, за которые они платят ежемесячную подписку. Тест «Juice» стал для сообщества символическим инструментом попытки узнать, что же они на самом деле получают.

marsbit06/30 12:09

Верните деньги! Claude 4.8 внезапно стал глупее, а вычислительные мощности GPT-5.6 «сократили вдвое»

marsbit06/30 12:09

GPT5.6 подверглись «лоботомии», Fable 5 возвращается в ослабленной версии?

GPT-5.6 был разделен на три версии: Sol, Terra и Luna, при этом доступ к самой мощной Sol ограничен. Параллельно Anthropic столкнулась с кризисом: ее модель Fable 5 была глобально отключена на 72 часа после демонстрации опасных возможностей, таких как поиск уязвимостей в банковских системах. Ожидается, что Fable 5 вернется в сильно ограниченном, «кастрированном» виде с усиленными мерами безопасности. Эксперты выражают опасения, что избыточные ограничения могут снизить интеллектуальные возможности моделей, превратив их из мощных инструментов в посредственных «помощников». Разработчиков также беспокоит потенциальный переход к платному доступу и строгой верификации для использования передовых ИИ, что противоречит первоначальным обещаниям широкой доступности. Таким образом, регулирующие меры, направленные на безопасность, могут привести к существенному ослаблению новейших моделей ИИ и ограничению их распространения.

marsbit06/29 08:38

GPT5.6 подверглись «лоботомии», Fable 5 возвращается в ослабленной версии?

marsbit06/29 08:38

Восьмилетние заметки предпринимателя, партнера a16z по направлению ИИ

Сооснователь Rosebud AI, который сейчас стал партнером a16z по инвестициям в ИИ, делится восьмилетним опытом работы в области генеративного ИИ. В 2018 году, до появления GPT, он начал разрабатывать инструменты для творчества на основе ИИ, такие как TokkingHeads, с целью сделать процесс создания контента таким же простым, как игра. Несмотря на несовершенство ранних моделей, таких как CycleGAN и StyleGAN, его команда смогла создать продукты, которые привлекли миллионы пользователей за счет удобного дизайна и интерактивности. С развитием технологий, особенно после выхода GPT-4, возможности генерации кода и контента значительно улучшились, что открыло новые горизонты для творческих инструментов. Автор подчеркивает, что ключевым моментом сейчас является не только технология, но и то, как ее продуктивно использовать, коммерциализировать и интегрировать в реальные продукты. Переходя в a16z, он планирует сосредоточиться на инвестициях в передовые модели ИИ и инфраструктуру, поддерживая основателей, которые строят будущее в этой области. Он уверен, что генеративный ИИ входит в новую фазу, где главное — не что может сделать технология, а как ее применять.

marsbit04/26 12:04

Восьмилетние заметки предпринимателя, партнера a16z по направлению ИИ

marsbit04/26 12:04

От споров в съемной квартире до противостояния на $300 миллиардов: длинная статья WSJ впервые раскрывает десятилетнюю личную вражду основателей Anthropic и OpenAI

Журналист The Wall Street Journal раскрыл десятилетний личный конфликт между основателями Anthropic и OpenAI, который повлиял на развитие глобального ИИ. Дарьо Амодеи, сооснователь Anthropic, резко критиковал Сэма Алтмана из OpenAI, сравнивая его спор с Илоном Маском с «Гитлером против Сталина» и называя действия OpenAI «злыми» и «лицемерными». Конфликт начался в 2016 году из-за разногласий о том, как распространять информацию об ИИ — публично или через правительство. Напряженность росла из-за вопросов власти, управления и признания заслуг. В 2020 году Дарьо и его сестра Даниэла покинули OpenAI с командой из 12 сотрудников и основали Anthropic, позиционируя её как «здоровую альтернативу» OpenAI. Сейчас обе компании оцениваются в $300 млрд и готовятся к IPO.

marsbit03/28 07:28

От споров в съемной квартире до противостояния на $300 миллиардов: длинная статья WSJ впервые раскрывает десятилетнюю личную вражду основателей Anthropic и OpenAI

marsbit03/28 07:28

活动图片