6 парадигмальных сдвигов в ИИ к 2025 году: от обучения с подкреплением с верифицируемыми вознаграждениями и «виб-кодинга» до Nano banana

marsbitОпубликовано 2025-12-22Обновлено 2025-12-22

Введение

К 2025 году в развитии больших языковых моделей (LLM) произошли ключевые изменения. Основные парадигмальные сдвиги включают: 1. **RLVR (обучение с подкреплением на основе проверяемых вознаграждений)**: заменило RLHF, позволив моделям самостоятельно формировать стратегии «рассуждений» через оптимизацию в объективных областях (математика, программирование). 2. **«Призрачный» интеллект ИИ vs. «зубчатый» интеллект человека**: ИИ демонстрирует резкие скачки в возможностях на проверяемых задачах, но остаётся уязвимым в других областях, что подрывает доверие к бенчмаркам. 3. **Cursor как новая категория приложений**: вертикально-ориентированные платформы, которые организуют вызовы LLM, управляют контекстом и предоставляют интерфейсы для конкретных задач. 4. **Claude Code: локальные ИИ-агенты**: работают непосредственно на устройствах пользователей, интегрируясь с приватными данными и средой, что открывает новые формы взаимодействия. 5. **Vibe Coding (программирование по описанию):** ИИ позволяет создавать программы через текстовые описания, делая кодирование доступным даже для непрограммистов и расширяя возможности разработчиков. 6. **Nano banana: визуальный интерфейс для LLM**: переход от текстового взаимодействия к визуальному (изображения, диаграммы, анимации), что соответствует естественному для человека способу восприятия информации. Эти изменения переопределяют то, как ИИ обучается, применяется и взаимодействует с миром.

Автор: Andrej Karpathy

Компиляция: Tim, PANews

2025 год стал годом стремительного развития и перемен в области больших языковых моделей (LLM), принеся обильные плоды. Ниже представлены «парадигмальные сдвиги», которые, на мой личный взгляд, заслуживают внимания и оказались несколько неожиданными; они изменили ландшафт и произвели на меня глубокое впечатление, по крайней мере, на концептуальном уровне.

1. Обучение с подкреплением с верифицируемыми вознаграждениями (RLVR)

В начале 2025 года стек технологий для производства LLM в большинстве AI-лабораторий в целом выглядел следующим образом:

  • Предварительное обучение (GPT-2/3, 2020 год);
  • Контролируемое тонкое обучение (InstructGPT, 2022 год);
  • и Обучение с подкреплением на основе человеческих предпочтений (RLHF, 2022 год).

Долгое время это был стабильный и зрелый технологический стек для обучения больших языковых моделей производственного уровня. К 2025 году обучение с подкреплением с верифицируемыми вознаграждениями (RLVR) стало основной широко применяемой ключевой технологией. Обучая большие языковые модели в средах с множеством автоматически верифицируемых вознаграждений (например, решение математических и программистских задач), эти модели спонтанно формируют стратегии, которые человеку кажутся похожими на «рассуждения». Они учатся разбивать решение проблем на промежуточные вычислительные шаги и осваивают множество стратегий решения путём многократных итеративных рассуждений (см. примеры в статье DeepSeek-R1). В предыдущем стеке эти стратегии было трудно реализовать, поскольку для больших языковых моделей оптимальный путь рассуждений и механизмы backtracking'а не были очевидны — их приходилось исследовать через оптимизацию вознаграждения, чтобы найти подходящие решения.

В отличие от этапов контролируемого тонкого обучения и обучения с подкреплением на основе человеческих предпочтений (эти этапы относительно коротки и требуют меньших вычислительных затрат, являясь тонкой настройкой), обучение с подкреплением с верифицируемыми вознаграждениями предполагает длительное обучение с оптимизацией под объективные, не поддающиеся манипуляциям функции вознаграждения. Оказалось, что запуск RLVR даёт значительное повышение способностей на единицу затрат, что поглотило огромное количество вычислительных ресурсов, изначально запланированных для предварительного обучения. Следовательно, прогресс в возможностях больших языковых моделей в 2025 году в основном проявился в том, что крупные AI-лаборатории освоили огромные вычислительные потребности, вызванные этой новой технологией. В целом, мы видим, что масштабы моделей примерно сопоставимы, но время обучения с подкреплением значительно увеличилось. Ещё одна уникальная особенность этой новой технологии — мы получили совершенно новое измерение для регулирования (и соответствующие законы масштабирования), а именно: способность модели можно контролировать как функцию вычислительных затрат во время тестирования, генерируя более длинные цепочки рассуждений, увеличивая «время на размышление». Модель o1 от OpenAI (выпущена в конце 2024 года) стала первой демонстрацией модели на основе RLVR, а выпуск o3 (начало 2025 года) стал явным переломным моментом, позволившим直观но ощутить качественный скачок.

2. Призрачный интеллект vs. Зубчатый интеллект животных

2025 год заставил меня (и, я думаю, всю отрасль) впервые начать понимать «форму» интеллекта больших языковых моделей с более интуитивной точки зрения. Мы не «эволюционируем и не выращиваем животных», мы «призываем призраков». Весь технологический стек LLM (нейроархитектура, данные для обучения, алгоритмы обучения и, особенно, цели оптимизации) кардинально отличается, поэтому неудивительно, что мы получаем в сфере интеллекта сущности, радикально отличные от биологического интеллекта, и рассматривать их через призму животных неправильно. С точки зрения обучающей информации, человеческие нейронные сети оптимизированы для выживания в племенных условиях джунглей, а нейронные сети LLM оптимизированы для имитации человеческого текста, получения вознаграждения за решение математических головоломок и выигрыша одобрения людей на аренах. Поскольку верифицируемые области создали условия для RLVR, способности LLM в этих областях испытывают «резкие скачки», в целом демонстрируя интересную, зубчатую характеристику производительности. Они могут одновременно быть эрудированными гениями и озадаченными, когнитивно ограниченными школьниками, готовыми в любой момент при наводящем вопросе раскрыть ваши данные.

Человеческий интеллект: синий, ИИ-интеллект: красный. Мне нравится эта версия мема (извините, не могу найти оригинал в Twitter), потому что она указывает, что человеческий интеллект тоже по-своему имеет зубчатую, волнообразную форму.

Связано с этим то, что в 2025 году у меня развилось общее безразличие и недоверие к различным тестовым наборам (бенчмаркам). Ключевая проблема заключается в том, что по своей сути тестовые среды почти всегда являются верифицируемыми, поэтому они чрезвычайно подвержены влиянию RLVR и более слабых форм воздействия через генерацию синтетических данных. В типичном процессе «максимизации баллов» команды разработчиков LLM неизбежно создают учебные среды вблизи небольших участков вложенного пространства, где находятся бенчмарки, и покрывают эти области «зубцами способностей». «Обучение на тестовом наборе» стало новой нормой.

Что толку от того, что мы побеждаем во всех бенчмарках, но всё ещё не достигаем общего искусственного интеллекта?

3. Cursor: Новый уровень приложений на основе LLM

Что больше всего впечатлило меня в Cursor (помимо его стремительного взлёта в этом году), так это то, что он убедительно揭示л новый уровень «LLM-приложений», поскольку люди начали говорить о «Cursor для такой-то области». Как я подчеркнул в своём выступлении на Y Combinator в этом году, суть LLM-приложений, подобных Cursor, заключается в интеграции и оркестровке вызовов LLM для конкретной вертикали:

  • Они отвечают за «инженерию контекста»;
  • На низком уровне организуют множественные вызовы LLM во всё более сложные направленные ациклические графы, тонко балансируя между производительностью и стоимостью;
  • Предоставляют специфический для приложения графический интерфейс для человека в цикле;
  • И предоставляют «ползунок автономности».

В 2025 году велось много дискуссий о пространстве для развития вокруг этого emerging слоя приложений. Захват ли платформы больших языковых моделей все приложения, или для LLM-приложений ещё останется广阔ное пространство? Я лично предполагаю, что платформы LLM будут постепенно приближаться к роли «универсальных выпускников университетов», в то время как LLM-приложения будут организовывать этих «выпускников», проводить их тонкую настройку и, предоставляя приватные данные, сенсоры, исполнительные механизмы и петли обратной связи, превращать их в реальные «профессиональные команды», готовые к работе в конкретных вертикалях.

4. Claude Code: ИИ, работающий локально

Появление Claude Code впервые убедительно продемонстрировало форму LLM-агентов, которые циклически сочетают использование инструментов и процесс рассуждений для достижения более устойчивого решения сложных проблем. Кроме того, меня впечатлило в Claude Code то, что он работает на персональном компьютере пользователя, глубоко интегрируясь с его приватной средой, данными и контекстом. Я считаю, что OpenAI ошиблась в своих суждениях по этому направлению, поскольку сосредоточила усилия по разработке ассистентов по коду и агентов на облачном развёртывании — в контейнеризированных средах, оркестрируемых ChatGPT, а не на локальной среде localhost. Хотя кластеры агентов, работающие в облаке, кажутся «конечной формой на пути к AGI», мы сейчас находимся в переходной фазе с неравномерным развитием способностей и относительно медленным прогрессом. В этих реальных условиях развёртывание агентов непосредственно на локальном компьютере, в тесной координации с разработчиком и его конкретной рабочей средой, является более разумным путём. Claude Code точно уловил этот приоритет и воплотил его в виде简洁 (лаконичного), элегантного и чрезвычайно привлекательного инструмента командной строки, переосмыслив то, как представляется ИИ. Это больше не просто веб-сайт, который нужно посещать, как Google, а маленький дух или призрак, «живущий» в вашем компьютере. Это новая, уникальная парадигма взаимодействия с ИИ.

5. Vibe Coding (Виб-кодинг, атмосферное программирование)

В 2025 году ИИ пересёк ключевой порог возможностей, позволив создавать самые удивительные программы, просто описывая их на английском языке, при этом людям даже не нужно заботиться о лежащем в основе коде. Интересно, что я придумал термин «Vibe Coding» в случайном твите во время душа, совершенно не ожидая, что он разовьётся до нынешнего уровня. В парадигме Vibe Coding программирование перестало быть строго ограниченной областью высококвалифицированных профессионалов и стало доступным для всех. С этой точки зрения, это ещё один пример явления, описанного мной в статье «Расширение возможностей людей: как большие языковые модели меняют модель распространения технологий». В отличие от всех других технологий до сих пор, обычные люди получают от больших языковых моделей больше пользы, чем профессионалы, компании и правительства. Но Vibe Coding не только позволяет обычным людям приобщиться к программированию, но и позволяет профессиональным разработчикам создавать больше программ, которые «никогда бы не были реализованы». При разработке nanochat я использовал Vibe Coding, чтобы написать на Rust собственный эффективный BPE-токенизатор, не полагаясь на существующие библиотеки и не углубляясь в изучение Rust. В этом году я также быстро реализовал несколько прототипов проектов с помощью Vibe Coding, просто чтобы проверить, осуществимы ли некоторые идеи. Я даже написал целые одноразовые приложения только для того, чтобы локализовать конкретную ошибку, потому что код внезапно стал бесплатным, мимолетным, податливым, одноразовым. Vibe Coding переформатирует экосистему разработки программного обеспечения и глубоко изменит границы профессиональных определений.

6. Nano banana: Графический интерфейс для LLM

Gemini Nano banana от Google стал одним из самых disruptive парадигмальных сдвигов 2025 года. На мой взгляд, большие языковые модели являются следующей крупной вычислительной парадигмой после компьютеров 1970-80-х годов. Следовательно, мы увидим аналогичные инновации, основанные на схожих фундаментальных причинах, подобно эволюции персональных вычислений, микроконтроллеров и даже интернета. В частности, на уровне взаимодействия человека с компьютером, текущий «разговорный» режим общения с LLM в некотором роде похож на ввод команд в компьютерный терминал в 1980-х годах. Текст — это самое примитивное представление данных для компьютера (и LLM), но не предпочтительный способ для человека (особенно при вводе). Люди на самом деле не любят читать текст, это медленно и требует усилий. Вместо этого люди предпочитают получать информацию через визуальные и пространственные измерения, что и стало причиной появления графического пользовательского интерфейса в традиционных вычислениях. Аналогично, большие языковые модели должны общаться с нами в форме, предпочтительной для человека: через изображения, инфографику, слайды, доски, анимации, видео, веб-приложения и другие носители. Текущие ранние формы уже реализованы через смайлики и «визуальные текстовые украшения», такие как разметка Markdown (заголовки, жирный шрифт, списки, таблицы и другие элементы форматирования). Но кто же в конечном итоге построит графический интерфейс для LLM? С этой точки зрения, nano banana является ранним прототипом этого будущего. Стоит отметить, что прорыв nano banana заключается не только в самой возможности генерации изображений, но и в комплексной способности, возникающей из переплетения генерации текста, генерации изображений и знаний о мире внутри весов модели.

Трендовые криптовалюты

Связанные с этим вопросы

QЧто такое RLVR (обучение с подкреплением на основе проверяемых вознаграждений) и как оно изменило процесс обучения больших языковых моделей в 2025 году?

ARLVR (Reinforcement Learning with Verifiable Rewards) — это метод обучения ИИ, при котором модели тренируются в средах с автоматически проверяемыми вознаграждениями (например, решение математических или программистских задач). В 2025 году RLVR стал ключевой технологией, заменив или дополнив традиционные этапы обучения, такие как предобучение, тонкая настройка с учителем и RLHF. Это позволило моделям развивать стратегии, напоминающие человеческое рассуждение, и значительно улучшило их способности, хотя и потребовало больших вычислительных ресурсов.

QЧто означает концепция 'Призрачный интеллект vs. Зубчатый интеллект животных' в контексте ИИ?

AКонцепция описывает разницу между интеллектом ИИ и биологическим интеллектом. 'Призрачный интеллект' ИИ оптимизирован для имитации текста, решения задач с чёткими правилами и получения одобрения человека, что создаёт неравномерную, 'зубчатую' кривую способностей — гениальность в одних областях и слабость в других. В отличие от этого, человеческий интеллект эволюционно оптимизирован для выживания в социальной среде и также имеет свои 'зубцы', но иного характера.

QКак Cursor представляет собой новый уровень приложений на основе больших языковых моделей (LLM)?

ACursor демонстрирует новый класс LLM-приложений, которые специализируются на конкретных вертикалях (например, программирование). Они организуют вызовы LLM в сложные графы, управляют контекстом, предоставляют интерфейсы для взаимодействия с человеком и позволяют настраивать уровень автономности. Это не просто платформа, а система', которая превращает 'универсальных выпускников' (базовые LLM) в 'специализированные команды' для конкретных задач.

QВ чём уникальность подхода Claude Code и почему он изменил представление о локальном ИИ?

AClaude Code — это ИИ-агент, который работает непосредственно на локальном компьютере пользователя, а не в облаке. Он интегрируется с личными данными, средой и контекстом пользователя, что обеспечивает более тесное и безопасное взаимодействие. Этот подход, реализованный в виде элегантной командной строки, изменил парадигму, представив ИИ не как удалённый сервис, а как 'локального духа', живущего в устройстве пользователя.

QЧто такое 'Vibe Coding' (атмосферное программирование) и как оно повлияло на разработку программного обеспечения в 2025 году?

AVibe Coding — это парадигма программирования, при которой программы создаются путём простого описания на естественном языке, без необходимости писать код вручную. В 2025 году ИИ достиг уровня, когда это стало возможным для широкого круга задач. Это демократизировало программирование, позволив непрофессионалам создавать ПО, а разработчикам — быстро прототипировать идеи и создавать 'одноразовые' приложения, что изменило границы профессии и экосистему разработки.

Похожее

Диалог с Далио: Сейчас мы находимся в пузыре ИИ, 1% моего инвестиционного портфеля — это биткоин

Источник: интервью Рэя Далио, основателя Bridgewater Associates, для подкаста "The Diary Of A CEO". Далио, предсказавший кризис 2008 года, обсуждает "большой цикл" — концепцию, охватывающую долговые проблемы, растущее неравенство и геополитические сдвиги. Он указывает, что текущий ажиотаж вокруг ИИ демонстрирует классические признаки пузыря, который может лопнуть из-за высокой долговой нагрузки, роста процентных ставок и чрезмерной эмиссии акций, что способно привести к рецессии. Для защиты личного капитала в неопределенные времена Далио советует диверсификацию: вместо хранения наличных инвестировать в акции, золото, облигации. Сам он держит около 1% портфеля в биткоине, считая его "твердыми деньгами", но предпочитает физическое золото из-за его статуса резервного актива и независимости от технологических рисков. Говоря о влиянии ИИ, Далио отмечает, что технология заменяет не только физический труд, но и элементы мышления, что увеличит разрыв между капиталом и трудом. Ключевыми останутся человеческие качества — эмоции и интуиция, а успеха добьются те, кто научится работать в партнерстве с ИИ. На геополитической арене, по его мнению, мир движется к регионализации с центрами в виде США и Китая. Вовлечение США в конфликты, подобные иранскому, обнажает снижение их абсолютного влияния. Внутренние вызовы, такие как дебаты о налогах на богатство, риск капитального бегства и низкая производительность, также ставят под вопрос стабильность традиционных держав в текущей фазе цикла.

marsbit1 ч. назад

Диалог с Далио: Сейчас мы находимся в пузыре ИИ, 1% моего инвестиционного портфеля — это биткоин

marsbit1 ч. назад

7.2 трлн вон за один день: иностранные инвесторы установили рекорд чистых покупок в пятницу! Уолл-Стрит: встречный ветер в плане ликвидности на южнокорейском рынке уже утих

Капиталы возвращаются на южнокорейский рынок акций. 31 июля иностранные инвесторы осуществили чистые покупки акций KOSPI на рекордные 7,2 трлн вон за один день, что стало самым высоким показателем в истории. По данным Citigroup, эта цифра знаменует собой кардинальный разворот после месяцев масштабного оттока средств нерезидентов. В июле чистые продажи иностранными инвесторами значительно сократились до 9,8 трлн вон по сравнению с 48,4 трлн и 44,5 трлн вон в июне и мае соответственно. Одновременно внутренние пенсионные и инвестиционные фонды в июле вернулись к чистым покупкам на 1,0 трлн вон. Дополнительным фактором снижения волатильности стали новые правила Комиссии по финансовым услугам (FSC), ужесточившие с 31 июля доступ розничных инвесторов к ETF с плечом на отдельные акции. После введения норм торговый оборот таких инструментов упал примерно вдвое. Citigroup сохраняет целевую точку для KOSPI на уровне 10000 пунктов, отмечая ослабление давления со стороны движения капиталов. Аналитики видят поддержку рынку в устойчивости фундаментальных показателей сектора чипов памяти, низких оценках KOSPI, сильной экономике и благоприятной политике властей, включая возможные меры по поддержке ликвидности.

marsbit1 ч. назад

7.2 трлн вон за один день: иностранные инвесторы установили рекорд чистых покупок в пятницу! Уолл-Стрит: встречный ветер в плане ликвидности на южнокорейском рынке уже утих

marsbit1 ч. назад

Как стать человеком, которого искусственный интеллект никогда не сможет заменить

В статье рассматривается вопрос о том, как остаться незаменимым в эпоху искусственного интеллекта. Автор утверждает, что вместо страха перед ИИ следует сосредоточиться на развитии качеств, которые машины не смогут заменить. Он критикует «зарплатное рабство» — зависимость от работы, не приносящей удовлетворения, и предлагает путь к финансовой независимости через создание собственного дела. Ключ к успеху — развитие пяти элементов: самостоятельности (агентности), вкуса, умения убеждать, упорства и способности к итерациям. Главное — не просто создавать что-либо (сегодня это может каждый), а создавать что-то ценное, востребованное и уметь это продвигать. Автор считает, что наиболее важным навыком будущего является создание контента (медиа), а не просто написание кода, поскольку ценность контента субъективна и требует уникального человеческого вкуса и суждения. ИИ может помочь в производстве, но не заменит оригинальность мысли и связь с аудиторией. В качестве практического шага предлагается упражнение: за 15 минут ответить на вопросы, чтобы обнаружить свои уникальные знания, опыт и точку зрения, которые станут основой для личного бренда и дела жизни. Первый шаг — немедленно опубликовать свою основную идею, чтобы получить обратную связь от реального мира и начать процесс роста. Цель — стать «непригодным для найма», построив жизнь вокруг собственного творчества и экспертизы.

marsbit4 ч. назад

Как стать человеком, которого искусственный интеллект никогда не сможет заменить

marsbit4 ч. назад

Благодаря броскам кубиков ключи от биткоинов хранятся в автономном режиме, но не все будут этим заниматься

Статья посвящена практике генерации сид-фраз для биткоин-кошельков с помощью бросков кубиков в свете уязвимости, обнаруженной в аппаратных кошельках Coldcard. Подчеркивается, что физический бросок кубика (дающий около 2.6 бит энтропии за бросок) создает высококачественную случайность, поскольку предсказать результат практически невозможно из-за множества переменных. Для создания стандартной сид-фразы из 12 слов (128 бит энтропии) требуется около 50 бросков, а для повышенной безопасности рекомендуется 99 и более. В связи с инцидентом Coldcard, когда неисправный генератор случайных чисел в прошивке (2021-2026 гг.) мог создавать предсказуемые ключи, выяснилось, что сид-фразы, сгенерированные вручную через кубики, были защищены от этой уязвимости. Однако исследование показало, что другие функции устройства (создание бумажных кошельков, ключей для мультиподписи, паролей и т.д.) по-прежнему использовали скомпрометированный генератор, подвергая риску владельцев даже с безопасной основной сид-фразой. Автор отмечает, что, хотя метод с кубиками криптографически надежен, он непрактичен для массового использования из-за трудоемкости, высокой вероятности ошибок при вводе и необходимости строгой дисциплины для сохранения секретности процесса. Делается вывод, что будущее безопасности лежит в создании надежных аппаратных генераторов случайных чисел и понятных интерфейсов, а ручные методы остаются нишевым инструментом для опытных пользователей. Владельцам Coldcard рекомендуется обновить прошивку и проверить/заменить все ключи, сгенерированные уязвимыми функциями.

cryptonews.ru7 ч. назад

Благодаря броскам кубиков ключи от биткоинов хранятся в автономном режиме, но не все будут этим заниматься

cryptonews.ru7 ч. назад

Торговля

Спот

Популярные статьи

Как купить BANANA

Добро пожаловать на HTX.com! Мы сделали приобретение Banana Gun (BANANA) простым и удобным. Следуйте нашему пошаговому руководству и отправляйтесь в свое крипто-путешествие.Шаг 1: Создайте аккаунт на HTXИспользуйте свой адрес электронной почты или номер телефона, чтобы зарегистрироваться и бесплатно создать аккаунт на HTX. Пройдите удобную регистрацию и откройте для себя весь функционал.Создать аккаунтШаг 2: Перейдите в Купить криптовалюту и выберите свой способ оплатыКредитная/Дебетовая Карта: Используйте свою карту Visa или Mastercard для мгновенной покупки Banana Gun (BANANA).Баланс: Используйте средства с баланса вашего аккаунта HTX для простой торговли.Третьи Лица: Мы добавили популярные способы оплаты, такие как Google Pay и Apple Pay, для повышения удобства.P2P: Торгуйте напрямую с другими пользователями на HTX.Внебиржевая Торговля (OTC): Мы предлагаем индивидуальные услуги и конкурентоспособные обменные курсы для трейдеров.Шаг 3: Хранение Banana Gun (BANANA)После приобретения вами Banana Gun (BANANA) храните их в своем аккаунте на HTX. В качестве альтернативы вы можете отправить их куда-либо с помощью перевода в блокчейне или использовать для торговли с другими криптовалютами.Шаг 4: Торговля Banana Gun (BANANA)С легкостью торгуйте Banana Gun (BANANA) на спотовом рынке HTX. Просто зайдите в свой аккаунт, выберите торговую пару, совершайте сделки и следите за ними в режиме реального времени. Мы предлагаем удобный интерфейс как для начинающих, так и для опытных трейдеров.

516 просмотров всегоОпубликовано 2024.03.29Обновлено 2026.06.02

Как купить BANANA

Обсуждения

Добро пожаловать в Сообщество HTX. Здесь вы сможете быть в курсе последних новостей о развитии платформы и получить доступ к профессиональной аналитической информации о рынке. Мнения пользователей о цене на BANANA (BANANA) представлены ниже.

活动图片