a16z: «Амнезия» ИИ, может ли непрерывное обучение ее вылечить?

marsbitОпубликовано 2026-04-25Обновлено 2026-04-25

Введение

В статье a16z рассматривается проблема «амнезии» больших языковых моделей (LLM), которые после обучения не могут обновлять свои параметры новыми знаниями, подобно герою фильма «Помни» с антероградной амнезией. Для компенсации используются внешние методы, такие как контекстное обучение (ICL) и системы поиска, но они не позволяют моделям по-настоящему усваивать информацию. Авторы утверждают, что контекстное обучение, хотя и эффективно, имеет ограничения: оно не подходит для решения truly новых задач (например, математических доказательств),对抗ных сценариев или работы с неявными знаниями. Настоящее обучение требует сжатия (compression) опыта в параметры модели. Предлагается подход непрерывного обучения (continual learning), который позволяет моделям обновлять свои веса после развертывания. Рассматриваются три основных пути: работа с контекстом (внешняя память), модульные подходы (адаптеры) и прямое обновление параметров (весов). Последний метод — самый сложный, но именно он позволяет моделям полностью усваивать новые знания и навыки. Статья также затрагивает проблемы катастрофического забывания, безопасности и аудируемости, которые возникают при обновлении весов, и рассматривает текущий ландшафт стартапов, работающих над этими решениями. Ключевой вывод: будущее — за гибридными системами, сочетающими контекстное обучение, модульность и параметрическое обновление для создания моделей, способных к непрерывному совершенствованию.

Оригинальные авторы: Malika Aubakirova, Matt Bornstein, a16z crypto

Оригинальная компиляция: Deep Tide TechFlow

В «Помни» (Memento) Кристофера Нолана главный герой Леонард Шелби живет в раздробленном настоящем. Повреждение мозга привело к тому, что у него развилась антероградная амнезия, не позволяющая формировать новые воспоминания. Каждые несколько минут его мир перезагружается, он застревает в вечном «сейчас», не помня, что произошло только что, и не зная, что будет дальше. Чтобы выжить, он делает татуировки на теле, пользуется поляроидом, полагаясь на эти внешние инструменты как на замену функции памяти, которую его мозг не может выполнить.

Большие языковые модели (LLM) живут в аналогичном вечном настоящем. После завершения обучения огромный объем знаний замораживается в параметрах, модель не может формировать новые воспоминания, не может обновлять свои параметры на основе нового опыта. Чтобы компенсировать этот недостаток, мы строим для нее множество лесов: история чата служит кратковременными заметками, система поиска — внешним блокнотом, системные промты — как татуировки на теле. Но сама модель никогда по-настоящему не усваивает эту новую информацию.

Все больше исследователей считают, что этого недостаточно. Задачи, которые может решить обучение в контексте (ICL), предполагают, что ответ (или его фрагменты) уже существует где-то в мире. Но для тех проблем, которые требуют настоящего открытия (например, новое математическое доказательство), adversarial-сценариев (например, безопасность, атаки и защита) или тех знаний, которые слишком неявны и не могут быть выражены словами, есть веские основания полагать: модели нужен способ напрямую записывать новые знания и опыт в параметры после развертывания.

Обучение в контексте временно. Настоящее обучение требует сжатия. Пока мы не позволим моделям непрерывно сжимать, мы, возможно, застрянем в вечном настоящем «Помни». С другой стороны, если мы сможем обучить модели их собственной архитектуре памяти, а не полагаться на внешние кастомные инструменты, это может открыть совершенно новое измерение масштабирования (scaling).

Эта область исследований называется непрерывным обучением (continual learning). Концепция не нова (см. статью McCloskey и Cohen 1989 года), но мы считаем ее одним из важнейших направлений исследований в современном ИИ. Взрывной рост возможностей моделей за последние два-три года сделал разрыв между тем, что модель «уже знает» и «может узнать», все более очевидным. Цель этой статьи — поделиться тем, что мы узнали от ведущих исследователей этой области, помочь прояснить различные пути непрерывного обучения и продвинуть эту тему в предпринимательской экосистеме.

Примечание: Формирование этой статьи стало возможным благодаря глубокому общению с группой выдающихся исследователей, аспирантов и предпринимателей, которые щедро поделились с нами своей работой и идеями в области непрерывного обучения. От теоретических основ до инженерных реалий обучения после развертывания, их инсайты сделали эту статью гораздо более основательной, чем если бы мы писали ее в одиночку. Спасибо за ваше время и идеи!

Сначала о контексте

Прежде чем защищать обучение на уровне параметров (т.е. обучение с обновлением весов модели), стоит признать факт: обучение в контексте действительно работает. И есть веский аргумент в пользу того, что оно будет продолжать побеждать.

Суть Transformer — это предсказание следующего токена на основе последовательности с условием. Дайте ему правильную последовательность, и вы получите удивительно богатое поведение, даже не касаясь весов. Вот почему такие методы, как управление контекстом, инженерия промтов, тонкая настройка по инструкциям (instruction fine-tuning) и few-shot примеры, так мощны. Интеллект инкапсулирован в статических параметрах, а проявляемые способности резко меняются в зависимости от того, что вы подаете в окно.

Недавняя глубокая статья Cursor о масштабировании автономных программирующих агентов — хороший пример: веса модели фиксированы, а真正 заставляет систему работать — тщательная оркестровка контекста — что в него поместить, когда делать суммаризацию, как поддерживать связное состояние в течение часов автономной работы.

OpenClaw — еще один хороший пример. Он стал популярным не из-за особых прав доступа к модели (базовую модель могут использовать все), а потому, что он чрезвычайно эффективно преобразует контекст и инструменты в рабочее состояние: отслеживает, что вы делаете, структурирует промежуточные результаты, решает, когда повторно вводить промты, поддерживает постоянную память о предыдущей работе. OpenClaw поднял «дизайн оболочки» агента на уровень самостоятельной дисциплины.

Когда инженерия промтов только появилась, многие исследователи скептически относились к тому, что «только промты» могут стать серьезным интерфейсом. Это выглядело как хак. Но это родной продукт архитектуры Transformer, не требующий переобучения и автоматически улучшающийся с прогрессом моделей. Модели становятся сильнее — промты становятся сильнее. «Грубые, но родные» интерфейсы часто побеждают, потому что они напрямую связаны с базовой системой, а не борются с ней. До сих пор развитие LLM шло именно по этому пути.

Модели пространства состояний: контекст на стероидах

Когда основные рабочие процессы переходят от простых вызовов LLM к агентским циклам, на модели обучения в контексте ложится все большее давление. Раньше контекстное окно заполнялось полностью относительно редко. Обычно это происходило, когда от LLM требовалось выполнить длинную серию дискретных задач, и уровень приложения мог относительно прямо обрезать и сжимать историю чата.

Но для агента одна задача может съесть значительную часть общего доступного контекста. Каждый шаг агентского цикла зависит от контекста, переданного предыдущими итерациями. И они часто терпят неудачу после 20–100 шагов, потому что «нить обрывается»: контекст заполняется, связность ухудшается, сходимость невозможна.

Поэтому основные AI-лаборатории сейчас вкладывают значительные ресурсы (то есть масштабные тренировочные прогоны) в разработку моделей со сверхдлинным контекстным окном. Это естественный путь, поскольку он строится на уже работающем методе (обучение в контексте) и соответствует общей тенденции отрасли к смещению в сторону вычислений во время вывода (inference-time computation). Наиболее распространенная архитектура — вставка слоев фиксированной памяти между обычными attention-головками, а именно модели пространства состояний (SSM) и варианты линейного внимания (далее统称为 SSM). SSM обеспечивают принципиально лучшую кривую масштабирования в сценариях с длинным контекстом.

Подпись к рисунку: Сравнение масштабирования SSM и традиционного механизма внимания

Цель — помочь агентам увеличить количество связных шагов выполнения на несколько порядков, примерно с 20 шагов до примерно 20 000, без потери широких навыков и знаний, предоставляемых традиционным Transformer. В случае успеха это станет значительным прорывом для долго работающих агентов.

Вы даже можете рассматривать этот метод как форму непрерывного обучения: хотя веса модели не обновляются, но вводится внешний слой памяти, который почти не требует сброса.

Итак, эти непараметрические методы реальны и мощны. Любая оценка непрерывного обучения должна начинаться отсюда. Вопрос не в том, полезны ли сегодняшние контекстные системы — они полезны. Вопрос в том: увидели ли мы уже потолок, и могут ли новые методы продвинуть нас дальше.

Чего не хватает контексту: «Ошибка архивного шкафа»

«С AGI и предварительным обучением произошло то, что они в некотором смысле перескочили... Люди — не AGI. Да, у людей есть база навыков, но людям не хватает огромного количества знаний. Мы зависим от непрерывного обучения.

Если я создам сверхумного 15-летнего подростка, он ничего не будет знать. Хороший ученик, очень жаждущий учиться. Вы можете сказать: иди в программисты, иди в врачи. Само развертывание будет включать процесс обучения, проб и ошибок. Это процесс, а не выброс готового продукта. — Ilya Sutskever»

Представьте систему с бесконечным пространством для хранения. Самый большой в мире архивный шкаф, каждый факт идеально индексирован, мгновенно доступен для поиска. Он может найти что угодно. Он научился?

Нет. Его никогда не заставляли сжимать.

В этом суть нашего аргумента, который ссылается на ранее высказанную мысль Ильи Суцкевера: LLM по своей сути являются алгоритмами сжатия. В процессе обучения они сжимают интернет в параметры. Сжатие происходит с потерями, и именно эта потерянность делает его мощным. Сжатие заставляет модель искать структуру, обобщать, строить представления, которые можно переносить между контекстами. Модель, которая заучивает все тренировочные образцы наизусть, хуже модели, которая извлекает underlying закономерности. Сжатие с потерями — это и есть обучение.

Ирония в том, что механизм, который делает LLM такими мощными во время обучения (сжатие сырых данных в компактные, переносимые представления), — это именно то, что мы отказываемся позволить им делать после развертывания. Мы останавливаем сжатие в момент выпуска, заменяя его внешней памятью.

Конечно, большинство агентских оболочек так или иначе сжимают контекст особым образом. Но разве горький урок (bitter lesson) не говорит нам о том, что сама модель должна научиться этому сжатию, прямо, в больших масштабах?

Юй Сун привел пример, иллюстрирующий эти дебаты: математика. Взгляните на Великую теорему Ферма. Более 350 лет ни один математик не мог ее доказать не потому, что им не хватало правильной литературы, а потому, что решение было高度新颖ным (высоконоваторским). Концептуальное расстояние между существующими математическими знаниями и окончательным ответом было слишком велико.

Когда Эндрю Уайлс наконец攻克 (преодолел) ее в 1990-х, он провел семь лет, работая почти в изоляции, и ему пришлось изобретать全新的 (совершенно новые) techniques, чтобы прийти к ответу. Его доказательство опиралось на успешное соединение двух различных математических分支 (ветвей): эллиптических кривых и модулярных форм. Хотя Кен Рибет ранее доказал, что если установить эту связь, то это автоматически решит теорему Ферма, до Уайлса ни у кого не было теоретических инструментов, чтобы фактически построить этот мост. Аналогичный аргумент можно привести и для доказательства гипотезы Пуанкаре Григорием Перельманом.

Ключевой вопрос: Доказывают ли эти примеры, что LLM не хватает чего-то, некоторой способности обновлять априорные знания, по-настоящему творчески мыслить? Или эта история как раз доказывает обратное — все человеческие знания — это просто данные для тренировки и рекомбинации, а Уайлс и Перельман просто продемонстрировали то, что LLM смогут делать в большем масштабе?

Этот вопрос эмпирический, ответ еще не известен. Но мы точно знаем, что есть много категорий проблем, с которыми обучение в контексте сегодня не справляется, а обучение на уровне параметров может помочь. Например:

Подпись к рисунку: Категории проблем, где обучение в контексте терпит неудачу, а параметрическое обучение может преуспеть

Что еще более важно, обучение в контексте может обрабатывать только то, что можно выразить словами, а веса могут кодировать концепции, которые невозможно передать словами в промте. Некоторые паттерны имеют слишком высокую размерность, слишком неявны, слишком глубоко структурированы, чтобы поместиться в контекст. Например, визуальная текстура, отличающая доброкачественный артефакт от опухоли на медицинском скане, или微波动 (микрофлуктуации) аудио, определяющие уникальный ритм говорящего, — эти паттерны不容易 (не легко) разложить на точные слова.

Язык может лишь приблизительно их передать. Самый длинный промт не передаст这些东西 (эти вещи); такие знания могут жить только в весах. Они живут в латентном пространстве изученных представлений, а не в словах. Независимо от того, насколько вырастет контекстное окно, всегда будут знания, которые невозможно описать текстом, их можно передать только параметрами.

Это, возможно, объясняет, почему явные функции «робот помнит тебя» (например, memory в ChatGPT) часто вызывают у пользователей скорее дискомфорт, чем восторг. Пользователи на самом деле хотят не «вспомнить», а «способность». Модель, которая усвоила ваши паттерны поведения, может обобщать для новых сценариев; модель, которая просто вспоминает вашу историю, — нет. Разница между «Вот что вы написали в ответ на это письмо в прошлый раз» (дословное повторение) и «Я достаточно понимаю ваш образ мышления, чтобы предугадать, что вам нужно» — это разница между поиском и обучением.

Введение в непрерывное обучение

Непрерывное обучение имеет несколько путей. Разделительная линия не в «есть ли функция памяти», а в: Где происходит сжатие? Эти пути распределены по спектру: от отсутствия сжатия (чистый поиск, замороженные веса), до полного внутреннего сжатия (обучение на уровне весов, модель становится умнее), с важной промежуточной зоной (модули).

Подпись к рисунку: Три пути непрерывного обучения — контекст, модули, веса

Контекст

Со стороны контекста команды строят более умные пайплайны поиска, агентские оболочки и оркестрацию промтов. Это самая зрелая категория: инфраструктура проверена, путь развертывания ясен. Ограничение — в глубине: длина контекста.

Заметное новое направление: мульти-агентные архитектуры как стратегия масштабирования самого контекста. Если одна модель ограничена окном в 128K токенов, то скоординированная группа агентов — каждый со своим контекстом, сфокусированный на своем срезе проблемы, общающийся результатами с другими — может в целом аппроксимировать бесконечную рабочую память. Каждый агент делает обучение в контексте в своем окне; система агрегирует. Недавний проект autoresearch Карпати и пример Cursor с построением веб-браузера — ранние кейсы. Это чисто непараметрический подход (без изменения весов), но он значительно поднимает потолок возможностей контекстных систем.

Модули

В пространстве модулей команды строят подключаемые модули знаний (сжатые KV-кэши, адаптерные слои, внешние хранилища памяти), которые позволяют универсальной модели специализироваться без переобучения. Модель на 8B с подходящим модулем может соответствовать производительности модели на 109B на целевой задаче, с占用内存 (занимаемой памятью), составляющей其零头 (ее долю). Привлекательность в совместимости с существующей инфраструктурой Transformer.

Веса

Со стороны обновления весов исследователи стремятся к настоящему обучению на уровне параметров: разреженные слои памяти, обновляющие только relevant фрагменты параметров, циклы обучения с подкреплением (RL), оптимизирующие модель на основе обратной связи, обучение во время тестирования (test-time training), сжимающее контекст в веса во время вывода. Это самые глубокие методы, и их сложнее всего развернуть, но они真正 позволяют модели полностью усваивать новую информацию или новые навыки.

Конкретные механизмы обновления параметров разнообразны. Перечислим несколько направлений исследований:

Подпись к рисунку: Обзор направлений исследований обучения на уровне весов

Исследования на уровне весов охватывают несколько параллельных направлений. Методы регуляризации и пространства весов имеют самую долгую историю: EWC (Kirkpatrick et al., 2017) штрафует изменения параметров в зависимости от их важности для предыдущих задач; интерполяция весов (Kozal et al., 2024) смешивает старые и новые конфигурации весов в пространстве параметров, но оба метода хрупки в large scale.

Обучение во время тестирования (Test-Time Training, TTT), впервые предложенное Sun et al.(2020), позже развилось в архитектурные примитивы (TTT-слои, TTT-E2E, TTT-Discover), с совершенно иным подходом: градиентный спуск на тестовых данных, сжатие новой информации в параметры в тот момент, когда это необходимо.

Мета-обучение задается вопросом: Можем ли мы обучить модели «учиться учиться»? От few-shot дружественной инициализации параметров в MAML (Finn et al., 2017) до вложенного обучения (Nested Learning, Behrouz et al., 2025), которое структурирует модель как иерархическую проблему оптимизации, с модулями, работающими на разных временных масштабах для быстрой адаптации и медленного обновления, вдохновленную биологическим консолидацией памяти.

Дистилляция сохраняет знания о предыдущих задачах, заставляя студенческую модель соответствовать замороженным контрольным точкам учителя. LoRD (Liu et al., 2025) делает дистилляцию достаточно эффективной для непрерывного运行 (работы), одновременно сжимая модель и буфер воспроизведения. Само-дистилляция (SDFT, Shenfeld et al., 2026) меняет источник, используя выводы модели самой себя в экспертных условиях как тренировочный сигнал, обходя катастрофическое забывание при последовательной тонкой настройке.

Рекурсивное самоусовершенствование работает по схожей логике: STaR (Zelikman et al., 2022) выводит способности к рассуждению из самогенерируемых цепочек рассуждений; AlphaEvolve (DeepMind, 2025) обнаружила оптимизации алгоритмов, которые не улучшались десятилетиями; «Эпоха опыта» (The Age of Experience) Сильвера и Саттона (2025) определяет обучение агента как永不停止ный поток непрерывного опыта.

Эти исследовательские направления сходятся. TTT-Discover уже объединил обучение во время тестирования и исследование, управляемое RL. HOPE вкладывает циклы быстрого и медленного обучения в единую архитектуру. SDFT превратила дистилляцию в базовую операцию самоулучшения. Границы между колонками размываются. Следующее поколение систем непрерывного обучения, вероятно, будет комбинировать多种 стратегии (множество стратегий): использовать регуляризацию для стабильности, мета-обучение для ускорения, самоулучшение для сложного процента. Все больше стартапов делают ставку на разные уровни этого технологического стека.

Ландшафт стартапов в области непрерывного обучения

Непараметрический конец спектра наиболее известен. Компании-оболочки (Letta, mem0, Subconscious) строят слои оркестрации и лесов, управляя тем, что попадает в контекстное окно. Внешние хранилища и инфраструктура RAG (как Pinecone, xmemory)提供检索骨干 (предоставляют хребет для поиска). Данные существуют, задача — предоставить правильный срез в правильное время перед моделью. По мере расширения контекстных окон, пространство для проектирования этих компаний также растет, особенно на стороне оболочек, где появляется новая волна стартапов для управления日益复杂的 (все более сложными) контекстными стратегиями.

Параметрический конец более ранний и более разнообразный. Здесь компании экспериментируют с какой-либо версией «сжатия после развертывания», позволяя модели усваивать новую информацию в весах. Пути大致可以分成几种不同的赌注 (грубо можно разделить на несколько различных ставок) о том, «как» модель должна учиться после выпуска.

Частичное сжатие: учиться без переобучения. Некоторые команды строят подключаемые модули знаний (сжатые KV-кэши, адаптерные слои, внешние хранилища памяти), которые позволяют универсальной модели специализироваться, не трогая核心权重 (основные веса). Общий аргумент: вы получаете meaningful сжатие (не просто поиск), сохраняя при этом компромисс стабильность-пластичность управляемым, поскольку обучение изолировано, а не разбросано по всему пространству параметров. Модель на 8B с подходящим модулем может соответствовать производительности гораздо большей модели на целевой задаче. Преимущество — компоновочность: модули можно подключать и использовать с существующей архитектурой Transformer, их можно независимо заменять или обновлять, стоимость экспериментов намного ниже, чем при переобучении.

RL и циклы обратной связи: учиться на сигналах. Другие команды делают ставку на то, что самый богатый сигнал для обучения после развертывания уже существует в самом цикле развертывания — пользовательские исправления, успех или провал задачи, сигналы вознаграждения от результатов реального мира. Ключевая идея: модель должна рассматривать каждое взаимодействие как потенциальный тренировочный сигнал, а не просто запрос на вывод. Это очень похоже на то, как люди进步 (прогрессируют) в работе: делают работу, получают обратную связь, усваивают, какие методы работают. Инженерная задача состоит в том, чтобы превратить разреженные, зашумленные, иногда adversarial отзывы в стабильные обновления весов, избегая катастрофического забывания. Но модель, которая действительно может учиться на развертывании, будет создавать сложный процент ценности способами, недоступными для контекстных систем.

Data-centric: учиться на правильных сигналах. Смежная, но отличная ставка: узкое место не в алгоритме обучения, а в тренировочных данных и окружающих системах. Эти команды专注于筛选,生成或合成正确的数据来驱动持续更新 (фокусируются на отборе, генерации или синтезе правильных данных для驱动持续更新): предпосылка в том, что модель с высококачественными, хорошо структурированными обучающими сигналами потребует гораздо меньше шагов градиента для meaningful улучшения. Это естественно сочетается с компаниями, работающими с циклами обратной связи, но акцент делается на вышестоящей проблеме: может ли модель учиться — это одно, а от чего она должна учиться и до какой степени — другое.

Новые архитектуры: способность к обучению, заложенная в основе. Самая радикальная ставка认为 Transformer 架构本身就是瓶颈 (считает, что сама архитектура Transformer является узким местом), непрерывное обучение требует принципиально иных вычислительных примитивов: архитектур с динамикой непрерывного времени и встроенными механизмами памяти. Аргумент здесь структурный: если вы хотите систему непрерывного обучения, вы должны встроить механизм обучения в底层基础架构 (нижний уровень базовой архитектуры).

Подпись к рисунку: Ландшафт стартапов в области непрерывного обучения

Все основные лаборатории также активно работают в этих категориях. Одни исследуют лучшее управление контекстом и chain-of-thought рассуждения, другие экспериментируют с внешними модулями памяти или sleep-time вычислительными пайплайнами, а несколько стелс-компаний追求新架构 (преследуют новые архитектуры). Эта область достаточно молода, ни один метод еще не победил, и учитывая широту вариантов использования, не должен быть только один победитель.

Почему простое обновление весов проваливается

Обновление параметров модели в производственной среде вызывает一连串 (цепочку) режимов отказа, которые в настоящее время не решены в large scale.

Подпись к рисунку: Режимы отказа при простом обновлении весов

Инженерные проблемы хорошо задокументированы. Катастрофическое забывание означает, что модель, достаточно чувствительная к новым данным для обучения, разрушит existing представления — дилемма стабильности-пластичности. Временное разделение (Temporal decoupling) означает, что неизменные правила и изменчивое состояние сжаты в один и тот же набор весов, обновление одного повреждает другое. Логическая интеграция терпит неудачу, потому что обновления фактов не распространяются на их следствия: изменения ограничены на уровне token-последовательностей, а не семантических концепций. Забывание (unlearning) все еще невозможно: не существует дифференцируемой операции вычитания, поэтому нет точного хирургического метода удаления ложных или токсичных знаний.

Есть второй класс проблем, которому уделяется меньше внимания. Текущее разделение обучения и развертывания — это не просто инженерное удобство, это граница безопасности, аудируемости и управления. Открытие этой границы приводит к одновременному возникновению множества проблем. Безопасное alignment может непредсказуемо деградировать: даже узкая тонкая настройка на benign данных может вызвать широкое рассогласование поведения.

Непрерывное обновление создает поверхность для атак data poisoning — медленную, устойчивую версию prompt injection, но она живет в весах. Аудируемость рушится, потому что continuously обновляемая модель — это движущаяся мишень, невозможно контролировать версии, проводить регрессионное тестирование или一次性 сертификацию. Риски для конфиденциальности усугубляются, когда пользовательские взаимодействия сжимаются в параметры, и конфиденциальная информация запекается в представления, что затрудняет ее фильтрацию по сравнению с информацией в контексте поиска.

Это открытые проблемы, а не фундаментальная невозможность. Их решение является частью исследовательской программы непрерывного обучения так же, как и решение основных архитектурных challenges.

От «Помни» к настоящей памяти

Трагедия Леонарда в «Помни» не в том, что он не может функционировать — в любой given сцене он resourceful, даже блестящий. Его трагедия в том, что он никогда не может создавать сложный процент. Каждый опыт остается внешним — поляроид, татуировка, записка чужым почерком. Он может искать, но он не может сжимать новые знания.

Пока Леонард движется по этому самостроенному лабиринту, граница между реальностью и верой начинает размываться. Его состояние не просто лишает его памяти; оно заставляет его постоянно重建意义 (перестраивать смысл), делая его одновременно детективом и ненадежным рассказчиком в своей собственной истории.

Современный ИИ работает в тех же ограничениях. Мы построили очень мощные системы поиска: более длинные контекстные окна, более умные оболочки, скоординированные группы агентов, и они работают. Но поиск — это не обучение. Система, которая может найти любой факт, не вынуждена искать структуру. Она не вынуждена обобщать. То самое有损压缩 (сжатие с потерями), которое сделало обучение таким мощным — механизм превращения сырых данных в переносимые представления — это именно то, что мы выключаем в момент развертывания.

Путь вперед, вероятно, не в единном прорыве, а в layered системе. Обучение в контексте останется первой линией адаптации: оно родное, проверенное и постоянно улучшающееся. Модульные механизмы могут处理中间地带 (обрабатывать промежуточную зону) персонализации и domain специализации.

Но для那些真正困难的问题 (тех по-настоящему трудных проблем) — открытий, adversarial адаптации, неявных знаний, которые невозможно выразить словами — нам, возможно, потребуется позволить моделям продолжать сжимать опыт в параметры после обучения. Это означает прогресс в разреженных архитектурах, мета-обучающих целях и циклах самоулучшения. Это также может потребовать от нас重新定义 (переопределить) значение «модели»: не как набор фиксированных весов, а как evolving систему, включающую ее память, ее алгоритм обновления и ее способность абстрагироваться от собственного опыта.

Архивный шкаф становится все больше. Но даже самый большой архивный шкаф — все еще只是档案柜 (просто архивный шкаф). Прорыв заключается в том, чтобы позволить модели после развертывания делать то, что сделало ее мощной во время обучения: сжимать, абстрагировать, учиться. Мы находимся на переломном моменте от моделей с амнезией к моделям с проблеском опыта. В противном случае мы застрянем в собственном «Помни».

Трендовые криптовалюты

Связанные с этим вопросы

QЧто такое «синдром постоянного настоящего» у больших языковых моделей (LLM) и как он связан с проблемой памяти?

A«Синдром постоянного настоящего» — это аналогия, описывающая неспособность LLM формировать новые воспоминания после завершения обучения. Как и у главного героя фильма «Помни» с амнезией, знания модели «замораживаются» в её параметрах в момент обучения. Для работы с новой информацией модели приходится полагаться на внешние «костыли», такие как история чата, системы поиска и подсказки, но сама модель никогда не усваивает эту информацию на уровне параметров.

QКаковы ключевые ограничения обучения в контексте (in-context learning) и в каких случаях оно неэффективно?

AОбучение в контексте эффективно, когда ответ или его фрагменты уже существуют где-то в мире и могут быть найдены. Однако оно терпит неудачу в случаях, требующих подлинного открытия (например, новое математическое доказательство), в adversarial-сценариях (например, безопасность) или для работы со скрытыми знаниями, которые трудно выразить словами. Оно является временным решением и не обеспечивает сжатия и обобщения информации, как это делает обучение на уровне параметров.

QКакие три основных пути существуют в области непрерывного обучения (continual learning) и чем они отличаются?

A1. **Контекст (Непараметрический):** Улучшение систем извлечения информации, оболочек ИИ и управления контекстом без изменения весов модели. Ограничение — длина контекста. 2. **Модули:** Создание подключаемых модулей знаний (адаптеры, кэши, внешняя память), которые специализируют общую модель без её переобучения. 3. **Веса (Параметрический):** Прямое обновление весов модели через разреженное обновление, обучение с подкреплением (RL) или обучение во время тестирования (test-time training). Это самый глубокий, но и самый сложный для развёртывания метод.

QС какими основными проблемами сталкивается простое (наивное) обновление весов моделей в продакшене?

A1. **Катастрофическое забывание:** Модель забывает ранее изученные знания при обучении на новых данных. 2. **Временное разъединение:** Постоянные правила и изменчивые состояния «сжаты» в одних и тех же весах, их обновление нарушает друг друга. 3. **Проблемы безопасности и управления:** Обновления могут непредсказуемо ухудшить выравнивание модели (safety alignment), создать поверхность для атак (например, медленное poisoning данных) и усложнить аудит и контроль версий. 4. **Невозможность «забыть»:** Отсутствие операции точного «удаления» ложных или вредных знаний из весов.

QКакую фундаментальную проблему решает сжатие (compression) в обучении моделей и почему оно важно?

AСжатие — это процесс преобразования сырых данных в компактные, обобщаемые и переносимые представления (representation) в параметрах модели. Именно необходимость сжимать данные во время обучения заставляет модель искать структуру, обобщать и выявлять глубинные закономерности. Это основа её способности к рассуждению и переносу знаний. Остановка этого процесса после развёртывания лишает модель возможности по-настоящему усваивать новый опыт и делать его частью своей «личности» и способностей.

Похожее

Гонконг готовит банки к квантовым угрозам на фоне активного развития токенизации

Гонконгский валютно-денежный орган (HKMA) представил основу для оценки готовности банков к угрозам со стороны квантовых компьютеров на фоне активного развития токенизации в финансовом секторе. В рамках инициативы был опубликован технический документ и впервые представлен Индекс готовности к квантовым вызовам (QPI). Согласно данным, общий уровень готовности сектора оценивается лишь в 2.3 из 10 баллов, при этом около половины опрошенных учреждений не имеют формального плана перехода на постквантовую криптографию. HKMA поставил цель достичь полной готовности (QPI = 10) к 2030 году. Эти меры связаны с активным переносом традиционных финансовых операций на распределенные реестры. С 2023 года Гонконг выпустил три выпуска токенизированных зеленых облигаций на общую сумму около 16,8 млрд гонконгских долларов. HKMA также продвигает токенизированные депозиты и расчеты цифровыми активами через Project Ensemble. В техническом документе подчеркивается, что распределенные реестры и платежные сети зависят от криптографии, и их работа может быть серьезно нарушена, если защита будет взломана квантовыми компьютерами. Инициатива по квантовой безопасности является частью стратегии Fintech 2030, где токенизация определена как один из четырех стратегических столпов. Регулятор планирует ускорить токенизацию реальных активов, сделать выпуск токенизированных государственных облигаций регулярным и изучить возможность токенизации бумаг Валютного фонда. По данным на конец 2025 года, объем цифровых активов под управлением банков Гонконга превысил 14 млрд гонконгских долларов, а объем токенизированных депозитов достиг 29 млрд. В документе HKMA предупреждает, что мощные квантовые компьютеры в будущем смогут взломать широко используемые алгоритмы шифрования, такие как RSA, что позволит злоумышленникам расшифровывать данные и подделывать цифровые подписи. Поскольку переход на новые криптографические системы может занять годы, регулятор призывает банки уже сейчас начинать инвентаризацию, оценку рисков и планирование миграции.

cointelegraph39 мин. назад

Гонконг готовит банки к квантовым угрозам на фоне активного развития токенизации

cointelegraph39 мин. назад

Спокойный взгляд на отечественные литографические машины: 5 устройств поставлены, как далеко до вызова ASML?

Автор статьи призывает к трезвой оценке новостей о запуске малосерийного производства китайского иммерсионного DUV-степпера. Сообщается о планах по производству около 5 единиц оборудования в этом году для таких клиентов, как SMIC, и о цели выпуска примерно 20 единиц к 2027 году. Устройство ориентировано на 28-нм технологический процесс. Автор подчеркивает, что эта новость отражает переход от разработки к начальной стадии внедрения у заказчика, но не означает полномасштабного коммерческого производства или решения всех проблем с литографией. Отмечается сохраняющийся значительный разрыв с ASML по производительности, надежности и, особенно, по технологиям EUV, которые находятся на стадии прототипа. Прогресс в DUV важен для создания второго источника поставок и повышения безопасности цепочки поставок для зрелых и некоторых продвинутых техпроцессов, но не решает проблем экономичности производства на узлах 5 нм и ниже. Ключевыми индикаторами для отслеживания в ближайшие годы будут успешная валидация оборудования клиентом, стабильность работы, ключевые параметры (пропускная способность, точность совмещения) и получение повторных заказов. Делается вывод, что, хотя прогресс обнадеживает, до радикального изменения глобальной конкурентной картины в литографии еще далеко, и не стоит преждевременно экстраполировать ограниченные текущие успехи на весь рынок или инвестиционные перспективы.

marsbit43 мин. назад

Спокойный взгляд на отечественные литографические машины: 5 устройств поставлены, как далеко до вызова ASML?

marsbit43 мин. назад

800-кратная жемчужина: "Тяни карты" спасает NFT-трейдинг

Статья рассказывает о проекте Fake World Assets (FWA) — протоколе «лотереи» NFT в сети Ethereum, который за неделю после запуска достиг дохода в 1,3 млн долларов. Его токен $FWA вырос в 800 раз. Основная механика: пользователи вносят в пул NFT и ETH, создавая свои собственные «лотерейные билеты». Другие пользователи платят ETH за «вытягивание» случайного NFT из пула. Если NFT не нравится, его можно моментально продать обратно владельцу пула со скидкой 85% — разница и составляет прибыль владельца. При продаже можно выбрать получение ETH или токенов $FWA, что создаёт постоянный покупательский спрос на токен. Ключевой фактор успеха $FWA — невозможность купить токен напрямую, только через участие в лотерее. Это создало мощный цикл: рост цены $FWA привлекал новых участников лотереи для его получения, что, в свою очередь, создавало новый покупательский спрос и толкало цену вверх. В этом его преимущество перед другими похожими проектами (например, Collector Cards), чьи токены имеют слабую полезность. Однако автор отмечает, что эта модель, вероятно, неустойчива в долгосрочной перспективе. Если рост цены $FWA остановится, лотерея станет убыточной, и интерес к протоколу быстро угаснет. Вывод: высокая прибыльность проекта сама по себе — хрупкий нарратив в крипторынке, где ключевую роль играют внимание пользователей и механизмы преобразования этого внимания в покупательский спрос.

marsbit1 ч. назад

800-кратная жемчужина: "Тяни карты" спасает NFT-трейдинг

marsbit1 ч. назад

Угроза квантовых вычислений приближается, криптовалюты могут оказаться под ударом раньше банков

Квантовые вычисления представляют растущую угрозу для всех систем, основанных на криптографии, включая крупные банки и государственные сети. Однако из-за своей децентрализованной природы и открытого реестра криптовалюты, вероятно, первыми столкнутся с этой опасностью на практике. Как отмечают эксперты, такие как CEO Quantum Xchange Эдди Зервигон, криптовалюты действуют как «канарейка в угольной шахте» — их уязвимость станет ранним сигналом о появлении криптографически релевантных квантовых компьютеров. Согласно текущим оценкам, такие машины, способные запускать алгоритм Шора для взлома криптографии на эллиптических кривых (например, в Bitcoin), могут появиться уже около 2029 года. Исследования Google Quantum AI показывают, что необходимое для атаки количество кубитов значительно снизилось, а время взлома открытого ключа может составить всего около 9 минут. Главный вызов для криптовалют, таких как Bitcoin, заключается не столько в самой технологии, сколько в скорости принятия решений и обновления. В отличие от централизованных финансовых институтов, которым для перехода на постквантовые стандарты нужны лишь внутренние решения, децентрализованные сети требуют широкого консенсуса среди миллионов участников. Исторически масштабные обновления (например, SegWit) вызывали серьёзные разногласия и форки. По оценкам исследований, даже в идеальных условиях миграция всех уязвимых UTXO-адресов займёт не менее 76 дней, а задержка создаёт риски. Угроза также не является бинарным событием, которое произойдёт в один день. Даже если для взлома потребуются месяцы, активы, чьи публичные ключи уже раскрыты в блокчейне (примерно треть Bitcoin), остаются уязвимыми для «статических атак». Таким образом, временное окно для безопасного перехода ограничено. Криптовалюты, будучи первой целью, остро демонстрируют общую дилемму: технические решения постквантовой криптографии существуют, но их внедрение упирается в скорость и эффективность управления в децентрализованных системах. Их опыт станет важным уроком для всего финансового сектора.

marsbit1 ч. назад

Угроза квантовых вычислений приближается, криптовалюты могут оказаться под ударом раньше банков

marsbit1 ч. назад

Вот почему соглашение об этике в Законе CLARITY может быть таким трудным для достижения

Долгожданный законопроект США о рыночной ясности цифровых активов (CLARITY) столкнулся с новой преградой на пути к принятию — разногласиями по этическим нормам. Основной спор развернулся вокруг того, достаточно ли сильны положения об этике в текущем проекте закона и, что критически важно, какой орган должен обеспечивать их соблюдение. Демократы настаивают, что предложение республиканцев «недостаточно строгое». Их ключевая озабоченность — чрезмерная зависимость от Министерства юстиции США в вопросах правоприменения. Они хотят, чтобы генеральные прокуроры штатов также могли вмешиваться, если федеральные власти бездействуют. Сенаторы-демократы утверждают, что положения, касающиеся этики чиновников, защиты потребителей и противодействия незаконным финансовым операциям, должны быть усилены. Республиканцы же отстаивают единую федеральную систему правоприменения через Министерство юстиции, утверждая, что передача полномочий штатам создаст правовую неразбериху. Они называют этические положения в текущем проекте «самыми сильными в истории США». Согласно последнему проекту, высшим федеральным должностным лицам, включая президента, вице-президента и членов Конгресса, а также их супругам будет временно запрещено выпускать или спонсировать цифровые активы во время пребывания в должности. Криптоплатформам также будет запрещено листить такие активы. Ограничения истекают в 2029 году. Несмотря на тупик в вопросе об этике, многие отраслевые эксперты и наблюдатели полагают, что компромисс возможен. Они отмечают, что сам факт сужения споров до этических норм, а не общей структуры законопроекта, является признаком прогресса. Однако предупреждают, что отклонение законопроекта в погоне за идеальными формулировками может оставить рынок цифровых активов США вообще без новой нормативной базы, что продлит неопределённость и затормозит инновации.

cointelegraph1 ч. назад

Вот почему соглашение об этике в Законе CLARITY может быть таким трудным для достижения

cointelegraph1 ч. назад

Торговля

Спот

Популярные статьи

Как купить S

Добро пожаловать на HTX.com! Мы сделали приобретение Sonic (S) простым и удобным. Следуйте нашему пошаговому руководству и отправляйтесь в свое крипто-путешествие.Шаг 1: Создайте аккаунт на HTXИспользуйте свой адрес электронной почты или номер телефона, чтобы зарегистрироваться и бесплатно создать аккаунт на HTX. Пройдите удобную регистрацию и откройте для себя весь функционал.Создать аккаунтШаг 2: Перейдите в Купить криптовалюту и выберите свой способ оплатыКредитная/Дебетовая Карта: Используйте свою карту Visa или Mastercard для мгновенной покупки Sonic (S).Баланс: Используйте средства с баланса вашего аккаунта HTX для простой торговли.Третьи Лица: Мы добавили популярные способы оплаты, такие как Google Pay и Apple Pay, для повышения удобства.P2P: Торгуйте напрямую с другими пользователями на HTX.Внебиржевая Торговля (OTC): Мы предлагаем индивидуальные услуги и конкурентоспособные обменные курсы для трейдеров.Шаг 3: Хранение Sonic (S)После приобретения вами Sonic (S) храните их в своем аккаунте на HTX. В качестве альтернативы вы можете отправить их куда-либо с помощью перевода в блокчейне или использовать для торговли с другими криптовалютами.Шаг 4: Торговля Sonic (S)С легкостью торгуйте Sonic (S) на спотовом рынке HTX. Просто зайдите в свой аккаунт, выберите торговую пару, совершайте сделки и следите за ними в режиме реального времени. Мы предлагаем удобный интерфейс как для начинающих, так и для опытных трейдеров.

1.7k просмотров всегоОпубликовано 2025.01.15Обновлено 2026.06.02

Как купить S

Sonic: Обновления под руководством Андре Кронье – новая звезда Layer-1 на фоне спада рынка

Он решает проблемы масштабируемости, совместимости между блокчейнами и стимулов для разработчиков с помощью технологических инноваций.

2.4k просмотров всегоОпубликовано 2025.04.09Обновлено 2025.04.09

Sonic: Обновления под руководством Андре Кронье – новая звезда Layer-1 на фоне спада рынка

HTX Learn: Пройдите обучение по "Sonic" и разделите 1000 USDT

HTX Learn — ваш проводник в мир перспективных проектов, и мы запускаем специальное мероприятие "Учитесь и Зарабатывайте", посвящённое этим проектам. Наше новое направление .

1.9k просмотров всегоОпубликовано 2025.04.10Обновлено 2025.04.10

HTX Learn: Пройдите обучение по "Sonic" и разделите 1000 USDT

Обсуждения

Добро пожаловать в Сообщество HTX. Здесь вы сможете быть в курсе последних новостей о развитии платформы и получить доступ к профессиональной аналитической информации о рынке. Мнения пользователей о цене на S (S) представлены ниже.

活动图片