a16z: «Амнезия» ИИ, может ли непрерывное обучение ее вылечить?

marsbitОпубликовано 2026-04-25Обновлено 2026-04-25

Введение

В статье a16z рассматривается проблема «амнезии» больших языковых моделей (LLM), которые после обучения не могут обновлять свои параметры новыми знаниями, подобно герою фильма «Помни» с антероградной амнезией. Для компенсации используются внешние методы, такие как контекстное обучение (ICL) и системы поиска, но они не позволяют моделям по-настоящему усваивать информацию. Авторы утверждают, что контекстное обучение, хотя и эффективно, имеет ограничения: оно не подходит для решения truly новых задач (например, математических доказательств),对抗ных сценариев или работы с неявными знаниями. Настоящее обучение требует сжатия (compression) опыта в параметры модели. Предлагается подход непрерывного обучения (continual learning), который позволяет моделям обновлять свои веса после развертывания. Рассматриваются три основных пути: работа с контекстом (внешняя память), модульные подходы (адаптеры) и прямое обновление параметров (весов). Последний метод — самый сложный, но именно он позволяет моделям полностью усваивать новые знания и навыки. Статья также затрагивает проблемы катастрофического забывания, безопасности и аудируемости, которые возникают при обновлении весов, и рассматривает текущий ландшафт стартапов, работающих над этими решениями. Ключевой вывод: будущее — за гибридными системами, сочетающими контекстное обучение, модульность и параметрическое обновление для создания моделей, способных к непрерывному совершенствованию.

Оригинальные авторы: Malika Aubakirova, Matt Bornstein, a16z crypto

Оригинальная компиляция: Deep Tide TechFlow

В «Помни» (Memento) Кристофера Нолана главный герой Леонард Шелби живет в раздробленном настоящем. Повреждение мозга привело к тому, что у него развилась антероградная амнезия, не позволяющая формировать новые воспоминания. Каждые несколько минут его мир перезагружается, он застревает в вечном «сейчас», не помня, что произошло только что, и не зная, что будет дальше. Чтобы выжить, он делает татуировки на теле, пользуется поляроидом, полагаясь на эти внешние инструменты как на замену функции памяти, которую его мозг не может выполнить.

Большие языковые модели (LLM) живут в аналогичном вечном настоящем. После завершения обучения огромный объем знаний замораживается в параметрах, модель не может формировать новые воспоминания, не может обновлять свои параметры на основе нового опыта. Чтобы компенсировать этот недостаток, мы строим для нее множество лесов: история чата служит кратковременными заметками, система поиска — внешним блокнотом, системные промты — как татуировки на теле. Но сама модель никогда по-настоящему не усваивает эту новую информацию.

Все больше исследователей считают, что этого недостаточно. Задачи, которые может решить обучение в контексте (ICL), предполагают, что ответ (или его фрагменты) уже существует где-то в мире. Но для тех проблем, которые требуют настоящего открытия (например, новое математическое доказательство), adversarial-сценариев (например, безопасность, атаки и защита) или тех знаний, которые слишком неявны и не могут быть выражены словами, есть веские основания полагать: модели нужен способ напрямую записывать новые знания и опыт в параметры после развертывания.

Обучение в контексте временно. Настоящее обучение требует сжатия. Пока мы не позволим моделям непрерывно сжимать, мы, возможно, застрянем в вечном настоящем «Помни». С другой стороны, если мы сможем обучить модели их собственной архитектуре памяти, а не полагаться на внешние кастомные инструменты, это может открыть совершенно новое измерение масштабирования (scaling).

Эта область исследований называется непрерывным обучением (continual learning). Концепция не нова (см. статью McCloskey и Cohen 1989 года), но мы считаем ее одним из важнейших направлений исследований в современном ИИ. Взрывной рост возможностей моделей за последние два-три года сделал разрыв между тем, что модель «уже знает» и «может узнать», все более очевидным. Цель этой статьи — поделиться тем, что мы узнали от ведущих исследователей этой области, помочь прояснить различные пути непрерывного обучения и продвинуть эту тему в предпринимательской экосистеме.

Примечание: Формирование этой статьи стало возможным благодаря глубокому общению с группой выдающихся исследователей, аспирантов и предпринимателей, которые щедро поделились с нами своей работой и идеями в области непрерывного обучения. От теоретических основ до инженерных реалий обучения после развертывания, их инсайты сделали эту статью гораздо более основательной, чем если бы мы писали ее в одиночку. Спасибо за ваше время и идеи!

Сначала о контексте

Прежде чем защищать обучение на уровне параметров (т.е. обучение с обновлением весов модели), стоит признать факт: обучение в контексте действительно работает. И есть веский аргумент в пользу того, что оно будет продолжать побеждать.

Суть Transformer — это предсказание следующего токена на основе последовательности с условием. Дайте ему правильную последовательность, и вы получите удивительно богатое поведение, даже не касаясь весов. Вот почему такие методы, как управление контекстом, инженерия промтов, тонкая настройка по инструкциям (instruction fine-tuning) и few-shot примеры, так мощны. Интеллект инкапсулирован в статических параметрах, а проявляемые способности резко меняются в зависимости от того, что вы подаете в окно.

Недавняя глубокая статья Cursor о масштабировании автономных программирующих агентов — хороший пример: веса модели фиксированы, а真正 заставляет систему работать — тщательная оркестровка контекста — что в него поместить, когда делать суммаризацию, как поддерживать связное состояние в течение часов автономной работы.

OpenClaw — еще один хороший пример. Он стал популярным не из-за особых прав доступа к модели (базовую модель могут использовать все), а потому, что он чрезвычайно эффективно преобразует контекст и инструменты в рабочее состояние: отслеживает, что вы делаете, структурирует промежуточные результаты, решает, когда повторно вводить промты, поддерживает постоянную память о предыдущей работе. OpenClaw поднял «дизайн оболочки» агента на уровень самостоятельной дисциплины.

Когда инженерия промтов только появилась, многие исследователи скептически относились к тому, что «только промты» могут стать серьезным интерфейсом. Это выглядело как хак. Но это родной продукт архитектуры Transformer, не требующий переобучения и автоматически улучшающийся с прогрессом моделей. Модели становятся сильнее — промты становятся сильнее. «Грубые, но родные» интерфейсы часто побеждают, потому что они напрямую связаны с базовой системой, а не борются с ней. До сих пор развитие LLM шло именно по этому пути.

Модели пространства состояний: контекст на стероидах

Когда основные рабочие процессы переходят от простых вызовов LLM к агентским циклам, на модели обучения в контексте ложится все большее давление. Раньше контекстное окно заполнялось полностью относительно редко. Обычно это происходило, когда от LLM требовалось выполнить длинную серию дискретных задач, и уровень приложения мог относительно прямо обрезать и сжимать историю чата.

Но для агента одна задача может съесть значительную часть общего доступного контекста. Каждый шаг агентского цикла зависит от контекста, переданного предыдущими итерациями. И они часто терпят неудачу после 20–100 шагов, потому что «нить обрывается»: контекст заполняется, связность ухудшается, сходимость невозможна.

Поэтому основные AI-лаборатории сейчас вкладывают значительные ресурсы (то есть масштабные тренировочные прогоны) в разработку моделей со сверхдлинным контекстным окном. Это естественный путь, поскольку он строится на уже работающем методе (обучение в контексте) и соответствует общей тенденции отрасли к смещению в сторону вычислений во время вывода (inference-time computation). Наиболее распространенная архитектура — вставка слоев фиксированной памяти между обычными attention-головками, а именно модели пространства состояний (SSM) и варианты линейного внимания (далее统称为 SSM). SSM обеспечивают принципиально лучшую кривую масштабирования в сценариях с длинным контекстом.

Подпись к рисунку: Сравнение масштабирования SSM и традиционного механизма внимания

Цель — помочь агентам увеличить количество связных шагов выполнения на несколько порядков, примерно с 20 шагов до примерно 20 000, без потери широких навыков и знаний, предоставляемых традиционным Transformer. В случае успеха это станет значительным прорывом для долго работающих агентов.

Вы даже можете рассматривать этот метод как форму непрерывного обучения: хотя веса модели не обновляются, но вводится внешний слой памяти, который почти не требует сброса.

Итак, эти непараметрические методы реальны и мощны. Любая оценка непрерывного обучения должна начинаться отсюда. Вопрос не в том, полезны ли сегодняшние контекстные системы — они полезны. Вопрос в том: увидели ли мы уже потолок, и могут ли новые методы продвинуть нас дальше.

Чего не хватает контексту: «Ошибка архивного шкафа»

«С AGI и предварительным обучением произошло то, что они в некотором смысле перескочили... Люди — не AGI. Да, у людей есть база навыков, но людям не хватает огромного количества знаний. Мы зависим от непрерывного обучения.

Если я создам сверхумного 15-летнего подростка, он ничего не будет знать. Хороший ученик, очень жаждущий учиться. Вы можете сказать: иди в программисты, иди в врачи. Само развертывание будет включать процесс обучения, проб и ошибок. Это процесс, а не выброс готового продукта. — Ilya Sutskever»

Представьте систему с бесконечным пространством для хранения. Самый большой в мире архивный шкаф, каждый факт идеально индексирован, мгновенно доступен для поиска. Он может найти что угодно. Он научился?

Нет. Его никогда не заставляли сжимать.

В этом суть нашего аргумента, который ссылается на ранее высказанную мысль Ильи Суцкевера: LLM по своей сути являются алгоритмами сжатия. В процессе обучения они сжимают интернет в параметры. Сжатие происходит с потерями, и именно эта потерянность делает его мощным. Сжатие заставляет модель искать структуру, обобщать, строить представления, которые можно переносить между контекстами. Модель, которая заучивает все тренировочные образцы наизусть, хуже модели, которая извлекает underlying закономерности. Сжатие с потерями — это и есть обучение.

Ирония в том, что механизм, который делает LLM такими мощными во время обучения (сжатие сырых данных в компактные, переносимые представления), — это именно то, что мы отказываемся позволить им делать после развертывания. Мы останавливаем сжатие в момент выпуска, заменяя его внешней памятью.

Конечно, большинство агентских оболочек так или иначе сжимают контекст особым образом. Но разве горький урок (bitter lesson) не говорит нам о том, что сама модель должна научиться этому сжатию, прямо, в больших масштабах?

Юй Сун привел пример, иллюстрирующий эти дебаты: математика. Взгляните на Великую теорему Ферма. Более 350 лет ни один математик не мог ее доказать не потому, что им не хватало правильной литературы, а потому, что решение было高度新颖ным (высоконоваторским). Концептуальное расстояние между существующими математическими знаниями и окончательным ответом было слишком велико.

Когда Эндрю Уайлс наконец攻克 (преодолел) ее в 1990-х, он провел семь лет, работая почти в изоляции, и ему пришлось изобретать全新的 (совершенно новые) techniques, чтобы прийти к ответу. Его доказательство опиралось на успешное соединение двух различных математических分支 (ветвей): эллиптических кривых и модулярных форм. Хотя Кен Рибет ранее доказал, что если установить эту связь, то это автоматически решит теорему Ферма, до Уайлса ни у кого не было теоретических инструментов, чтобы фактически построить этот мост. Аналогичный аргумент можно привести и для доказательства гипотезы Пуанкаре Григорием Перельманом.

Ключевой вопрос: Доказывают ли эти примеры, что LLM не хватает чего-то, некоторой способности обновлять априорные знания, по-настоящему творчески мыслить? Или эта история как раз доказывает обратное — все человеческие знания — это просто данные для тренировки и рекомбинации, а Уайлс и Перельман просто продемонстрировали то, что LLM смогут делать в большем масштабе?

Этот вопрос эмпирический, ответ еще не известен. Но мы точно знаем, что есть много категорий проблем, с которыми обучение в контексте сегодня не справляется, а обучение на уровне параметров может помочь. Например:

Подпись к рисунку: Категории проблем, где обучение в контексте терпит неудачу, а параметрическое обучение может преуспеть

Что еще более важно, обучение в контексте может обрабатывать только то, что можно выразить словами, а веса могут кодировать концепции, которые невозможно передать словами в промте. Некоторые паттерны имеют слишком высокую размерность, слишком неявны, слишком глубоко структурированы, чтобы поместиться в контекст. Например, визуальная текстура, отличающая доброкачественный артефакт от опухоли на медицинском скане, или微波动 (микрофлуктуации) аудио, определяющие уникальный ритм говорящего, — эти паттерны不容易 (не легко) разложить на точные слова.

Язык может лишь приблизительно их передать. Самый длинный промт не передаст这些东西 (эти вещи); такие знания могут жить только в весах. Они живут в латентном пространстве изученных представлений, а не в словах. Независимо от того, насколько вырастет контекстное окно, всегда будут знания, которые невозможно описать текстом, их можно передать только параметрами.

Это, возможно, объясняет, почему явные функции «робот помнит тебя» (например, memory в ChatGPT) часто вызывают у пользователей скорее дискомфорт, чем восторг. Пользователи на самом деле хотят не «вспомнить», а «способность». Модель, которая усвоила ваши паттерны поведения, может обобщать для новых сценариев; модель, которая просто вспоминает вашу историю, — нет. Разница между «Вот что вы написали в ответ на это письмо в прошлый раз» (дословное повторение) и «Я достаточно понимаю ваш образ мышления, чтобы предугадать, что вам нужно» — это разница между поиском и обучением.

Введение в непрерывное обучение

Непрерывное обучение имеет несколько путей. Разделительная линия не в «есть ли функция памяти», а в: Где происходит сжатие? Эти пути распределены по спектру: от отсутствия сжатия (чистый поиск, замороженные веса), до полного внутреннего сжатия (обучение на уровне весов, модель становится умнее), с важной промежуточной зоной (модули).

Подпись к рисунку: Три пути непрерывного обучения — контекст, модули, веса

Контекст

Со стороны контекста команды строят более умные пайплайны поиска, агентские оболочки и оркестрацию промтов. Это самая зрелая категория: инфраструктура проверена, путь развертывания ясен. Ограничение — в глубине: длина контекста.

Заметное новое направление: мульти-агентные архитектуры как стратегия масштабирования самого контекста. Если одна модель ограничена окном в 128K токенов, то скоординированная группа агентов — каждый со своим контекстом, сфокусированный на своем срезе проблемы, общающийся результатами с другими — может в целом аппроксимировать бесконечную рабочую память. Каждый агент делает обучение в контексте в своем окне; система агрегирует. Недавний проект autoresearch Карпати и пример Cursor с построением веб-браузера — ранние кейсы. Это чисто непараметрический подход (без изменения весов), но он значительно поднимает потолок возможностей контекстных систем.

Модули

В пространстве модулей команды строят подключаемые модули знаний (сжатые KV-кэши, адаптерные слои, внешние хранилища памяти), которые позволяют универсальной модели специализироваться без переобучения. Модель на 8B с подходящим модулем может соответствовать производительности модели на 109B на целевой задаче, с占用内存 (занимаемой памятью), составляющей其零头 (ее долю). Привлекательность в совместимости с существующей инфраструктурой Transformer.

Веса

Со стороны обновления весов исследователи стремятся к настоящему обучению на уровне параметров: разреженные слои памяти, обновляющие только relevant фрагменты параметров, циклы обучения с подкреплением (RL), оптимизирующие модель на основе обратной связи, обучение во время тестирования (test-time training), сжимающее контекст в веса во время вывода. Это самые глубокие методы, и их сложнее всего развернуть, но они真正 позволяют модели полностью усваивать новую информацию или новые навыки.

Конкретные механизмы обновления параметров разнообразны. Перечислим несколько направлений исследований:

Подпись к рисунку: Обзор направлений исследований обучения на уровне весов

Исследования на уровне весов охватывают несколько параллельных направлений. Методы регуляризации и пространства весов имеют самую долгую историю: EWC (Kirkpatrick et al., 2017) штрафует изменения параметров в зависимости от их важности для предыдущих задач; интерполяция весов (Kozal et al., 2024) смешивает старые и новые конфигурации весов в пространстве параметров, но оба метода хрупки в large scale.

Обучение во время тестирования (Test-Time Training, TTT), впервые предложенное Sun et al.(2020), позже развилось в архитектурные примитивы (TTT-слои, TTT-E2E, TTT-Discover), с совершенно иным подходом: градиентный спуск на тестовых данных, сжатие новой информации в параметры в тот момент, когда это необходимо.

Мета-обучение задается вопросом: Можем ли мы обучить модели «учиться учиться»? От few-shot дружественной инициализации параметров в MAML (Finn et al., 2017) до вложенного обучения (Nested Learning, Behrouz et al., 2025), которое структурирует модель как иерархическую проблему оптимизации, с модулями, работающими на разных временных масштабах для быстрой адаптации и медленного обновления, вдохновленную биологическим консолидацией памяти.

Дистилляция сохраняет знания о предыдущих задачах, заставляя студенческую модель соответствовать замороженным контрольным точкам учителя. LoRD (Liu et al., 2025) делает дистилляцию достаточно эффективной для непрерывного运行 (работы), одновременно сжимая модель и буфер воспроизведения. Само-дистилляция (SDFT, Shenfeld et al., 2026) меняет источник, используя выводы модели самой себя в экспертных условиях как тренировочный сигнал, обходя катастрофическое забывание при последовательной тонкой настройке.

Рекурсивное самоусовершенствование работает по схожей логике: STaR (Zelikman et al., 2022) выводит способности к рассуждению из самогенерируемых цепочек рассуждений; AlphaEvolve (DeepMind, 2025) обнаружила оптимизации алгоритмов, которые не улучшались десятилетиями; «Эпоха опыта» (The Age of Experience) Сильвера и Саттона (2025) определяет обучение агента как永不停止ный поток непрерывного опыта.

Эти исследовательские направления сходятся. TTT-Discover уже объединил обучение во время тестирования и исследование, управляемое RL. HOPE вкладывает циклы быстрого и медленного обучения в единую архитектуру. SDFT превратила дистилляцию в базовую операцию самоулучшения. Границы между колонками размываются. Следующее поколение систем непрерывного обучения, вероятно, будет комбинировать多种 стратегии (множество стратегий): использовать регуляризацию для стабильности, мета-обучение для ускорения, самоулучшение для сложного процента. Все больше стартапов делают ставку на разные уровни этого технологического стека.

Ландшафт стартапов в области непрерывного обучения

Непараметрический конец спектра наиболее известен. Компании-оболочки (Letta, mem0, Subconscious) строят слои оркестрации и лесов, управляя тем, что попадает в контекстное окно. Внешние хранилища и инфраструктура RAG (как Pinecone, xmemory)提供检索骨干 (предоставляют хребет для поиска). Данные существуют, задача — предоставить правильный срез в правильное время перед моделью. По мере расширения контекстных окон, пространство для проектирования этих компаний также растет, особенно на стороне оболочек, где появляется новая волна стартапов для управления日益复杂的 (все более сложными) контекстными стратегиями.

Параметрический конец более ранний и более разнообразный. Здесь компании экспериментируют с какой-либо версией «сжатия после развертывания», позволяя модели усваивать новую информацию в весах. Пути大致可以分成几种不同的赌注 (грубо можно разделить на несколько различных ставок) о том, «как» модель должна учиться после выпуска.

Частичное сжатие: учиться без переобучения. Некоторые команды строят подключаемые модули знаний (сжатые KV-кэши, адаптерные слои, внешние хранилища памяти), которые позволяют универсальной модели специализироваться, не трогая核心权重 (основные веса). Общий аргумент: вы получаете meaningful сжатие (не просто поиск), сохраняя при этом компромисс стабильность-пластичность управляемым, поскольку обучение изолировано, а не разбросано по всему пространству параметров. Модель на 8B с подходящим модулем может соответствовать производительности гораздо большей модели на целевой задаче. Преимущество — компоновочность: модули можно подключать и использовать с существующей архитектурой Transformer, их можно независимо заменять или обновлять, стоимость экспериментов намного ниже, чем при переобучении.

RL и циклы обратной связи: учиться на сигналах. Другие команды делают ставку на то, что самый богатый сигнал для обучения после развертывания уже существует в самом цикле развертывания — пользовательские исправления, успех или провал задачи, сигналы вознаграждения от результатов реального мира. Ключевая идея: модель должна рассматривать каждое взаимодействие как потенциальный тренировочный сигнал, а не просто запрос на вывод. Это очень похоже на то, как люди进步 (прогрессируют) в работе: делают работу, получают обратную связь, усваивают, какие методы работают. Инженерная задача состоит в том, чтобы превратить разреженные, зашумленные, иногда adversarial отзывы в стабильные обновления весов, избегая катастрофического забывания. Но модель, которая действительно может учиться на развертывании, будет создавать сложный процент ценности способами, недоступными для контекстных систем.

Data-centric: учиться на правильных сигналах. Смежная, но отличная ставка: узкое место не в алгоритме обучения, а в тренировочных данных и окружающих системах. Эти команды专注于筛选,生成或合成正确的数据来驱动持续更新 (фокусируются на отборе, генерации или синтезе правильных данных для驱动持续更新): предпосылка в том, что модель с высококачественными, хорошо структурированными обучающими сигналами потребует гораздо меньше шагов градиента для meaningful улучшения. Это естественно сочетается с компаниями, работающими с циклами обратной связи, но акцент делается на вышестоящей проблеме: может ли модель учиться — это одно, а от чего она должна учиться и до какой степени — другое.

Новые архитектуры: способность к обучению, заложенная в основе. Самая радикальная ставка认为 Transformer 架构本身就是瓶颈 (считает, что сама архитектура Transformer является узким местом), непрерывное обучение требует принципиально иных вычислительных примитивов: архитектур с динамикой непрерывного времени и встроенными механизмами памяти. Аргумент здесь структурный: если вы хотите систему непрерывного обучения, вы должны встроить механизм обучения в底层基础架构 (нижний уровень базовой архитектуры).

Подпись к рисунку: Ландшафт стартапов в области непрерывного обучения

Все основные лаборатории также активно работают в этих категориях. Одни исследуют лучшее управление контекстом и chain-of-thought рассуждения, другие экспериментируют с внешними модулями памяти или sleep-time вычислительными пайплайнами, а несколько стелс-компаний追求新架构 (преследуют новые архитектуры). Эта область достаточно молода, ни один метод еще не победил, и учитывая широту вариантов использования, не должен быть только один победитель.

Почему простое обновление весов проваливается

Обновление параметров модели в производственной среде вызывает一连串 (цепочку) режимов отказа, которые в настоящее время не решены в large scale.

Подпись к рисунку: Режимы отказа при простом обновлении весов

Инженерные проблемы хорошо задокументированы. Катастрофическое забывание означает, что модель, достаточно чувствительная к новым данным для обучения, разрушит existing представления — дилемма стабильности-пластичности. Временное разделение (Temporal decoupling) означает, что неизменные правила и изменчивое состояние сжаты в один и тот же набор весов, обновление одного повреждает другое. Логическая интеграция терпит неудачу, потому что обновления фактов не распространяются на их следствия: изменения ограничены на уровне token-последовательностей, а не семантических концепций. Забывание (unlearning) все еще невозможно: не существует дифференцируемой операции вычитания, поэтому нет точного хирургического метода удаления ложных или токсичных знаний.

Есть второй класс проблем, которому уделяется меньше внимания. Текущее разделение обучения и развертывания — это не просто инженерное удобство, это граница безопасности, аудируемости и управления. Открытие этой границы приводит к одновременному возникновению множества проблем. Безопасное alignment может непредсказуемо деградировать: даже узкая тонкая настройка на benign данных может вызвать широкое рассогласование поведения.

Непрерывное обновление создает поверхность для атак data poisoning — медленную, устойчивую версию prompt injection, но она живет в весах. Аудируемость рушится, потому что continuously обновляемая модель — это движущаяся мишень, невозможно контролировать версии, проводить регрессионное тестирование или一次性 сертификацию. Риски для конфиденциальности усугубляются, когда пользовательские взаимодействия сжимаются в параметры, и конфиденциальная информация запекается в представления, что затрудняет ее фильтрацию по сравнению с информацией в контексте поиска.

Это открытые проблемы, а не фундаментальная невозможность. Их решение является частью исследовательской программы непрерывного обучения так же, как и решение основных архитектурных challenges.

От «Помни» к настоящей памяти

Трагедия Леонарда в «Помни» не в том, что он не может функционировать — в любой given сцене он resourceful, даже блестящий. Его трагедия в том, что он никогда не может создавать сложный процент. Каждый опыт остается внешним — поляроид, татуировка, записка чужым почерком. Он может искать, но он не может сжимать новые знания.

Пока Леонард движется по этому самостроенному лабиринту, граница между реальностью и верой начинает размываться. Его состояние не просто лишает его памяти; оно заставляет его постоянно重建意义 (перестраивать смысл), делая его одновременно детективом и ненадежным рассказчиком в своей собственной истории.

Современный ИИ работает в тех же ограничениях. Мы построили очень мощные системы поиска: более длинные контекстные окна, более умные оболочки, скоординированные группы агентов, и они работают. Но поиск — это не обучение. Система, которая может найти любой факт, не вынуждена искать структуру. Она не вынуждена обобщать. То самое有损压缩 (сжатие с потерями), которое сделало обучение таким мощным — механизм превращения сырых данных в переносимые представления — это именно то, что мы выключаем в момент развертывания.

Путь вперед, вероятно, не в единном прорыве, а в layered системе. Обучение в контексте останется первой линией адаптации: оно родное, проверенное и постоянно улучшающееся. Модульные механизмы могут处理中间地带 (обрабатывать промежуточную зону) персонализации и domain специализации.

Но для那些真正困难的问题 (тех по-настоящему трудных проблем) — открытий, adversarial адаптации, неявных знаний, которые невозможно выразить словами — нам, возможно, потребуется позволить моделям продолжать сжимать опыт в параметры после обучения. Это означает прогресс в разреженных архитектурах, мета-обучающих целях и циклах самоулучшения. Это также может потребовать от нас重新定义 (переопределить) значение «модели»: не как набор фиксированных весов, а как evolving систему, включающую ее память, ее алгоритм обновления и ее способность абстрагироваться от собственного опыта.

Архивный шкаф становится все больше. Но даже самый большой архивный шкаф — все еще只是档案柜 (просто архивный шкаф). Прорыв заключается в том, чтобы позволить модели после развертывания делать то, что сделало ее мощной во время обучения: сжимать, абстрагировать, учиться. Мы находимся на переломном моменте от моделей с амнезией к моделям с проблеском опыта. В противном случае мы застрянем в собственном «Помни».

Трендовые криптовалюты

Связанные с этим вопросы

QЧто такое «синдром постоянного настоящего» у больших языковых моделей (LLM) и как он связан с проблемой памяти?

A«Синдром постоянного настоящего» — это аналогия, описывающая неспособность LLM формировать новые воспоминания после завершения обучения. Как и у главного героя фильма «Помни» с амнезией, знания модели «замораживаются» в её параметрах в момент обучения. Для работы с новой информацией модели приходится полагаться на внешние «костыли», такие как история чата, системы поиска и подсказки, но сама модель никогда не усваивает эту информацию на уровне параметров.

QКаковы ключевые ограничения обучения в контексте (in-context learning) и в каких случаях оно неэффективно?

AОбучение в контексте эффективно, когда ответ или его фрагменты уже существуют где-то в мире и могут быть найдены. Однако оно терпит неудачу в случаях, требующих подлинного открытия (например, новое математическое доказательство), в adversarial-сценариях (например, безопасность) или для работы со скрытыми знаниями, которые трудно выразить словами. Оно является временным решением и не обеспечивает сжатия и обобщения информации, как это делает обучение на уровне параметров.

QКакие три основных пути существуют в области непрерывного обучения (continual learning) и чем они отличаются?

A1. **Контекст (Непараметрический):** Улучшение систем извлечения информации, оболочек ИИ и управления контекстом без изменения весов модели. Ограничение — длина контекста. 2. **Модули:** Создание подключаемых модулей знаний (адаптеры, кэши, внешняя память), которые специализируют общую модель без её переобучения. 3. **Веса (Параметрический):** Прямое обновление весов модели через разреженное обновление, обучение с подкреплением (RL) или обучение во время тестирования (test-time training). Это самый глубокий, но и самый сложный для развёртывания метод.

QС какими основными проблемами сталкивается простое (наивное) обновление весов моделей в продакшене?

A1. **Катастрофическое забывание:** Модель забывает ранее изученные знания при обучении на новых данных. 2. **Временное разъединение:** Постоянные правила и изменчивые состояния «сжаты» в одних и тех же весах, их обновление нарушает друг друга. 3. **Проблемы безопасности и управления:** Обновления могут непредсказуемо ухудшить выравнивание модели (safety alignment), создать поверхность для атак (например, медленное poisoning данных) и усложнить аудит и контроль версий. 4. **Невозможность «забыть»:** Отсутствие операции точного «удаления» ложных или вредных знаний из весов.

QКакую фундаментальную проблему решает сжатие (compression) в обучении моделей и почему оно важно?

AСжатие — это процесс преобразования сырых данных в компактные, обобщаемые и переносимые представления (representation) в параметрах модели. Именно необходимость сжимать данные во время обучения заставляет модель искать структуру, обобщать и выявлять глубинные закономерности. Это основа её способности к рассуждению и переносу знаний. Остановка этого процесса после развёртывания лишает модель возможности по-настоящему усваивать новый опыт и делать его частью своей «личности» и способностей.

Похожее

Хуан Сяомин, Ли Бинь, Лэй Цзюнь, Лян Вэньфэн... Пир IPO Changxin: кто стал самым большим победителем?

Компания Changxin Technology вышла на IPO на научно-технологической бирже STAR в Китае, заняв первое место по капитализации на рынке A-акций с показателем 3,28 трлн юаней. Это событие спровоцировало волну обогащения для ряда инвесторов и сотрудников. Основатель компании Чжу Имин стал крупнейшим бенефициаром: стоимость его доли в Changxin оценивается примерно в 80 млрд юаней, а общее состояние семьи, по данным индекса Bloomberg, достигло 13,9 млрд долларов, увеличившись почти на 300%. Более 237 сотрудников компании стали миллионерами (в юанях). Среди других заметных победителей: * **Лян Вэньфэн**, основатель Deepseek: его фонды получили прибыль около 827 млн юаней от первичного размещения акций. * **Кун Цзяньпин**, основатель Nano Labs: косвенно владеет акциями на сумму около 940 млн юаней, что означает окупаемость инвестиций 2020 года примерно в 44 раза. * **Хуан Сяомин** (бывший топ-менеджер Midea Group): прибыль от инвестиций составила примерно 503 млн юаней. * **Ли Бинь**, основатель NIO, и **Лэй Цзюнь**, основатель Xiaomi: через свои компании они участвовали в стратегическом размещении. Прибыль NIO оценивается примерно в 740 млн юаней, а компании Xiaomi — примерно в 736 млн юаней (в ответе Xiaomi подчеркнули, что это корпоративные инвестиции, а не личное богатство Лэй Цзюня). Основатель Чжу Имин также объявил о планах безвозмездно передать акции на сумму свыше 37,6 млрд юаней для будущего поощрения сотрудников, что может стать крупнейшей программой стимулирования в истории A-акций.

marsbit9 мин. назад

Хуан Сяомин, Ли Бинь, Лэй Цзюнь, Лян Вэньфэн... Пир IPO Changxin: кто стал самым большим победителем?

marsbit9 мин. назад

IOSG: От горячего хранилища к холодной памяти — децентрализованное хранение в эпоху бума хранения ИИ

Автор анализирует расходящиеся траектории развития централизованных систем хранения для ИИ и децентрализованного хранения (например, Filecoin, Arweave) в эпоху искусственного интеллекта. Хранилища для ИИ переживают бум, будучи переоценены как «двигатели эффективности», которые максимизируют скорость передачи данных (пропускную способность HBM, скорость SSD) для загрузки вычислений GPU. Их цель — ускорение, а не просто сохранение. Напротив, децентрализованное хранилище, находящееся в тени рынка, ориентировано на «максимальную надежность». Оно защищает «холодные данные» — долгосрочные архивы, публичные наборы данных, исторические записи — обеспечивая их неизменность, устойчивость к цензуре и постоянное сохранение с помощью криптографии и распределенных сетей. В статье подробно рассматривается многоуровневая архитектура хранилищ для ИИ (HBM, DRAM/CXL, SSD, HDD, ПО) и сравниваются философии Filecoin (верифицируемый рынок хранения) и Arweave (постоянный общественный уровень памяти). Подчеркивается, что текущие проблемы децентрализованного хранения связаны с несоответствием стимулов, отсутствием корпоративных услуг и сложностями с извлечением данных, а не с ошибочностью его ценностного предложения. В заключение отмечается, что хотя рынок в настоящее время вознаграждает эффективность ИИ-хранилищ, будущие факторы, такие как споры об авторских правах на ИИ, аудит данных и потребность в сохранении культурного наследия, могут привести к переоценке «надежного холодного уровня» децентрализованного хранения как необходимой инфраструктуры для долгосрочной памяти человечества.

marsbit10 мин. назад

IOSG: От горячего хранилища к холодной памяти — децентрализованное хранение в эпоху бума хранения ИИ

marsbit10 мин. назад

Экскурсия по штаб-квартире Changxin Technology в Хэфэе: Взлёт парка разжёг коммерцию в Чанганге, рядовые сотрудники «наблюдают» со стороны за историей обогащения

Во время посещения штаб-квартиры компании Changxin Technology в Хэфэе репортер отметил, что, несмотря на стремительный рост стоимости акций компании после IPO, большинство рядовых сотрудников не имеют доступа к опционам на акции, которые доступны только для руководителей уровня 9 и выше. Обычные сотрудники находятся на уровнях 11-12. На территории царит строгий режим безопасности и конфиденциальности: запрещены съемка и несанкционированные интервью, в производственных и исследовательских зонах требуется сдавать телефоны. Тем не менее, компания стала локомотивом развития всего района. Рядом со штаб-квартирой идет активное строительство (включая третий этап проекта), формируется коммерческая зона, растут цены на жилье. Район Чанганг, ранее бывший сельской местностью, превратился в оживленный деловой центр с многочисленными предприятиями общественного питания, обслуживающими сотрудников Changxin Technology и смежных компаний. Рабочий день сотрудников длительный, часто с переработками, но зарплаты в Хэфэе считаются высокими.

marsbit14 мин. назад

Экскурсия по штаб-квартире Changxin Technology в Хэфэе: Взлёт парка разжёг коммерцию в Чанганге, рядовые сотрудники «наблюдают» со стороны за историей обогащения

marsbit14 мин. назад

Хуан Сяомин, Ли Бинь, Лэй Цзюнь, Лян Вэньфэн… Пир на IPO компании ChangXin Technology, кто получил наибольшую выгоду?

Китайская компания Changxin Technology успешно разместила акции на научно-технологической бирже STAR в Шанхае, став самой дорогой компанией на китайском фондовом рынке с капитализацией 3,28 трлн юаней. Это привело к созданию большого количества состоятельных людей. Основатель Changxin Technology Чжу Имин стал самым крупным победителем, его состояние, связанное с долей в компании, оценивается примерно в 80 млрд юаней. Более 237 сотрудников компании стали миллионерами (в юанях). Основатель DeepSeek Лян Вэньфэн получил прибыль в размере 827 млн юаней за счет участия фондов под его управлением в размещении акций. Соучредитель Nano Labs Кун Цзяньпин, инвестировавший в компанию еще в 2020 году, получил значительную прибыль на свои косвенные акции. Среди других известных инвесторов — бывший топ-менеджер Midea Хуан Сяомин (прибыль около 503 млн юаней), основатель NIO Ли Бинь (прибыль около 740 млн юаней через стратегическое размещение) и компания Xiaomi, связанная с Лэй Цзюнем (бумажная прибыль более 700 млн юаней, хотя в компании подчеркивают, что это корпоративные инвестиции). Основатель Чжу Имин также объявил о планах безвозмездно передать акции на сумму более 37,6 млрд юаней для будущего поощрения сотрудников. Это IPO стало историческим событием, значительно обогатившим основателей, сотрудников и ранних инвесторов компании.

Odaily星球日报29 мин. назад

Хуан Сяомин, Ли Бинь, Лэй Цзюнь, Лян Вэньфэн… Пир на IPO компании ChangXin Technology, кто получил наибольшую выгоду?

Odaily星球日报29 мин. назад

Стабильные хранилища Aave

Aave представила продукт под названием Stable Vaults, который позволяет финтех-приложениям, необанкам и платформам (например, для расчета заработной платы) легко предлагать своим пользователям "сберегательные счета" с фиксированной процентной ставкой. Средства пользователей направляются в кредитные пулы Aave, но приложение-посредник (оператор) гарантирует стабильный доход, например, 4%, скрывая от пользователей волатильность реальной ставки в протоколе. Разницу между гарантированной ставкой и фактическим доходом от Aave забирает оператор, что является для него новым источником прибыли. Для пользователей это означает удобство: не нужно управлять криптокошельком, выбирать пулы или блокчейны. Однако они платят за это удобство, получая меньшую доходность, чем при прямом использовании Aave, и принимая на себя дополнительные риски, связанные с надежностью оператора и его внутренних скриптов. Для Aave Stable Vaults — это способ привлечь и удержать "ленивую" ликвидность от массовых пользователей, которая менее чувствительна к изменению ставок. Это повышает стабильность протокола и поддерживает выручку, необходимую для таких механизмов, как выкуп токенов AAVE. Автор отмечает, что, хотя прямой доступ к DeFi выгоднее, большинство пользователей предпочитают удобство и предсказуемость, что делает стратегию Aave прагматичной и соответствующей рыночному спросу.

marsbit33 мин. назад

Стабильные хранилища Aave

marsbit33 мин. назад

Торговля

Спот

Популярные статьи

Как купить S

Добро пожаловать на HTX.com! Мы сделали приобретение Sonic (S) простым и удобным. Следуйте нашему пошаговому руководству и отправляйтесь в свое крипто-путешествие.Шаг 1: Создайте аккаунт на HTXИспользуйте свой адрес электронной почты или номер телефона, чтобы зарегистрироваться и бесплатно создать аккаунт на HTX. Пройдите удобную регистрацию и откройте для себя весь функционал.Создать аккаунтШаг 2: Перейдите в Купить криптовалюту и выберите свой способ оплатыКредитная/Дебетовая Карта: Используйте свою карту Visa или Mastercard для мгновенной покупки Sonic (S).Баланс: Используйте средства с баланса вашего аккаунта HTX для простой торговли.Третьи Лица: Мы добавили популярные способы оплаты, такие как Google Pay и Apple Pay, для повышения удобства.P2P: Торгуйте напрямую с другими пользователями на HTX.Внебиржевая Торговля (OTC): Мы предлагаем индивидуальные услуги и конкурентоспособные обменные курсы для трейдеров.Шаг 3: Хранение Sonic (S)После приобретения вами Sonic (S) храните их в своем аккаунте на HTX. В качестве альтернативы вы можете отправить их куда-либо с помощью перевода в блокчейне или использовать для торговли с другими криптовалютами.Шаг 4: Торговля Sonic (S)С легкостью торгуйте Sonic (S) на спотовом рынке HTX. Просто зайдите в свой аккаунт, выберите торговую пару, совершайте сделки и следите за ними в режиме реального времени. Мы предлагаем удобный интерфейс как для начинающих, так и для опытных трейдеров.

1.7k просмотров всегоОпубликовано 2025.01.15Обновлено 2026.06.02

Как купить S

Sonic: Обновления под руководством Андре Кронье – новая звезда Layer-1 на фоне спада рынка

Он решает проблемы масштабируемости, совместимости между блокчейнами и стимулов для разработчиков с помощью технологических инноваций.

2.4k просмотров всегоОпубликовано 2025.04.09Обновлено 2025.04.09

Sonic: Обновления под руководством Андре Кронье – новая звезда Layer-1 на фоне спада рынка

HTX Learn: Пройдите обучение по "Sonic" и разделите 1000 USDT

HTX Learn — ваш проводник в мир перспективных проектов, и мы запускаем специальное мероприятие "Учитесь и Зарабатывайте", посвящённое этим проектам. Наше новое направление .

1.9k просмотров всегоОпубликовано 2025.04.10Обновлено 2025.04.10

HTX Learn: Пройдите обучение по "Sonic" и разделите 1000 USDT

Обсуждения

Добро пожаловать в Сообщество HTX. Здесь вы сможете быть в курсе последних новостей о развитии платформы и получить доступ к профессиональной аналитической информации о рынке. Мнения пользователей о цене на S (S) представлены ниже.

活动图片