# Сопутствующие статьи по теме Глубокое обучение

Новостной центр HTX предлагает последние статьи и углубленный анализ по "Глубокое обучение", охватывающие рыночные тренды, новости проектов, развитие технологий и политику регулирования в криптоиндустрии.

69-летний отец обучения с подкреплением Ричард Саттон основал стартап: создание 20-ваттного агента уровня человеческого мозга

69-летний Ричард Саттон, основоположник обучения с подкреплением и лауреат премии Тьюринга 2024 года, вместе со своим учеником Хуррамом Джаведом покинул Keen Technologies (основанную Джоном Кармаком) и основал собственную лабораторию — Oak Lab. Цель Oak Lab — создание интеллектуального агента с триллионом параметров, способного к обучению и планированию в реальном времени, с энергопотреблением всего 20 Вт, что сравнимо с энергозатратами человеческого мозга. Это является прямым ответом Саттона на его убеждение, что современные методы глубокого обучения неэффективны и требуют фундаментально новых идей, а не постепенных улучшений. Ключевая идея Oak Lab заключается в том, что «интеллект возникает из опыта, постоянно генерируемого во время работы». В отличие от современных больших языковых моделей, которые обучаются на статических наборах данных, агент Oak Lab должен постоянно обучаться на основе своего взаимодействия с окружающей средой, немедленно адаптируя свое поведение. Исследовательский подход лаборатории сосредоточен на архитектуре OaK (Options and Knowledge), которая позволяет агенту выделять из опыта абстрактные навыки (опции) и знания. Это позволяет разбивать сложные задачи на повторно используемые навыки, что является формой временной абстракции. Кроме того, система должна обучаться в реальном времени (размер пакета равен 1), без хранения и воспроизведения исторических данных, что, по замыслу, радикально снизит вычислительные затраты. Эта философия развивает идеи, изложенные Саттоном в его знаменитом эссе «Горький урок» (2019). Хотя он и признает успех масштабирования вычислений, он считает, что истинный интеллект должен происходить из опыта, генерируемого самим агентом в погоне за долгосрочными целями, а не только из данных, созданных и отобранных человеком. Oak Lab представляет собой практическое воплощение этого видения «эпохи опыта». Первым публичным выступлением Саттона после начала创业 станет доклад «Первые принципы обучения с подкреплением: выращивание сверхинтеллекта из опыта» на Всемирной конференции по искусственному интеллекту (WAIC) в Шанхае.

marsbit07/14 12:32

69-летний отец обучения с подкреплением Ричард Саттон основал стартап: создание 20-ваттного агента уровня человеческого мозга

marsbit07/14 12:32

Преобразуем Transformer, и большие языковые модели становятся умнее

В новой статье исследователей из Mila, Корнелльского и Монреальского университетов предлагается радикально простой способ улучшить большие языковые модели (LLM) без увеличения параметров или вычислительных затрат. Вместо равномерного распределения параметров по всем слоям модели, авторы предлагают использовать «конические языковые модели» (Tapered Language Models, TLM), где емкость (например, ширина прямого распространения) монотонно уменьшается от ранних слоев к более поздним. Эксперименты на моделях размером от 440M до 1.3B параметров показывают, что оптимальное распределение (уменьшение по косинусоидальной кривой) дает значительное улучшение. Например, для модели на 440M параметров perplexity снизился с 16.28 до 14.44, что соответствует улучшению на 1.84 пункта. Этот результат воспроизведен на четырех различных архитектурах, включая Transformer, модели с управляемым вниманием и архитектуры с долговременной памятью. Ключевое обоснование заключается в том, что ранние слои модели обрабатывают фундаментальную информацию (например, синтаксис) и нуждаются в большей емкости, в то время как более глубокие слои часто лишь повторяют или уточняют уже сформированные представления. Таким образом, перераспределение ресурсов в пользу начальных слоев повышает общую эффективность модели без дополнительных затрат. Исследователи отмечают, что этот принцип может быть применен не только к языковым моделям, но и к другим архитектурам, таким как Vision Transformer или диффузионные модели, где также исторически используется равномерное распределение параметров по слоям. Работа открывает новое, практически бесплатное направление для оптимизации современных нейронных сетей.

marsbit06/29 12:54

Преобразуем Transformer, и большие языковые модели становятся умнее

marsbit06/29 12:54

Как использовать Dynamic Workflows Claude для глубокого исследования

**Глубокие исследования с помощью Dynamic Workflows в Claude** Технические исследования часто сопряжены с рисками: большой объем информации размывает выводы. ИИ, хотя и эффективен в выполнении задач, часто "застревает" в текущих данных и слаб в междисциплинарных ассоциациях. Функция **Dynamic Workflows** в Claude решает эту проблему, автоматически проектируя оптимальный рабочий процесс для задачи перед ее выполнением, включая логику проверки и сходимости результатов. **Шесть встроенных режимов рабочего процесса:** 1. **Маршрутизация (Classify-And-Act):** Задача анализируется и направляется наиболее подходящему агенту. Эффективно и экономно, но слабо для нечетких задач. 2. **Разделение и слияние (Fan-out & Merge):** Задача параллельно разделяется на независимые подзадачи, результаты которых затем объединяются. Быстро и изолированно, но дорого по токенам. 3. **Антивирусная проверка (Adversarial Verification):** Один агент генерирует вывод, а другие оспаривают его. Решение принимается большинством голосов, устраняя предвзятость. 4. **Генерация и фильтрация (Generate & Filter):** Сначала создается множество вариантов, затем фильтруется по строгим критериям для получения лучших. Обеспечивает разнообразие, но зависит от качества фильтров. 5. **Турнирный режим (Tournament):** Несколько агентов конкурируют за выполнение одной задачи, последовательно выбывая в попарных сравнениях. Дает стабильный и надежный результат. 6. **Циклический режим (Loop):** Агент итеративно пытается выполнить задачу, собирая информацию об ошибках и адаптируясь, пока не будет выполнено условие остановки. Подходит для задач с неопределенным объемом работы. **Сравнение с пользовательскими подходами:** Авторская система deep-research страдала от отсутствия целенаправленной сходимости, перегружая информацией без четких выводов для принятия решений. Встроенный рабочий процесс Claude превосходит ее благодаря: * **Слою декомпозиции проблемы**, который сначала уточняет цели и подвопросы. * **Оценке достоверности** для каждой найденной информации. * **Скрещенному удалению** выводов с низким рейтингом вместо их простого усреднения. * **Целеориентированному выводу**, который предоставляет суждения и рекомендации, а не просто сводку данных. Это решает ключевые проблемы ИИ в длительных задачах: дрейф цели, преждевременная остановка, загрязнение контекста и предвзятость вывода. Динамические рабочие процессы структурируют сам процесс исследования, сокращая необходимое количество диалогов и повышая качество результатов, хотя и значительно увеличивают потребление токенов. **Оставшиеся ограничения:** Для абсолютно надежных выводов, особенно в таких областях, как блокчейн, где официальная документация может отставать, все еще необходимы: 1. Более строгие механизмы проверки, основанные на фактах (например, код, транзакции), а не только на документации. 2. Возможность для действительно глубокого междисциплинарного мышления в новых, малоизученных областях. 3. Разработка и, что особенно важно, *практическая проверка* решений с учетом существующих ограничений и затрат. 4. Адаптивное сжатие информации в зависимости от уровня подготовки аудитории. Таким образом, Dynamic Workflows представляют собой значительный шаг вперед, структурируя исследовательский процесс и повышая его надежность, хотя для наиболее сложных и новаторских задач критическое участие человека и специализированная настройка остаются незаменимыми.

marsbit06/09 03:09

Как использовать Dynamic Workflows Claude для глубокого исследования

marsbit06/09 03:09

Новая работа лауреата премии Тьюринга Саттона: Использование формулы 1967 года для устранения важного недостатка потокового обучения с подкреплением

В декабре 2024 года исследователи из Университета Альберты столкнулись с проблемой «потокового барьера» в глубоком обучении с подкреплением: при обучении в потоковом режиме (без буфера воспроизведения и с размером пакета, равным 1) обучение становилось нестабильным. Год спустя, команда с участием лауреата премии Тьюринга Ричарда Саттона предложила решение — метод «интенциональных обновлений» (Intentional Updates). Идея, восходящая к алгоритму NLMS 1967 года, заключается в том, чтобы напрямую задавать желаемое изменение выхода функции (например, уменьшение ошибки прогноза на фиксированный процент), а затем вычислять необходимый размер шага обновления параметров, а не наоборот. Этот подход обеспечивает стабильное влияние каждого обновления на результат. Метод был применён как к обучению ценности (Intentional TD/Q), так и к обучению политики (Intentional Policy Gradient), сочетаясь с такими техниками, как RMSProp и следы пригодности. В экспериментах на задачах непрерывного (MuJoCo) и дискретного (Atari) управления алгоритмы показали производительность, сопоставимую с современными методами (SAC, DQN), использующими большие буферы, но при значительно меньших вычислительных затратах и с лучшей устойчивостью. Хотя метод демонстрирует высокую эффективность и робастность, авторы отмечают потенциальную проблему смещения в обновлениях политики и необходимость дальнейшей работы для её устранения. «Интенциональные обновления» представляют собой значительный шаг в сторону создания ИИ, способного к непрерывному и эффективному онлайн-обучению, аналогичному естественному обучению живых существ.

marsbit05/10 06:32

Новая работа лауреата премии Тьюринга Саттона: Использование формулы 1967 года для устранения важного недостатка потокового обучения с подкреплением

marsbit05/10 06:32

Прощание с грубой вычислительной мощью: как «GrainBot» из HKUST переосмысливает логику оценки AI for Science

Ключевой момент: переход от «универсального ИИ» к «вертикальному ИИ для науки». Исследователи из Гонконгского университета науки и технологий (HKUST) под руководством профессора Го Икэ представили GrainBot — инструмент ИИ, который автоматически анализирует микроструктуру материалов (размер, форма и распределение зерен) с помощью компьютерного зрения и глубокого обучения. Это резко ускоряет разработку новых материалов (например, для солнечных батарей и аккумуляторов), сокращая циклы НИОКР с лет до месяцев. Новая логика оценки: ценность ИИ измеряется не числом пользователей, а его влиянием на ускорение научных открытий и создание промышленных патентов («цифровые лаборатории»). Гонконг, с его сильными научными кадрами, позиционирует себя как центр «автономных лабораторий» (ИИ + роботы), где ИИ «думает», а роботы «экспериментируют», создавая ценные IP для производства в Greater Bay Area. Проблемы: нехватка качественных научных данных и их закрытость. Будущее — за ИИ, решающим конкретные задачи в физическом мире, а не за чистой генерацией контента.

marsbit03/05 09:43

Прощание с грубой вычислительной мощью: как «GrainBot» из HKUST переосмысливает логику оценки AI for Science

marsbit03/05 09:43

活动图片