# Сопутствующие статьи по теме LLM

Новостной центр HTX предлагает последние статьи и углубленный анализ по "LLM", охватывающие рыночные тренды, новости проектов, развитие технологий и политику регулирования в криптоиндустрии.

Преобразуем Transformer, и большие языковые модели становятся умнее

В новой статье исследователей из Mila, Корнелльского и Монреальского университетов предлагается радикально простой способ улучшить большие языковые модели (LLM) без увеличения параметров или вычислительных затрат. Вместо равномерного распределения параметров по всем слоям модели, авторы предлагают использовать «конические языковые модели» (Tapered Language Models, TLM), где емкость (например, ширина прямого распространения) монотонно уменьшается от ранних слоев к более поздним. Эксперименты на моделях размером от 440M до 1.3B параметров показывают, что оптимальное распределение (уменьшение по косинусоидальной кривой) дает значительное улучшение. Например, для модели на 440M параметров perplexity снизился с 16.28 до 14.44, что соответствует улучшению на 1.84 пункта. Этот результат воспроизведен на четырех различных архитектурах, включая Transformer, модели с управляемым вниманием и архитектуры с долговременной памятью. Ключевое обоснование заключается в том, что ранние слои модели обрабатывают фундаментальную информацию (например, синтаксис) и нуждаются в большей емкости, в то время как более глубокие слои часто лишь повторяют или уточняют уже сформированные представления. Таким образом, перераспределение ресурсов в пользу начальных слоев повышает общую эффективность модели без дополнительных затрат. Исследователи отмечают, что этот принцип может быть применен не только к языковым моделям, но и к другим архитектурам, таким как Vision Transformer или диффузионные модели, где также исторически используется равномерное распределение параметров по слоям. Работа открывает новое, практически бесплатное направление для оптимизации современных нейронных сетей.

marsbit06/29 12:54

Преобразуем Transformer, и большие языковые модели становятся умнее

marsbit06/29 12:54

20-летний основатель, 18-летние сотрудники, инвестиции от 19-летнего

**Резюме статьи "20-летний основатель нанимает 18-летних сотрудников и получает инвестиции от 19-летних"** В индустрии искусственного интеллекта происходит масштабный сдвиг поколений. Ключевыми игроками становятся исключительно молодые люди — исследователи, основатели стартапов и даже инвесторы, часто в возрасте 17-25 лет. Их называют "AI Native" — поколение, чье мышление интуитивно совпадает с логикой больших языковых моделей. Крупные технологические компании (такие как ByteDance, Tencent, Alibaba) и стартапы ведут ожесточенную борьбу за молодые таланты, предлагая астрономические зарплаты: стажерам — суточные ставки до 5500 юаней, а выпускникам вузов — пакеты в 2-6 миллионов юаней в год. Для сравнения, чтобы достичь аналогичного дохода традиционным путем в IT-компании, потребовалось бы 8-12 лет карьеры и высокие руководящие позиции. Прошлый опыт и управленческие заслуги теряют ценность. Успех проектов вроде DeepSeek показал, что решающую роль играют молодые ключевые исследователи, а не опытные "ветераны". Компании активно "омолаживают" команды, считая, что сотрудники старше 30-33 лет могут отставать из-за инерции мышления и меньшей гибкости. Гонка за кадрами начинается еще в университетах и даже школах. HR-отделы создают базы данных самых перспективных студентов, спонсируют конкурсы и конференции, организуют эксклюзивные встречи с руководством. Инвестиционное сообщество также делает ставку на молодежь: фонды создают специальные программы для финансирования основателей, рожденных после 1998 года. Молодые инвесторы, исследователи и основатели образуют свои сети, общаясь на одном языке и совместно создавая новые компании. Эта новая реальность создает беспрецедентные возможности для молодых гениев, но одновременно обостряет социальное неравенство. Разрыв в доходах между топовыми выпускниками и обычными специалистами достигает сотен раз. Для многих опытных IT-специалистов "старая гвардия" технологическая революция несет угрозу обесценивания навыков и требует болезненной трансформации, которую не все могут осуществить. Как отмечает один из героев, "эпоха щедро вознаграждает неординарных, но никогда еще не была так сурова к обычным".

marsbit06/23 04:05

20-летний основатель, 18-летние сотрудники, инвестиции от 19-летнего

marsbit06/23 04:05

От кода к сознанию: Руководство на десять тысяч слов о том, как эволюционирует мозг робота

**От кода к познанию: Путеводитель по эволюции мозга роботов** Роботы прошли путь от предсказуемых машин, управляемых тщательно написанным кодом (ROS, классическое управление), к более адаптивным системам, основанным на ИИ. Переломным моментом стало появление больших языковых моделей (LLM), которые стали выступать в роли "планировщиков", переводящих команды на естественном языке в последовательность действий. Однако истинная революция — это модели "Vision-Language-Action" (VLA), такие как RT-2 от Google и OpenVLA. Они напрямую объединяют зрение, язык и движение в одной нейронной сети, генерируя команды для исполнительных механизмов. Самые современные человекоподобные роботы (например, от Figure AI и многих китайских стартапов) используют **двухсистемную архитектуру**: медленная, "размышляющая" модель (System 2) анализирует сцену и ставит цели, а быстрая, "реактивная" модель (System 1, а также рефлекторный System 0) управляет моторами в режиме реального времени. Вся критичная для безопасности обработка выполняется на борту (например, на чипах NVIDIA Jetson). Следующий гигантский шаг — **модели мира** (World Models), такие как NVIDIA Cosmos или DeepMind Genie. Эти системы предсказывают последствия действий, позволяя роботу "проигрывать" различные сценарии в уме, выбирать наилучший и избегать ошибок *перед* тем, как начать движение. Они обещают радикально улучшить восстановление после сбоев, обобщение и долгосрочное планирование. Экономика меняется: цены на "железо" падают (Unitree H1 за $5900), а ключевым активом становятся **данные** — тысячи часов телеметрии с роботов для обучения моделей. Открытые модели и фреймворки (GR00T, OpenVLA, LeRobot) ускоряют прогресс, позволяя стартапам строить решения на готовой базе. В итоге, интеллект робота постепенно перемещался из кода инженеров в обученные модели восприятия, затем в планировщики и стратегии, и теперь — в обучаемые модели физического мира. Мы находимся на этапе, сравнимом с GPT-2: система впечатляет, быстро развивается, но до полной автономности в неконтролируемой среде еще далеко. Вопрос будущего — не "что могут роботы?", а "что мы должны им поручить?".

marsbit06/07 12:59

От кода к сознанию: Руководство на десять тысяч слов о том, как эволюционирует мозг робота

marsbit06/07 12:59

活动图片