【Введение】Это безумие! Данные об эволюции ИИ, недавно измеренные Meta и METR, идеально совпали с «законом плотности», предложенным китайской командой два года назад. Кремниевая долина с удивлением обнаружила, что китайские исследователи опередили их на два года!
Три самые авторитетные организации в области исследований ИИ за неделю столкнулись с одинаковыми результатами!
3 апреля американская исследовательская организация METR тихо обновила технический отчет, сведя основной вывод к одной фразе.
Способности ИИ удваиваются каждые 88,6 дней.

Спустя 5 дней, 8 апреля, лаборатория сверхразумного интеллекта Meta выпустила новую модель Muse Spark, представив кривую эффективности обучения под названием scaling ladder, и вывод также сводится к одной фразе.
Чтобы достичь производительности Llama 4 Maverick годичной давности, новой модели требуется менее одной десятой вычислительных ресурсов для обучения.

Одна организация измеряла длительность задач, другая — вычислительные ресурсы для обучения. Учреждения не связаны между собой, методы исследования совершенно разные.
Но когда кривые были переведены в одну систему координат, их наклоны почти полностью совпали.
На этом этапе ситуация уже достаточно невероятна.
Что еще более удивительно, эту кривую уже полностью нарисовала китайская команда два года назад, и она была опубликована в дочернем журнале Nature.
Это закон плотности.


Два года назад кто-то уже нарисовал эту линию
Эта концепция впервые появилась в статье под названием «Densing Law of LLMs».
Авторами выступила объединенная команда FaceWall Intelligence и Университета Цинхуа под руководством профессоров Сунь Маосина и Лю Чжиюаня, первым автором является доктор Сяо Чаоцзюнь.
Статья была размещена на arXiv в декабре 2024 года, а в ноябре 2025 года была принята журналом Nature Machine Intelligence.

Адрес статьи: https://arxiv.org/abs/2412.04315

Адрес статьи: https://www.nature.com/articles/s42256-025-01137-0
Ключевой вывод статьи сводится к одной фразе.
Плотность интеллекта модели экспоненциально увеличивается со временем, количество параметров, необходимое для достижения определенного уровня интеллекта, уменьшается вдвое каждые 3,5 месяца.
В конце 2024 года это утверждение звучало довольно радикально.
Тогда вся отрасль поклонялась scaling law. OpenAI наращивала параметры моделей, Anthropic наращивала параметры, Meta тоже наращивала параметры.
Все считали, что чем больше параметров, тем выше интеллект, и что правильный путь — это сжигать GPU до предела.

Но исследовательская команда думала иначе.
Они поместили все влиятельные на тот момент открытые базовые модели, от Llama-1 до Gemma-2 и MiniCPM-3, всего 51 модель, в одну систему измерений.
После прогона по пяти бенчмаркам результат показал почти идеальную экспоненциальную зависимость с R2=0,934.
Учитывая, что оценка больших моделей легко подвержена влиянию загрязнения данных, они повторно протестировали на новом наборе данных с фильтрацией загрязнений MMLU-CF. R2=0,953.
Оба подгонки дали R2, близкий к 1. Статистически это почти не может быть совпадением.
Другими словами, каждая основная открытая модель, выпущенная за эти два года, независимо от команды или архитектуры, попала на одну и ту же экспоненциальную линию «удвоения каждые 3,5 месяца».

На этом этапе история была всего лишь «китайская команда предложила seemingly радикальный эмпирический закон».
То, что превратило это в «момент», произошло в следующие полгода.
Три организации, три метода, один наклон
Если разложить выводы FaceWall, Meta и METR.
- Закон плотности FaceWall измеряет «сколько параметров требуется для того же уровня интеллекта». Вывод: потребность в параметрах уменьшается вдвое каждые 3,5 месяца.
- Scaling ladder Meta измеряет «сколько вычислительных ресурсов для обучения требуется для того же уровня интеллекта». Вывод: Muse Spark экономит на порядок больше, чем Llama 4 Maverick годичной давности.
- Отчет METR о временном горизонте измеряет «какую длину задачи может handle одна и та же модель». Вывод: длительность задачи удваивается каждые 88,6 дней.
Три системы измерений. Три академических учреждения. Три совершенно непересекающихся исследовательских пути.
Но когда все цифры переводятся в одну систему координат, наклоны их кривых почти полностью совпадают.
Самое легкоупускаемое в этом деле то, что закон плотности был предложен самым первым из трех. Почти на два года раньше scaling ladder от Meta и более чем на год раньше полного моделирования METR.
И когда Meta нарисовала ту самую scaling ladder в своем блоге в начале апреля, они, вероятно, сами не осознавали, что форма этого графика почти идентична кривой на слайде презентации на академической конференции в Пекине в 2024 году.
Какое наблюдение заслуживает названия «закон»
В научном мире существует негласный стандарт, определяющий, заслуживает ли эмпирическое наблюдение права называться «законом».
Дело не в том, насколько красивы данные, а в том, может ли оно подтверждаться в нескольких независимых системах измерений одновременно.
Закон Мура является законом потому, что полупроводниковая промышленность десятилетиями проверяла его с трех совершенно разных аспектов: точность литографии, плотность транзисторов, стоимость вычислений на единицу.

Закон плотности идет тем же путем.
Изначально это была всего лишь кривая подгонки от одной команды. К моменту принятия в дочерний журнал Nature он уже мог воспроизводиться на наборе данных с фильтрацией загрязнений. А в этом месяце он был независимо проверен еще дважды на данных обучения Meta и оценках задач METR.
Если смотреть в более широкой системе координат, этот момент очень напоминает 1880-е годы, когда электричество только пришло в Нью-Йорк.
Тогда тоже разные изобретатели, разные инженеры, разные города各自 разрабатывали свои энергосистемы. Пока кто-то не нарисовал кривые развития всех проектов на одном листе бумаги, люди не осознали. Это не несколько разрозненных инженерных достижений, это悄悄铺开 (тихо расстилается) новая эра.
Только на этот раз от публикации статьи до проверки global коллегами потребовалось менее года.
Три следствия, каждое из которых меняет отраслевые предположения
Если закон плотности выдерживает критику, он одновременно изменит многое.
Во-первых, стоимость вывода (inference) рухнет быстрее, чем все ожидали.
Одним из следствий закона плотности является то, что стоимость вывода для LLM с одинаковой производительностью, вероятно, будет снижаться вдвое каждые 2,6 месяца.
Сегодня эта скорость снижения уже превышена реальностью.
Последние данные отслеживания Epoch AI показывают, что за последний год цена за токен для LLM с производительностью уровня Claude 3.5 Sonnet упала в 400 раз. Максимальная скорость снижения для аналогичного уровня производительности достигла 900 раз/год.
Уровень, за который в конце 2022 года GPT-3.5 запрашивал 20 долларов за миллион токенов, сегодня Mistral Nemo предлагает за 0,02 доллара, дешевле в 1000 раз, и модель при этом мощнее.
Оглядываясь назад, прогноз в статье оказался консервативным.
Во-вторых, точка взрывного роста edge-интеллекта ближе, чем все думали.
Если перемножить закон плотности и закон Мура, получится еще более впечатляющая цифра.
По текущим оценкам, максимальный эффективный размер модели, который можно запустить на чипе той же цены, удваивается примерно каждые 88 дней.
Эта цифра почти совпадает с 88,6 днями, рассчитанными METR. Два совершенно разных пути расчета столкнулись после запятой.
В ближайшие три-пять лет запуск моделей уровня современных топовых GPT на обычном ноутбуке или даже на смартфоне может перестать быть фантастикой.
В-третьих, оптимальная стратегия индустрии больших моделей quietly меняется.
За последние три года понимание scaling law в отрасли оставалось на уровне «наращивания параметров и данных».
Но закон плотности дает контр-интуитивное суждение. При условии持续指数增长 (постоянного экспоненциального роста) плотности, у любой сильнейшей модели в любой момент есть окно оптимальности всего в несколько месяцев.
Вкладывать все ресурсы в обучение большей модели, а затем ждать три месяца, пока ее не превзойдет новая модель вдвое меньшего размера, с экономической точки зрения невыгодно.
Истинно устойчивый путь — вкладывать ресурсы в саму плотность. Лучшие архитектуры, данные более высокого качества, более умные алгоритмы обучения.
FaceWall всегда шла по нарисованной herself линейке
Стоит отметить, что закон плотности — это не статья, которая закончилась после публикации.
FaceWall Intelligence, предложившая эту теорию, последние два года постоянно проверяла ее на своих моделях серии «Маленькая пушка» MiniCPM.
Когда MiniCPM-1-2.4B была выпущена в феврале 2024 года, ее результаты могли сравниться или превзойти Mistral-7B сентября 2023 года. Другими словами, за четыре месяца, с 35% параметров, была достигнута同等性能 (равная производительность).
Эта цифра была прямо включена в статью в дочернем журнале Nature в качестве первого эмпирического案例 закона плотности.
С тех пор серия «Маленькая пушка»一路开源 (постоянно выпускалась в open source), охватывая четыре основных направления: текст, мультимодальность, речь, полная модальность с параметрами ниже 10B. Такую полноту открытости в Китае, кроме Alibaba, достигла только FaceWall.
На сегодняшний день глобальное количество загрузок серии «Маленькая пушка» в открытом исходном коде превысило 24 миллиона раз.
Это не самая большая модель в отрасли. Но это команда, которая первой в отрасли приняла «приоритет плотности»作为公司方法论来执行 (как корпоративную методологию).
И когда Meta и METR на неделе апреля 2026 года своими способами подтвердили закон плотности, у этой китайской компании, которая начала обучать модели по этой методологии еще в 2024 году,实际上已经领先了两年的工程经验 (фактически уже был двухлетний опыт инжиниринга).
На этот раз китайские исследователи стоят у истока кривой
Теоретическая框架 (рамка), предложенная китайской исследовательской командой два года назад, вновь и вновь открывается заново такими зарубежными авторитетными учреждениями, как Meta и METR, их собственными способами.
Значимость этого события, возможно, потребует времени для полного осознания.
Это не история «мы тоже можем». Это история «мы увидели немного раньше».
В истории науки таких моментов не так много. Суждение, в котором сомневались в 2024 году, в 2026 году превратилось в одну и ту же кривую, на которую указывают несколько независимых доказательств.
Такое «не сговариваясь»跨地域、跨方法、跨机构 (через регионы, методы, учреждения) случалось в физике несколько раз, и каждый раз знаменовало конец старой парадигмы и начало новой.
На этот раз китайские исследователи ИИ стоят у этого истока.
И эта кривая продолжает расти со скоростью удвоения каждые 88 дней.
Источники:
«Закон плотности», впервые предложенный FaceWall Intelligence, получил признание таких зарубежных顶级机构 (топовых учреждений), как Meta
https://arxiv.org/abs/2412.04315
https://www.nature.com/articles/s42256-025-01137-0
https://metr.org/blog/2026-1-29-time-horizon-1-1/
https://ai.meta.com/blog/introducing-muse-spark-msl/
Статья из WeChat Official Account «新智元» (New Wisdom Element), редакторы: Хао Кунь, Таоцзы








