【Введение】 На прошедшем WWDC ключевым словом стало возрождение Siri от Apple с помощью ИИ, тренд на «модели на устройстве» уже налицо! Еще раньше Андрей Карпати призвал отделить знания модели, оставив только «когнитивное ядро». Китайская компания заявила, что реализовала это направление — 4 млрд параметров, в задачах группового интеллекта показывает результаты, сопоставимые с крупными моделями в сотни миллиардов параметров. Что на самом деле могут изменить когнитивные модели на устройстве?
Вчера Siri возродилась благодаря 1,2 триллионам параметров Gemini от Google.
Но с другой стороны, Amazon прекратила работу своего внутреннего рейтинга ИИ, вызвавшего огромные споры — сотрудники активно использовали инструменты ИИ, расходы на вычислительные ресурсы взлетели до уровня, когда руководство уже не могло сидеть сложа руки.
Стоимость токенов стала самым серьезным барьером для массового внедрения ИИ.
Ранее в интервью Андрей Карпати указал направление: удалить из модели огромные объемы знаний, оставив только «когнитивное ядро», которое умеет думать, планировать, знать о своих незнаниях, достаточно всего миллиардного масштаба параметров.

https://www.youtube.com/watch?v=lXUZvyajciY
Это направление получает подтверждение.
Модель с 4 миллиардами параметров в задачах группового интеллекта показала результаты, эквивалентные крупным моделям уровня GPT-5.4 в сотни миллиардов параметров, и поддерживает развертывание на устройстве.
Она от команды основателей, которая ранее моделью с 3,6 млрд параметров победила 65 млрд Llama и заняла первое место в рейтинге Hugging Face в Японии.
На этот раз они создали первую в отрасли когнитивную модель для устройств.
Прогноз Карпати и счет за вычислительные ресурсы
Давление стоимости вычислений уже превратилось из технической проблемы в финансовую, случай с Amazon — лишь вершина айсберга.
Сотрудники Amazon, часто используя внутренние инструменты ИИ, вызывали возможности вывода крупных моделей, что подняло общие расходы на вычисления, и руководству пришлось срочно остановить механизм рейтинга, чтобы ограничить использование.

https://www.ft.com/content/b1a62a7f-6df5-4c90-94ce-64ce9c9961b6?syn-25a6b1a6=1
Отрасль переживает первый «отступление токенов», ежедневное потребление вычислений некоторыми компаниями уже достигло уровня сотен миллионов юаней.
Бизнес-модель крупных моделей сталкивается со структурной стеной: чем сильнее возможности, чем глубже цепочка рассуждений, тем выше стоимость одного вызова.
Отношение затрат на GPU к выручке (GPU Cost / Revenue) — ключевой показатель для всех ИИ-компаний, тенденция к постоянному росту параметров модели только ухудшает этот показатель.
Идея Карпати указывает на другой путь: он предложил необходимость отделить «память / знания» в модели, оставив то, что он назвал «когнитивным ядром» —
сущность, лишенная огромного количества фактов, знаний, но сохранившая алгоритмы мышления, магию интеллекта, стратегии решения проблем.
Он считает, что даже при масштабе в 1 миллиард параметров можно достичь эффективного человеко-подобного мышления:
Оно будет думать как человек...... Если вы зададите ему фактический вопрос, возможно, ему потребуется обратиться к справочным материалам — оно знает, что не знает, и пойдет проверять.
Эти слова вызвали широкое обсуждение в техническом сообществе.
Консенсус по направлению формируется, но команды, способные продвинуть «когнитивное ядро» от концепции до развертываемого продукта, являются настоящими переменными.

4B паритет с сотнями миллиардов, что сделал Nextie Alpha
То, что продвинуло описанное Карпати «когнитивное ядро» от концепции до продукта, — это Tomorrow's New Journey (Nextie).
Эта компания проводит обучение с подкреплением на основе открытых моделей логического вывода, разделяя знания и познание — удаляя запоминаемые запасы знаний из модели, усиливая способности к обобщению и абстрактному мышлению.
Созданная модель названа Nextie Alpha, масштаб параметров 4B, обучение завершено и модель запущена, это первый продукт в отрасли, определенный как «когнитивная модель».
Что касается конкретного метода обучения, отправная точка довольно необычна.
Команда Tomorrow's New Journey собрала человеческие научные статьи с 1800 по 2020 год, охватывая 220 лет, пытаясь проследить эволюционный путь группового интеллекта, чтобы обеспечить ориентир для технологического направления.
На основе этих исследований они проводят обучение с подкреплением на открытых моделях логического вывода, фокусируясь на повышении способностей к обобщению и абстракции.
Приведем наглядный пример: обученная модель может переносить модели принятия решений игроков в го на сценарии повседневной жизни — упомянутое Карпати «сохранение алгоритмов мышления» здесь получило конкретную техническую реализацию.
Что касается эффективности, Nextie Alpha в задачах группового интеллекта (дебаты, рефлексия, вызовы, голосование и другие этапы) с 4 миллиардами параметров достигла качества вывода, эквивалентного крупным моделям, таким как GPT-5.4, с явными преимуществами в расходе вычислительных ресурсов и скорости вывода.
Еще более важно пространство сценариев, которое разблокирует эта модель, имеющее три уровня прогрессирующего значения.
Первый уровень — повышение качества принятия решений множественными интеллектуальными агентами.
В рамках принятия решений по методологии Harness использование когнитивной модели дает лучшие результаты, чем использование моделей логического вывода.
Переход базовой модели от «логического вывода» к «познанию» приводит к скачку в общем качестве цепочки принятия решений в системах совместной работы множественных интеллектуальных агентов.
Второй уровень — сокращение вычислительных затрат на порядок.
4 миллиарда по сравнению с сотнями миллиардов параметров значительно снижают вычислительные расходы при развертывании в облаке.
Nextie Alpha также поддерживает развертывание на устройстве — может работать непосредственно на MacBook, устройствах воплощенного интеллекта, таким образом, стоимость вычислений превращается в стоимость электроэнергии.
Это особенно важно для области воплощенного интеллекта: использование крупной модели в сотни миллиардов параметров для управления домашним роботом, каждое «размышление» потребляет много токенов, совокупная стоимость может быть выше, чем нанять человека для уборки.
Развертывание 4B на устройстве радикально меняет эту картину.
Третий уровень — разблокировка проактивных (Proactive) сценариев.
В настоящее время подавляющее большинство продуктов ИИ работают в реактивном (Reactive) режиме — пользователь дает команду, модель реагирует.
Proactive-режим означает, что интеллектуальный агент самостоятельно принимает решения и выполняет задачи, не дожидаясь команд, коммерческий масштаб значительно превышает Reactive, но до сих пор был заблокирован стоимостью вычислений.
Nextie Alpha поддерживает круглосуточную работу, стоимость контролируема, что делает возможными проактивные интеллектуальные агенты, отложенные ранее из-за высокой цены.

Карты команды и позиционирование в нише
Tomorrow's New Journey основана командой-создателем Microsoft Xiaoice.
Визитная карточка этой команды — «победа малыми параметрами над большими» — ранее обученная ими открытая модель rinna (Японская Сяоайс) с 3,6 млрд параметров заняла первое место в рейтинге Hugging Face в Японии, победив 65-миллиардную Llama.
Nextie Alpha, демонстрируя с 4 миллиардами результаты, сравнимые с сотнями миллиардов, продолжает ту же технологическую линию.

Ниша, в которую Tomorrow's New Journey делает основную ставку, это — Harness Group Multi-Agent.
Эта ниша получает подтверждение от ведущего капитала — в марте 2026 года OpenAI инвестировала в стартап Isara, напрямую подняв его оценку до 6,5 миллиардов долларов, направление исследований Isara — именно совместная работа множественных интеллектуальных агентов и групповой интеллект.

https://www.wsj.com/tech/ai/openai-backs-new-ai-startup-seeking-bot-army-breakthroughs-a0b1fedc
В углубленной оценке интеллекта (IDI) в этой области комплексные показатели Tomorrow's New Journey значительно выше, чем у любой отдельной крупной модели.

Капитал подтвердил ценность ниши, данные оценок обозначили позицию Tomorrow's New Journey внутри нее.
Два сигнала вместе указывают на одно и то же суждение: групповые множественные интеллектуальные агенты — следующее высокоценное направление в слое приложений ИИ, а когнитивные модели — ключевая инфраструктура для их работы.
Когнитивные модели меняют не только параметры, но и бухгалтерские книги
Отношение затрат на GPU к выручке (GPU Cost / Revenue) — это дамоклов меч, висящий над всеми ИИ-компаниями.
Решение, предлагаемое когнитивными моделями, направлено на перестройку экономической модели — достижение с 4 миллиардами результатов, возможных только с сотнями миллиардов, означает, что тому же качеству вывода соответствует совершенно другая структура затрат.
В интервью Tomorrow's New Journey сообщили, что команда обучает более обобщающую 8-миллиардную когнитивную модель.
Если 4 миллиарда уже могут конкурировать с GPT-5.4 в задачах группового интеллекта, границы возможностей 8 миллиардов стоит ждать.
Отрасли оставлен более глубокий вопрос: Когда стоимость круглосуточной работы когнитивной модели на устройстве снижается до пренебрежимо малого уровня, всем сегодняшним ИИ-продуктам, разработанным на основе реактивного (Reactive) режима «пользователь дает команду — модель отвечает», возможно, придется пересмотреть свою продуктовую форму.
Пространство для коммерческого воображения проактивных (Proactive) интеллектуальных агентов намного превосходит все существующее в рамках нынешних реактивных (Reactive) интеллектуальных агентов.
Эта статья взята из официального аккаунта WeChat «Синьчжиюань» (XinZhiYuan), автор: ASI启示录








