Автор: Лю Цзюнь
2026 год. В индустрии ИИ формируется консенсус: возможности моделей больше не являются узким местом. Разрыв кроется за пределами моделей — в кодировании предметных знаний, в интерфейсе между агентом и реальным миром, в зрелости инструментальных цепочек. Этот разрыв быстро заполняется сообществом открытого исходного кода, и скорость этого превосходит все ожидания. OpenClaw набрал 60 тысяч звезд на GitHub за 72 часа, а через три месяца преодолел отметку в 350 тысяч. Экосистема Claude Code за полгода выросла с 50 до более чем 334 навыков (Skills). Hermes Agent пошел еще дальше, позволив агентам автономно создавать повторно используемые навыки. Данные Vela Partners показывают, что за последние 90 дней два направления — персональные ИИ-ассистенты и плагины с агентскими навыками — совокупно добавили 244 тысячи звезд. Это взрывной рост навыков.
Работа Perseus Yang находится в эпицентре этого взрыва. Выпускник Cornell по математике и информатике, член Forbes Business Council, участник программы THINC Fellowship, за последние несколько лет он участвовал в разработке и поддерживал более десятка проектов с открытым исходным кодом на GitHub, связанных с ИИ. Они охватывают расширение навыков агентов, управление на уровне мобильных устройств, инструментарий для оптимизации ИИ-движков, агентов для анализа GEO-данных, автоматизации рабочих процессов контента, инфраструктуру платежных протоколов и другие направления. Его отличительная черта — сочетание глубокой инженерной подготовки с сильнейшей продуктовой интуицией. Он не просто пишет код, а способен, исходя из потребностей пользователя, определить, каким должен быть инструмент, затем создать его от начала до конца и способствовать его внедрению.
Вот несколько ключевых выводов, к которым он пришел в этом процессе.
Первый вывод: Система навыков — это наиболее недооцененная инфраструктура эпохи ИИ-агентов
После того как Anthropic в конце 2025 года выпустила Agent Skills в качестве открытого стандарта, OpenAI Codex CLI также приняла формат SKILL.md. Реестр ClawHub от OpenClaw уже накопил более 13000 навыков,贡献 (внесенных) сообществом, экосистема Claude Code быстро следует этому примеру. Значение навыков далеко выходит за рамки «добавления плагинов агенту». По сути, это способ позволить людям, не умеющим программировать, участвовать в ИИ-программировании. Специалист по операциям может написать на естественном языке файл SKILL.md, и агент освоит новый рабочий процесс. Это смена парадигмы: реальная мощь ИИ зависит не от количества параметров модели, а от того, какие предметные знания в нее заложены, а навыки передают право закладывать эти знания от инженеров — всем.
Но Perseus заметил проблему. Подавляющее большинство навыков сосредоточено в инженерной сфере: код-ревью, фронтенд-дизайн, DevOps, тестирование. Экспертные знания в не-инженерных областях почти не систематически кодируются в виде навыков. Это означает, что охват экосистемы навыков далеко не достиг своих потенциальных границ.
Это наблюдение стало движущей силой для серии его работ с открытым исходным кодом в направлении инструментария GTM (Go-To-Market). Наиболее показательным примером является GTM Engineer Skills — набор навыков для Claude Code и Codex, охватывающий полный рабочий процесс обеспечения discoverability (возможности обнаружения) для ИИ-движков. На данный момент проект набрал более 600 звезд на GitHub. Он кодирует работу, которая традиционно требует collaboration экспертов по SEO, контент-стратегов и фронтенд-разработчиков, в виде автоматизированного процесса, исполняемого одним человеком: аудит ИИ-discoverability сайта, оптимизация структуры контента, исследование ключевых слов, машинно-анализируемый слой для визуализации данных. Аудитор не выдает рекомендации, а после автоматического определения фронтенд-фреймворка генерирует исправления кода, которые можно сразу отправлять как Pull Request. Вокруг того же направления он построил配套 (сопутствующий) инструмент GEO-анализа, который может одновременно отправлять запросы в ChatGPT, Claude, Gemini, Perplexity и анализировать частоту упоминаний бренда, sentiment, долю рынка и конкурентное позиционирование, выводя интерактивные HTML-отчеты и структурированные данные.
Практический эффект демонстрирует продуктовую ценность этого инструментария. Такие компании, как Articuler AI и Axis Robotics, использовали GTM Engineer Skills для завершения полного цикла от исследования до создания Resource Center за несколько часов, в то время как такая работа в традиционном режиме обычно требует десятков часов межкомандного взаимодействия. Эта разница в эффективности достигнута не за счет возможностей модели, а благодаря глубокому пониманию Perseus рабочих процессов GTM и продуктовой декомпозиции: он разбил расплывчатую потребность «повысить ИИ- discoverability» на стандартизированные этапы, исполняемые агентом пошагово, где каждый этап имеет четкие входы, выходы и проверки качества. Этот инструментарий в настоящее время используется десятком стартапов и несколькими компаниями из списка Fortune 500. Инструменты с открытым исходным кодом являются входной точкой, коммерческие продукты — масштабируемым продолжением, и то и другое разделяет одно техническое ядро.
Сам по себе проект ценен, но Perseus считает более важным подтвержденный им тезис: границы возможностей системы навыков простираются далеко за пределы инженерной сферы. Продуктовая стратегия, go-to-market, бизнес-анализ — любая экспертиза, которая может быть описана структурно, может быть закодирована как способность агента.
Второй вывод: Операционные границы ИИ-агента не должны ограничиваться браузером и API
Обсуждение агентов в 2026 году доминируют браузерные агенты и интеграции через API. LangGraph, CrewAI, Google ADK образуют процветающую экосистему оркестрации multi-agent. Но Perseus заметил структурное слепое пятно: большая часть мировой активности происходит в нативных мобильных приложениях — соцсети, платежи, игры, коммуникации, — и у этих приложений нет публичных API, нет браузерного эквивалента. Существующие фреймворки не могут操作 (управлять) WeChat, Douyin, WhatsApp или Alipay. Смартфон — самый доминирующий компьютерный интерфейс в мире, но инфраструктура для нативных мобильных агентов практически отсутствует.
Размышления Perseus таковы: почему все учат ИИ работать с браузером, но никто не учит его серьезно работать со смартфоном? Расцвет браузерных агентов во многом обусловлен тем, что web изначально дружественен к автоматизации: есть DOM, есть API, есть зрелые инструментальные цепочки, like Playwright. Но мобильный мир совершенно иной. Нативные приложения — черные ящики, без структурированного описания интерфейса,操作 (управление) возможно только путем эмуляции человеческих касаний и свайпов. Сложность этой проблемы заключается не в том, чтобы заставить LLM понять, нужно ли нажимать кнопку, а в том, что вся исполнительная инфраструктура создается с нуля: управление подключением устройств, парсинг состояния экрана, взаимное исключение (mutex) устройств между несколькими агентами, security boundaries для чувствительных операций.
Этот вывод привел к рождению OpenPocket. Это фреймворк с открытым исходным кодом, который через ADB позволяет управляемым LLM агентам автономно操作 (управлять) устройствами Android. На данный момент у проекта около десятка контрибьюторов и более 500 коммитов. То, что пользователи реально делают с его помощью, очень показательно: автоматическое управление аккаунтами в соцсетях, ответы за вас в мессенджерах, обработка платежей и счетов на телефоне, даже автоматическая игра в мобильные игры. Типичный сценарий: пользователь на естественном языке говорит агенту «каждое утро в 8 открывай Slack и выполняй签到 (чек-ин)», и агент будет persistently выполнять эту задачу в изолированной сессии, превращая ежедневно повторяющиеся ручные操作 (действия) в фоновую автоматизацию.
В этом проекте Perseus сделал несколько ключевых, по его мнению, продуктовых и архитектурных выборов. Во-первых, агент может автоматически создавать новые навыки во время выполнения. Когда он сталкивается с незнакомой操作流程 (последовательностью действий), он может сохранить изученные шаги как повторно используемый SKILL.md для последующего прямого вызова. Это означает, что агент — не инструмент с фиксированными способностями, а система, которая становится тем сильнее, чем больше ее используют. Во-вторых, все чувствительные操作 должны проходить человеческое одобрение, а не предоставляться на усмотрение агента. По его мнению, самая большая опасность автономного агента не в том, что он сделает что-то не так, а в том, что он будет «уверенно» делать ошибки, думая, что прав. В-третьих, каждый агент полностью изолирован, привязан к отдельному устройству, конфигурации и состоянию сессии, несколько агентов могут работать одновременно, не мешая друг другу. Если расширять возможности агента могут только TypeScript-инженеры, то эта экосистема никогда не вырастет, поэтому OpenPocket, как и Claude Code, использует SKILL.md в качестве стандартного формата для расширения возможностей.
Вся система поддерживает 29+ конфигураций LLM, агентский телефон полностью изолирован от личного телефона пользователя, все данные остаются локально. В 2026 году, когда OWASP включил «злоупотребление инструментами» в топ-10 рисков Agentic AI, а высокорисковые обязательства EU AI Act вот-вот вступят в силу, такой дизайн, ориентированный на локальность и с участием человека в цикле (human-in-the-loop) — не консерватизм, а prerequisite для выхода агентов в реальные сценарии.
Третий вывод: Ценность открытого исходного кода не в самом коде, а в определении стандартов на инфраструктурном уровне
Понимание открытого исходного кода Perseus'ом — это не «выложить код на GitHub». Он repeatedly упоминает мысль: экосистема open-source ИИ в 2026 году находится в окне, когда стандарты еще не устоялись. Архитектурные patterns и интерфейсные规范 (спецификации), adopted сообществом сейчас, в ближайшие годы станут инфраструктурой по умолчанию для всей отрасли. В этом окне возможность определить нишу важнее, чем оптимизировать существующее решение.
Конкретно, его проекты с навыками продвинули технически значимую вещь: доказали, что формат SKILL.md — не просто контейнер для инженерных инструментов, а достаточно унифицированный стандарт кодирования предметных знаний. Когда один и тот же SKILL.md может быть загружен и выполнен одновременно Claude Code, OpenAI Codex CLI и OpenClaw, он de facto становится «портативной единицей способностей» (portable capability unit) экосистемы ИИ-агентов. Perseus поместил полный рабочий процесс go-to-market, не-инженерной области, в этот формат и успешно запустил сквозную автоматизацию от аудита до исправления кода. Это весомое подтверждение универсальности всего стандарта Skills.
Его проект мобильного агента решает архитектурный пробел на исполнительном уровне агентов. Существующие фреймворки агентов на уровне вызова инструментов зависят от структурированных интерфейсов, будь то API или DOM. OpenPocket должен выполнять操作 (действия) в среде без каких-либо структурированных интерфейсов, полагаясь исключительно на парсинг пикселей экрана и инъекцию touch-событий. Это заставило проект с нуля перепроектировать цикл восприятие-решение-исполнение агента, включая парсинг состояния устройства в реальном времени, протоколы взаимного исключения устройств для нескольких агентов и механизмы автоматического восстановления после сбоев操作. Это не простая адаптация существующих фреймворков агентов, а независимо evolved архитектурное решение для проблемы «автономной操作 в среде без API».
Инженерный дизайн обоих проектов заслуживает отдельного упоминания. OpenPocket использует трехслойную архитектуру (Manager, Gateway, Agent Runtime), где каждый слой может итерироваться независимо, и контрибьюторам сообщества нужно фокусироваться только на знакомом им слое. Каждый Skill в GTM Engineer Skills internally следует阶段化 (поэтапному) pipeline-дизайну: вывод предыдущего этапа является входом для следующего, есть обязательные контрольные точки проверки качества, рабочий процесс может быть прерван и восстановлен на любом этапе, ошибки могут быть локализованы до конкретного этапа. Цель этих архитектурных выборов одна и та же: чтобы open-source проектам можно было доверять в production-средах реальных пользователей.
С продуктовой точки зрения у этих двух проектов есть еще одна общая черта: Perseus в своем дизайне всегда ставит «кто будет использовать» и «как расширять» во главу архитектурных решений. Целевые пользователи GTM Engineer Skills — не инженеры, а growth-команды, поэтому каждый его Skill имеет четкие контракты входов/выходов и встроенные проверки качества, позволяя нетехническим пользователям понимать, что делает агент. Механизм расширения через SKILL.md в OpenPocket, задачи по расписанию на естественном языке, multi-channel доступ (Telegram, Discord, WhatsApp, CLI) — все это предназначено для снижения порога входа для не-инженерных пользователей. По его мнению, если инфраструктурный проект с открытым исходным кодом могут использовать только инженеры, то его потолок — это размер сообщества инженеров. По-настоящему рычажный (leveraged) дизайн — это когда границы возможностей агента расширяются совместно практиками из всех областей.
Эта модель прослеживается в его многочисленных проектах. Не разработка на уровне приложений в существующих фреймворках, а идентификация недостающих компонентов в инфраструктурном слое экосистемы агентов с последующим их созданием.
Более широкая картина
Экосистема open-source ИИ в 2026 году переживает момент, similar ранним годам cloud-native экосистемы в 2010-х: стандарты и инструменты на инфраструктурном уровне正在被定义 (определяются), и эти определения будут определять пути развития всей отрасли на годы вперед. В этом окне каждый принятый сообществом формат навыков, каждая проверенная архитектурная pattern для агентов, каждая заполненная生态空白 (ниша в экосистеме) участвует в формировании следующего интерфейсного слоя ИИ.
Perseus Yang делает простую вещь: использует инженерные способности и продуктовое мышление для исследования парадигм на технологическом фронте эпохи ИИ. Модели будут продолжать становиться мощнее, но ответы на вопросы о том, кто будет определять, как агенту следует взаимодействовать с реальным миром, и кто будет решать, в какой форме предметные знания должны кодироваться и распространяться, не вырастут из моделей сами по себе. Их могут дать только те, кто создает вещи, методом проб и ошибок.








