Примечание редактора: По мере того как возможности больших моделей продолжают расти, прикладной слой ИИ сталкивается с распространенной тревогой: если такие компании, как OpenAI и Anthropic, владеют как базовыми моделями, так и каналами дистрибуции и преимуществами бренда, что остается делать стартапам на прикладном уровне?
Именно на этот вопрос пытается ответить партнер a16z Джо Шмидт в этой статье. Он использует метафору «желтой кирпичной дороги» из «Волшебника страны Оз», чтобы разделить возможности в области ИИ-приложений на две категории: первая — это главная дорога, на которую сами компании, разрабатывающие большие модели, уже вступают, например, генерация кода, письмо, создание изображений, универсальные агенты и горизонтальные офисные ассистенты; вторая — это «остальная часть страны Оз», то есть вертикальные сценарии, которые глубоко интегрированы в отраслевые процессы, зависят от сложных рабочих процессов, накопления данных, соответствия нормативным требованиям и способности к системной интеграции.
По его мнению, настоящая возможность для стартапов заключается во втором.
От продаж до страхования Джо Шмидт повторяет одну и ту же логику: за что предприятия действительно готовы платить — это не более умное чат-окно, а система, которая берет на себя ответственность за бизнес-результаты. Ей нужно понимать хаотичное состояние клиентских данных, обрабатывать многоуровневые согласования и пограничные случаи, брать на себя ответственность за соответствие требованиям и аудит, а также, по мере постоянного обновления моделей, брать на себя миграцию, маршрутизацию и оптимизацию затрат за клиента.
Это также ключевое суждение статьи о следующем поколении корпоративного программного обеспечения: базовые модели будут становиться все мощнее и в то же время все более взаимозаменяемыми; но по-настоящему незаменимым станет то, что накапливается вокруг конкретных отраслей и конкретных рабочих процессов: данные, процессы, возможности управления и оперативная память. Возможность для ИИ-приложений заключается не в борьбе с компаниями-разработчиками моделей за «желтую кирпичную дорогу», а в том, чтобы зайти в те места, которые сложнее, грязнее, медленнее, но и ближе к реальной коммерческой ценности.
Далее следует оригинальный текст:
В последнее время я постоянно слышу от основателей и потенциальных сотрудников один и тот же вопрос: осталось ли что-то делать на прикладном уровне ИИ? Или же OpenAI и Anthropic в конечном итоге все уничтожат?
За этим вопросом стоит типичная для ИИ тревога. Некоторые уже пришли к выводу: если вы не хотите оказаться навсегда на нижнем уровне, единственное ценное в долгосрочной перспективе положение — это либо внутри лабораторий больших моделей, либо создание стартапов в области робототехники, хардвера или аналогичных передовых областях — теоретически, то есть делать то, чего «лаборатория не касается». Потому что если каждый тип программного обеспечения будет поглощен — либо непосредственно Codex или Claude, взяв на себя соответствующую работу, либо какая-то будущая модель сделает его ненужным — то лучший выбор, кажется, таков: беги быстрее!
Признаюсь, я сам почти максималист в области ИИ, и я думаю, они правы наполовину. Лаборатории больших моделей действительно вступают на обширные территории прикладного уровня. Но «прикладной уровень» — это не однородный набор возможностей. По-настоящему важный критерий: вы идете по «желтой кирпичной дороге» или находитесь в другом месте страны Оз.
«Желтая кирпичная дорога» — это наша метафора для пути, по которому идут и в который вкладывают огромные ресурсы лаборатории больших моделей. Такие проблемы, как генерация кода, письмо, создание изображений, от природы подходят для лабораторий, потому что они становятся лучше по мере роста исходных возможностей модели: каждый доллар, вложенный в предобучение и дообучение, напрямую улучшает качество продукта.
Но в остальной части страны Оз существуют более сложные, а зачастую и более вертикальные проблемы. Их решение — это не просто предоставление корпоративному пользователю горизонтального инструмента, который подключается к стандартным инструментам и компьютерным возможностям. Ценность здесь в большей степени исходит от «строительных лесов» вокруг модели: эти леса делают выводы надежными, соответствующими требованиям и действительно интегрируемыми в бизнес-процессы в конкретных отраслях. Исходные возможности базовой модели, конечно, все еще важны, но уже не являются всем.
Мы наблюдаем это в режиме реального времени. OpenAI и Anthropic фактически признают рынку: они не могут решить все проблемы одним универсальным ИИ-коллегой. Они уже объявили о крупномасштабных совместных предприятиях по фронтальному развертыванию, создавая целые компании вокруг настройки и кастомизации моделей для предприятий. Если бы они действительно считали, что следующий выпуск модели решит эти проблемы, они не вкладывали бы в такие проекты миллиарды долларов.
Поэтому, если вы хотите зарабатывать на ИИ-приложениях, не идите по желтой кирпичной дороге, а стройте в другом месте страны Оз. Вот некоторые уроки, которые мы и некоторые основатели из нашего портфеля усвоили на практике.
Желтая кирпичная дорога
Если вы собираетесь основать компанию, желтая кирпичная дорога — это самый очевидный путь, но и самый опасный. Возьмите высокопроизводительную модель, подключите несколько готовых коннекторов, таких как Google Drive, Slack, Salesforce, Notion, GitHub, а затем постройте поверх этого слой оркестровки агентов. Выглядит как магия.
Проблема в том, что именно это лаборатории больших моделей делают с помощью Cowork и Codex. Очевидно, что они владеют моделями, а значит, у них лучше маржинальность, больше контроля и они могут оказывать влияние на ценообразование для всех нижестоящих игроков. Но, возможно, что еще важнее, они также контролируют архитектурный выбор, определяющий, какие проблемы подходят для решения продуктом. До сих пор они очень сознательно придерживались модели «модель + вызов инструментов», и именно эта модель нужна для горизонтальной, малошаговой работы на желтой кирпичной дороге. Даже если стартап каким-то образом сможет превзойти Codex или Claude Code, лаборатории больших моделей по-прежнему обладают огромными возможностями дистрибуции и самым сильным брендом в области ИИ.
Если вы — ИИ-прикладная компания, использующая ту же тактику: подключаете те же коннекторы, не имеете нижележащих субагентов или конфигурации, не имеете каналов дистрибуции, то вы, скорее всего, идете по дороге в никуда.
Остальная часть страны Оз
Для стартапов ситуация не полностью пессимистична. За пределами желтой кирпичной дороги по-прежнему существуют огромные возможности. Стартапы могут обзавестись клиентами и решать сложные проблемы в этих местах.
Эти компании создают опыт работы с агентами: модель вплетена в сложную сеть инструментов, автоматизации и интеграций — другими словами, в программное обеспечение. Это также делает большинство таких стартапов по своей природе вертикальными. Они могут фокусироваться на многошаговых, многосторонних рабочих процессах, проектировать субагентов для разных ролей и вертикальных сценариев, решать проблемы, до которых трудно добраться горизонтальным платформам Anthropic и OpenAI: собирать контекст из разных систем, а затем маршрутизировать задачи нескольким людям, которым требуется утверждение на разных этапах.
Такая работа обычно связана с одной или несколькими унаследованными системами, часто требует детерминированных результатов, потому что неопределенность неприемлема, а иногда напрямую привязана к важному бизнес-результату. Лаборатории больших моделей, конечно, знают, насколько ценны эти проблемы: именно поэтому они создают свои собственные команды по аутсорсингу настройки, и именно поэтому появляется целая группа компаний, предоставляющих услуги по обучению с подкреплением для крупных клиентов.
Почему остальную часть страны Оз не займет полностью «Волшебник»
Контраргумент к вышесказанному таков: до сих пор ставка на то, что модели или лаборатории не будут продолжать прогрессировать, была очень плохой сделкой. Они, вероятно, продолжат становиться сильнее и в конечном итоге поглотят рынки, которые обслуживают эти прикладные компании.
Лаборатории больших моделей, конечно, будут прогрессировать. Но я считаю, что у компаний в остальной части страны Оз все еще есть несколько способов защититься в долгосрочной перспективе.
Данные и маховик обучения
Многое из того, что вы действительно интериоризируете в бизнесе, не существует ни в одном наборе данных для обучения: неписаные отраслевые соглашения, недокументированные стандарты, племенные знания, существующие в головах практикующих специалистов. Их нет в открытом интернете. Сколько бы вычислительных ресурсов для обучения ни было вложено, они не заменят реального погружения внутрь рабочих процессов, где находятся эти знания.
Здесь накладываются два маховика: один — сквозной маховик между клиентами, то есть когда вы видите больше вариаций одной и той же проблемы, паттерны продолжают приносить сложный процент; другой — внутренний маховик внутри клиента, то есть причины, стоящие за конкретными решениями, невысказанные исключения, внутренние эмпирические правила компании, которые проявляются только тогда, когда пользователи реально взаимодействуют с системой.
Даже если данные клиентов нельзя использовать между клиентами, прикладная компания все равно может использовать распознавание паттернов разных типов проблем у разных клиентов и использовать его для руководства архитектурным дизайном будущих проблем. Компания, чьи агенты уже обработали сто раз правки юридических документов, тысячу циклов андеррайтинга страхования или десять тысяч действий SDR по развитию продаж, уже обладает пониманием формы проблемы, которое не может быть скопировано новичком, впервые запускающим нового агента.
Теоретически, горизонтальный агент также может создать такую же инфраструктуру обучения. Но причина, по которой он этого не делает, помимо недостаточной сосредоточенности, заключается в пользовательском опыте. Захват такого знания полностью зависит от того, какой интерфейс рабочего процесса вы предоставляете пользователю. Вертикальные игроки могут проектировать эти интерфейсы вокруг информации, которая действительно нужна для конкретного рабочего процесса, горизонтальные инструменты — нет. Наборы для оценки, размеченные выводы, системы классификации пограничных случаев могут быть объединены в вертикальный маховик данных, который, в свою очередь, поддерживает дообучение. Поздним игрокам без аналогичного воздействия производственной среды трудно создать такой маховик. Его реализуемость зависит от прав на данные, накопленного объема производственного использования и структуры клиентских контрактов, но распознавание паттернов само по себе будет продолжать накапливаться.
Управление волатильностью и сложностью модели
Внутри лабораторий больших моделей уже происходит маршрутизация: вызов разных категорий моделей для разных запросов, использование ансамблей моделей на нижнем уровне. Но то, чего они не могут сделать, — это маршрутизация между разными поставщиками, им также трудно оценивать модели конкурентов для конкретной подзадачи или использовать действительно наиболее подходящую дообученную модель с открытым исходным кодом в узком месте.
Компании в остальной части страны Оз будут выбирать наиболее подходящую модель для каждой подзадачи на всем рынке моделей, а не просто использовать модель, выпущенную какой-то материнской лабораторией. Они также возьмут на себя работу, которую никто не хочет делать: перезапускать оценку при каждом выпуске новой модели, перекалибровать промпты для пограничных случаев клиентов, внедрять изменения, не нарушая производственную среду. Лаборатории больших моделей не будут делать это за клиента. Они продают вам новую модель и говорят вам мигрировать. Компании в остальной части страны Оз поглощают стоимость миграции. Клиент получает лучшие интеллектуальные возможности на всем рынке и преемственность в процессе каждого обновления.
Оптимизация затрат
Сбрасывать каждый запрос в Opus 4.7 — это самый быстрый путь к отрицательной валовой марже. Лучшие компании страны Оз будут проводить маршрутизацию между моделями разных уровней: самые сложные задачи — передовым моделям, большинство задач — моделям среднего уровня, а там, где это уже доказано работоспособным, использовать более мелкие кастомные или дообученные модели.
Некоторые из этих компаний уже сейчас на основе этого проводят собственное дообучение, оптимизируя модели под тот маленький отрезок работы, который действительно волнует клиента, и предоставляя услуги по стоимости, намного ниже, чем вызовы передовых API. Лаборатории больших моделей устанавливают цены на «минимальный уровень»: самый низкий уровень интеллекта, который можно купить за X долларов. Компании страны Оз продают обратное: самые низкие долларовые затраты при действительно необходимом уровне интеллекта для конкретного рабочего процесса. Это возможно только тогда, когда вы точно знаете, какой именно уровень интеллекта требуется для каждой подзадачи. А лаборатории больших моделей структурно не могут знать каждую задачу в каждой вертикальной отрасли. В конечном счете, это напрямую преобразуется в более низкое и контролируемое ценообразование по результатам.
Управление (Governance)
Стать плоскостью управления (control plane), через которую клиент запускает ИИ в определенной вертикали, создает значительную ценность. Эта плоскость управления — это место, где сходятся разрешения, аудит, то, что агенту разрешено делать, и то, что агент фактически сделал.
Эта плоскость управления строится на защитных механизмах (ограничителях, guardrails) для конкретных случаев использования, и эти механизмы полностью различны в разных отраслях и типах должностей. Поскольку эти компании сквозным образом владеют инструментами, рабочими процессами и данными, с которыми взаимодействует агент, они могут обеспечивать детерминированные результаты способами, недоступными для горизонтальных инструментов. Они также поглощают за конечного покупателя регуляторную сложность: Федеральные правила гражданского судопроизводства США и правила адвокатской этики в юридической сфере, HIPAA в медицине, правила SEC и FINRA в финансах, регулирование страхования на уровне штатов и так далее. Горизонтальные игроки не могут убедительно сделать это, не превратившись в сотню разных вертикальных отраслей. CIO нужен партнер, который может четко взять на себя в контракте обязательство: он будет нести ответственность за соответствие требованиям предоставляемых им агентов.
Все это в конечном итоге сводится к одному и тому же: фокус.
Этот фокус может быть на вертикальной отрасли, такой как страхование, юриспруденция, бухгалтерия; или на функции, выполненной достаточно глубоко, например, продажи, поддержка клиентов, финансы. В любом случае, эта работа требует, чтобы команда долгое время погружалась в одну и ту же группу клиентов, понимала ее рабочие процессы, пограничные случаи и регуляторные требования. Лаборатории больших моделей для этого не созданы. Они должны обслуживать всех, охватывать все, и именно поэтому они изначально построили желтую кирпичную дорогу. Тот же компромисс не позволит им войти в остальную часть страны Оз: вы можете быть везде одновременно или быть лучшим в одном деле, но не то и другое вместе.
Пример с продажами: практические советы от технического CEO 11x
Как на практике следует понимать это? Вот несколько практических советов от CEO 11x Прабхава Джайна.
Фокусируйтесь на результате
Один из возможных тактических путей для создания компании, устойчивой к давлению лабораторий больших моделей, — это отталкиваться от конкретного результата, который действительно волнует клиента. Для нас этот результат — помочь бизнесу генерировать больше лидов и воронок продаж.
Начиная отсюда, проблема становится очень конкретной: какие виды деятельности мы хотим охватить сквозным образом и которые действительно увеличивают воронку продаж? Разбейте каждую деятельность на задачи. Какие задачи подходят для агентов, а какие нет? Какие требуют сложных предметных знаний, а какие нет? Лаборатории больших моделей также будут выпускать рабочие процессы, но когда шагов в рабочем процессе много, входные данные хаотичны, состояние трудно объяснить или существуют реальные ограничения, просто наличие лучшей модели не поможет выполнить работу. Тогда работа возвращается к традиционной разработке программного обеспечения, и на этом уровне лаборатории больших моделей не имеют преимущества перед сосредоточенной прикладной компанией.
Например, некоторые из задач, которые мы обрабатываем, включают: поиск потенциальных клиентов на основе пользовательских сигналов, обогащение информации о лидах, глубокое исследование аккаунтов, извлечение контекста из CRM, написание сообщений для разных каналов, агента для квалификации лидов и систему доставки писем. Некоторые из них — задачи для агентов, некоторые — нет. Эти задачи не выполняются одним промптом, они требуют глубоких инженерных возможностей.
Ключевое прозрение в аналогии со страной Оз заключается в том, что в любом реальном рабочем процессе примерно половина, грубо говоря, — это неагентские задачи, и эта половина не дает преимущества лаборатории. Ниже уровня модели их способность писать детерминированное программное обеспечение не лучше вашей. А другая половина, агентские задачи, по-прежнему требует от вас настройки, обучения и ограничения модели вокруг действительно желаемого результата.
Предметные знания часто отсутствуют в общих обучающих данных. Эти возможности должны строиться снизу вверх из вертикальной отрасли или конкретной функции и подаваться модели в подходящий момент рабочего процесса. Когда наш агент определяет по телефону, подходит ли входящий лид, он должен быть обучен понимать: что является хорошим диалогом по продажам для конкретной отрасли, конкретного пользовательского профиля. Это работа прикладной компании, и эта способность приносит сложный процент.
Что еще важнее, эти способности постоянно устаревают, потому что бизнесы сами эволюционируют. Следовательно, ваша способность постоянно эволюционировать рабочие процессы и контекст сама по себе станет конкурентным преимуществом. Например, когда мы только начинали делать продукт для масштабного исходящего обмена письмами, «письма, написанные ИИ» только начали появляться. Перенесемся в сегодняшний день, у людей развилось острое чутье, позволяющее различать, какие письма написаны ИИ, а какие больше похожи на человеческие, и ключевой момент в том, что это ощущение меняется каждые несколько месяцев. Наши агенты должны постоянно адаптироваться к рыночной динамике, но именно здесь и строится ров. На самом деле, несмотря на такую динамику, наша положительная частота ответов за последние несколько месяцев увеличилась в 4 раза и создала для клиентов воронки продаж на сотни миллионов долларов.
Беритесь за задачи высокой сложности
Именно сложные задачи — это место, где по-настоящему раскрывается коммерческая ценность. Иначе вы легко можете обнаружить, что делаете лишь тонкий слой обертки.
Разбейте любую достаточно сложную бизнес-проблему, и вскоре вы увидите хаос. Вот простой на первый взгляд пример из области GTM: если какая-то компания уже является вашим клиентом, вы не должны связываться с каким-либо контактом внутри этой компании. Но это совсем не просто.
Возможно, в вашей CRM есть домен, соответствующий этой компании. А что насчет компаний с десятками дочерних предприятий? Что делать, если в CRM записан домен материнской компании? Что, если устаревшее поле сопоставления в Salesforce заставит вас отправить холодное письмо о продажах нынешнему клиенту — главному директору по доходам? Данные в реальном мире хаотичны. Людям трудно с этим справляться, и модель не перешагнет этот порог волшебным образом. Чтобы создать порядок из этого хаоса, нужно проектировать специализированных агентов вокруг конкретной формы проблемы, а не просто направить универсального помощника на CRM. Фактически, основываясь на имеющихся у нас данных, мы обнаружили, что качество и свежесть наших данных уже выше, чем у самих клиентов, поэтому по умолчанию мы используем наши данные как якорь.
Защитные механизмы нужны не только для предотвращения плохого. Клиенты платят именно за это
Защитные механизмы сильно недооценены. Даже внутри одного продукта каждый случай использования требует своих собственных механизмов. Для нас гарантии, требуемые потенциальным клиентом в регулируемых финансовых услугах, полностью отличаются от требований клиента среднего SaaS. И эти гарантии просачиваются на все уровни: как агент пишет, с кем можно связываться, к каким данным можно обращаться, что можно говорить по телефону и как регистрируется каждое решение.
Система «один размер для всех» рухнет перед лицом таких различий. Защитные механизмы должны строиться по случаю использования, настраиваться под клиента и постоянно аудироваться, и вся эта работа полностью ложится на прикладную компанию. Именно поэтому нам нужны инженеры фронтального развертывания и специалисты по техническому развертыванию, чтобы настраивать систему под требования каждого клиента.
Например, мы работали с компанией из списка Fortune 1000, осуществляя согласованные исходящие звонки через голос для их огромной базы клиентов малого и среднего бизнеса (SMB). В первых нескольких попытках частота ответов была низкой. Нам пришлось быстро итерировать, учиться тому, как вовлекать эту конкретную аудиторию в первые 10 секунд разговора. Владельцы бизнеса SMB ведут себя совершенно иначе, чем крупные B2B-покупатели или потребители. Сейчас мы создаем для них возможности для продаж за один день больше, чем вся их команда продаж могла бы создать за месяц на этом сегменте рынка.
Пример со страхованием: практические советы от CEO FurtherAI
Продажи — лишь один пример. Страхование — другой пример, иллюстрирующий ту же идею с другой точки зрения. Вот понимание CEO FurtherAI Амана Гура о «строительстве вдали от желтой кирпичной дороги».
Когда мы начали внедрять ИИ в реальные страховые операции, мы постоянно слышали одно предположение: модель — это интеллект, а рабочий процесс — это просто строительные леса вокруг модели.
Но чем больше страховых компаний мы привлекали, тем больше мы убеждались, что все как раз наоборот.
В страховой отрасли много интеллекта уже содержится в самом рабочем процессе. Две страховые компании могут провести отправленные материалы по, казалось бы, одинаковому пути: подача, проверка, расчет стоимости, андеррайтинг. Сам путь прост. То, что действительно отличает две страховые компании, — это все внутри пути: какие риски требуют эскалации, какие сигналы убытков важны, какое правило андеррайтинга имеет приоритет при конфликте, когда требуется подпись человека, какие внешние данные нужно извлечь и как в конечном итоге фиксируется решение.
Эта логика не содержится в чистом механизме правил. Она разбросана по стандартным операционным процедурам, проверкам менеджера, философии андеррайтинга, специфическим для страховой компании предпочтениям в отношении рисков и многолетнему операционному опыту. Многое из этого не записано в форме, доступной для чтения моделью.
Вот почему мы не верим в чистых агентов, которые каждый раз рассуждают с нуля, и не верим в жесткие рабочие процессы, которые рухнут при столкновении с реальной сложностью. Вместо этого мы строим агентские рабочие процессы. Рабочий процесс обеспечивает повторяемость, возможность аудита и контроль затрат; агент обрабатывает изменчивость и восстанавливает процесс, когда идеальный путь прерывается; человек остается в контуре там, где это касается суждений и ответственности.
В первый день эта система автоматизирует ручной труд. Но со временем каждая эскалация становится сигналом, каждое исключение — обратной связью, каждое исправление человеком говорит вам, где неполно оригинальное руководство по эксплуатации. В конечном итоге рабочий процесс перестает быть просто скриптом, а становится оперативной памятью страховой компании.
Именно эта часть труднодоступна для лабораторий больших моделей. Они будут продолжать выпускать лучшие модели и лучших универсальных агентов, и они должны это делать. Но они не будут долго оставаться в производственном рабочем процессе страховой компании, чтобы узнать, почему определенный аккаунт был эскалирован, почему определенный риск был отклонен или почему андеррайтер отменил руководство по предпочтениям в отношении рисков, и, как оказалось, был прав.
Такое понимание может прийти только от выполнения одного и того же рабочего процесса тысячи раз в производственной среде. Рабочий процесс, который вы поставляете в первый день, — это не ров. Цикл, формируемый производственным использованием с течением времени, — это ров.
Для нас это и означает «строительство вдали от желтой кирпичной дороги».
Как понять, находитесь ли вы в остальной части страны Оз или все еще идете по желтой кирпичной дороге?
Тест на инструменты и шаги
Сколько шагов требует эта работа? Насколько сложны инструменты, которые вам нужно построить для ее поддержки?
Возьмем для сравнения горизонтальный ИИ, ищущий в Google Drive: это одношаговая операция с одним инструментом, и допускается высокая погрешность результата. Пользователь читает резюме, если оно неверно, задает вопрос снова.
Теперь рассмотрим задачу многошагового редактирования юридических документов на основе прецедентов юридической фирмы за последние три года: она может включать десятки шагов, несколько инструментов, вывод должен быть проверен партнером и, возможно, даже обоснован в суде. Обе ситуации выглядят как «агент выполняет работу», но только последняя требует глубокого программного обеспечения, построенного сосредоточенной командой за многие годы.
Системный тест
Вы строите систему, в которой клиент выполняет работу, или вы добавляете инструмент поверх уже существующей у клиента системы?
Система сквозным образом владеет рабочим процессом: захват данных, управление, запись выполненной работы. Клиент описывает, как реально происходит работа, ссылаясь на эту систему. Инструмент просто добавляет слой интеллекта к рабочему процессу, который клиент уже выполняет.
Инструментальные продукты также могут приносить реальный доход, но лабораториям больших моделей легче их забрать, потому что клиент не зависит от вас как от слоя оркестрации. Высокий ACV (годовая стоимость контракта) обычно является сигналом системного продукта, потому что система заменяет реальные человеческие ресурсы и, соответственно, получает за это оплату. Но это не абсолютная гарантия. Вы должны спросить себя: если какая-то лаборатория больших моделей выпустит продукт, который, казалось бы, напрямую конкурирует с вашим, будет ли клиенту все еще нужен ваш инструмент? Если ответ «да», вы строите систему. Если ответ «нет», вы инструмент — даже если ваш ACV высок.
Тест хедж-фонда / отчета о прибылях и убытках
Результаты лабораторий больших моделей оцениваются по бенчмаркам; результаты компаний в остальной части страны Оз оцениваются по отчетам о прибылях и убытках клиентов.
Клиентов не волнует, сколько баллов набрала ваша модель в SWE-Bench или MMLU. Их волнует: закрыл ли ваш агент сделку, правильно ли он отредактировал контракт, застраховал ли он правильный полис. Если клиент сосредоточен на результате конкретного рабочего процесса, а не на баллах за универсальные способности, вы находитесь в остальной части страны Оз. Если клиент платит за универсальные способности, то вы продаете то, что он может получить через доступ к Claude или Codex.
Лучшие компании-разработчики агентов должны исполнять как хедж-фонды: они побеждают за счет альфы, а альфа измеряется в отчете о прибылях и убытках клиента, а не в баллах бенчмарка.
Победить могут и те, и другие, и обе стороны победят
Мы увидим огромных победителей как на желтой кирпичной дороге, так и за ее пределами. Модели продолжат побеждать, потому что они владеют моделями и обладают дистрибьюторскими возможностями, заточенными под горизонтальные инструменты.
Остальная часть страны Оз также может победить, при условии, что они владеют системой работы: то есть интерфейсом, в котором предприятие фактически выполняет работу, и данными, которые через него протекают и захватываются. Эти компании владеют захватом данных, системой действий рабочего процесса и управлением. По мере того как сложные рабочие процессы в определенной вертикальной области созревают, они объединяются в ключевой опыт, от которого клиент не может отказаться. По мере того как существующие игроки и новые участники будут выпускать новое поколение моделей, эта компания станет тем слоем, который интегрирует эти модели и доставляет их клиенту. Базовая модель заменима, но система работы — нет.
Следующее поколение корпоративного программного обеспечения будет построено вдали от желтой кирпичной дороги.






