В феврале 2026 года Xiaohongshu выпустила уведомление, требующее обязательной маркировки сгенерированного и синтезированного AI контента, неотмеченный контент будет ограничен в распространении. Более чем через три месяца на GitHub появился открытый проект под названием guizang-social-card-skill, специализирующийся на генерации графики 3:4 для Xiaohongshu и обложек для публичных аккаунтов. Его технический путь имеет нетривиальный выбор: он не использует AI-модели для генерации пикселей изображения, вся визуализация осуществляется с помощью HTML+CSS, а иллюстрации берутся из поиска по библиотекам реальных фотографий, таким как Unsplash. Выходные данные — это не «изображение, сгенерированное AI», а скриншот веб-страницы, растеризованный движком браузера.
Этот выбор соответствует конкретному изменению. С 2026 года Xiaohongshu запустила модель аудиовизуального распознавания для определения AIGC-контента путем анализа закономерностей распределения пикселей и аудиохарактеристик. За тот же период было обработано более 800 000 аккаунтов, размещающих AI-контент, и почти 150 000 записей, сфальсифицированных с помощью AI. Для контент-мейкеров, которым требуется высокочастотная выдача графических материалов, вероятность обнаружения и маркировки изображений, сгенерированных Midjourney или Canva AI, продолжает расти. Skill мастера Цзан выбрал другой путь: AI принимает решения по макету, а итоговые пиксели отдаются на откуп движку рендеринга и библиотекам реальных фотографий.
Это сознательный технический обход. Но то, как далеко зайдет эта схема, зависит от гибкости определения платформой термина «сгенерированный и синтезированный AI контент».
28 каркасов макетов, AI отвечает за логику верстки, а не за рисование
Мастер Цзан, настоящее имя Гуйцзан, ранее выпускал guizang-ppt-skill, также инструмент AI для сценариев графической верстки. Этот social-card-skill имеет более узкую направленность: ориентирован на графику 3:4 для Xiaohongshu, обложки 1:1 и 21:9 для публичных аккаунтов с выходным разрешением 1080×1440, 1080×1080 и 2100×900 соответственно.

В технической архитектуре этот Skill содержит 28 каркасов макетов, разделенных на две визуальные системы: Editorial (журнальный стиль, 16 макетов) и Swiss (стиль швейцарского интернационализма, 12 макетов), с 10 предустановленными темами цветовых схем. После ввода пользователем пункта назначения, маршрута или темы заметки AI выбирает подходящий каркас макета, определяет положение текста, обрабатывает параметры аннотаций на карте, а затем записывает все дизайнерские решения в виде HTML+CSS. Движок рендеринга Playwright берет на себя последующие этапы, делая скриншоты страниц и выводя PNG.
Особенно полезным компонентом для тревел-блогеров является модуль карты. Он использует MapLibre для загрузки реальных тайлов OpenStreetMap и поддерживает маркировку и соединение нескольких мест. Пользователю достаточно указать название города или достопримечательности, AI автоматически генерирует базовую карту с аннотациями и встраивает ее в макет. Сопутствующий рабочий процесс для источников изображений имеет четкий приоритет: предоставленные пользователем реальные фотографии имеют наивысший приоритет; при их отсутствии автоматически выполняется поиск иллюстраций в порядке Unsplash → Pexels → Flickr CC → Wallhaven.

Весь процесс выполняется в семь шагов: Intake (прием ввода) → Style & Theme (определение стиля и темы) → Layout Selection (выбор макета) → Asset Prep (подготовка материалов) → Compose & Render (верстка и рендеринг) → Deliver & Review (вывод и проверка) → Iterate (итеративное изменение). Каждый шаг записывается в файл .poster в каталоге task. При пакетной генерации изображений выполняется
node render.mjs, и Playwright рендерит их по очереди. Также имеется скрипт проверки validate-social-deck.mjs, который в реальной среде браузера измеряет DOM-элементы, обнаруживая такие проблемы верстки, как переполнение текста, превышение максимального размера шрифта, столкновение элементов footer и т.д.
Цель проектирования этого механизма ясна: быть точным и контролируемым, как программы для полиграфической верстки, а не непредсказуемым, как диффузионные модели. Ценой является сужение творческой свободы до 28 шаблонов. Для создателей, полагающихся на индивидуальный фотографический стиль, рисованные элементы или нерегулярный коллаж, эти каркасы макетов предоставляют не повышение эффективности, а дизайнерские ограничения.
Что касается порога входа, CLI-версия требует установки Playwright, среды Node, а также получения прав доступа к API Claude Code или Codex. Существует также веб-вход xiaohongshu.guizang.ai для непрограммирующих пользователей, но информация о том, совпадает ли его функциональная полнота с CLI-версией, не опубликована. Несколько твитов разработчика на платформе X и постоянно обновляемое README указывают на то, что проект все еще находится в стадии быстрой итерации.
Пиксели не от генеративных моделей, но соответствие правилам не означает долгосрочной безопасности
Логика обнаружения AI-контента в Xiaohongshu, согласно анализу публичной информации и технических материалов, в основном опирается на модель аудиовизуального распознавания. Эта модель определяет, происходит ли контент из AI-генеративных моделей, анализируя закономерности распределения пикселей изображения. Диффузионные модели и GAN оставляют определенные статистические характеристики на уровне пикселей при генерации изображений, которые отличаются от естественного света и тени, улавливаемых сенсором камеры, дисторсии объектива и паттернов шума. Цель обучения модели аудиовизуального распознавания — как раз уловить эту несогласованность в статистических закономерностях.
Логика обхода Skill мастера Цзана основана на ключевом различии: выходные пиксели изображения не происходят ни от одной генеративной модели. Движок рендеринга HTML растеризует CSS-стили, и распределительные характеристики генерируемых пикселей ближе к скриншотам интерфейса браузера или выводу программ настольной верстки. Фотографии берутся из библиотек реальных снимков, таких как Unsplash, эти изображения сняты камерой, прошли ручную постобработку и не несут следов диффузионных моделей.

Но это различие действует при условии, что определение платформой термина «сгенерированный и синтезированный AI контент» точно укладывается в рамки «генерации пикселей AI-моделью». Официальное уведомление Xiaohongshu использует формулировку «сгенерированный и синтезированный AI контент», исходный охват которой не узок. Как только платформа расширит определение до «программно рендеренного вывода, созданного с помощью AI», или включит характеристики рендеринга браузера для HTML-растеризованных изображений в обучающую выборку для моделей распознавания, текущее техническое преимущество этой схемы исчезнет.
У платформы есть техническая основа и управленческие мотивы для расширения определения. Модель аудиовизуального распознавания сама по себе постоянно совершенствуется. Если в обучающие данные включить множество сравнительных образцов HTML-рендеренных и AI-сгенерированных изображений, модель может научиться отличать «характеристики субпиксельного сглаживания шрифтов в браузере» от «нерегулярных блоков пикселей при генерации текста GAN». В настоящее время нет публичной информации, указывающей на то, что Xiaohongshu начала обучение в этом направлении, но с точки зрения границ возможностей модели, такое расширение технически осуществимо.
Более важным фактом являются элементы соответствия, связанные с размещением мини-программ. В настоящее время не видно никаких официальных документов, указывающих на то, что этот Skill интегрирован с номером регистрации модели или прошел соответствующую процедуру соответствия. Если платформа добавит в процесс модерации контента требование отслеживать цепочку инструментов генерации изображений, отсутствие информации о регистрации может стать новой точкой блокировки.
API-движки шаблонов, платформенно-ориентированные инструменты и HTML-рендеринг открывают три расходящихся пути
Наблюдая за инструментами для генерации изображений для социальных сетей на рынке, можно заметить, что они разделяются на три различные технические траектории. Каждая сталкивается с разной структурой рисков модерации.
Прямая генерация изображений AI-моделями. Типичным представителем этого пути является функция Magic Design, выпущенная Canva AI в апреле 2026 года, которая генерирует по текстовым промптам дизайн-макеты, содержащие AI-визуальные элементы. Изображения, сгенерированные такими моделями, как Midjourney, DALL·E, также относятся к этой категории. Проблема очевидна: эти изображения являются основной целью для моделей аудиовизуального распознавания. Ответ Canva заключается в поощрении прозрачной маркировки, а не в обходе обнаружения. На Xiaohongshu нет открытых данных, подтверждающих, снижается ли вес рекомендаций для постов с изображениями от AI-моделей после их маркировки, но формулировка платформы «ограничение распространения немаркированного AI-контента» уже является установленной политикой. С каждым обновлением версии диффузионной модели статистические характеристики пикселей могут меняться, и соответствующие модели обнаружения также будут синхронно итерироваться, создатели сталкиваются с постоянно движущейся мишенью.
Рендеринг API-движками шаблонов. Bannerbear — типичный представитель этого направления. Пользователь создает шаблон в дизайнере, через REST API передает JSON-данные для изменения переменных слоев, сервер рендерит и выводит PNG или JPG. Его ядро также является «программным рендерингом», а не «генерацией пикселей моделью», вывод не содержит следов диффузионных моделей. Отличие от Skill мастера Цзана заключается в следующем: шаблоны Bannerbear зависят от ручного дизайна, AI не участвует в принятии решений о макете; Skill мастера Цзана позволяет Claude напрямую читать и писать HTML, передавая право выбора макета AI. Риск схемы Bannerbear лежит в другом измерении: когда множество аккаунтов используют один и тот же шаблон, одну цветовую схему, один шрифт для создания графики, даже если каждое изображение не сгенерировано AI, это может запустить на стороне платформы распознавание шаблона «программного массового производства». Условия срабатывания правил против спама не полностью идентичны обнаружению AI, но для создателей, управляющих аккаунтами в массовом порядке, результатом также является ограничение распространения.
Платформенно-ориентированная генерация. Pin Generator создан специально для Pinterest, автоматически генерируя Pin-изображения, соответствующие предпочтениям алгоритма платформы. Суть этого направления не в обходе, а в полной адаптации — размер, визуальный стиль, график публикаций соответствуют правилам платформы. Преимущество — минимальный риск модерации, недостаток также очевиден: возможности инструмента жестко привязаны к правилам платформы, при изменении алгоритма Pinterest или ограничении вызовов стороннего API инструмент теряет работоспособность. В сравнении со Skill мастера Цзана, первый относится к платформенно-специфичным инструментам, второй — к кроссплатформенному универсальному решению. Платформенно-специфичные решения безопаснее, но уязвимее, кроссплатформенные универсальные решения гибче, но сложнее — это дилемма, постоянно возникающая в сфере AI-инструментов.
Структура рисков для трех путей различна. Генерация AI-изображений дает наибольшую свободу, но с каждым обновлением приходится отвечать на новые модели обнаружения. Движки шаблонов наиболее стабильны, но могут быть затронуты правилами против спама. HTML-рендеринг находится между ними: макет гибко контролируется AI, пиксели отдаются браузеру и реальным материалам, обход осуществляется на уровне обнаружения «пикселей, сгенерированных AI», но не может противостоять семантическому расширению правил на уровне платформы.
Потолок системы макетов не в коде, а в типе контента
28 каркасов макетов охватывают две основные визуальные системы: журнальный стиль и швейцарский интернационализм. Для тревел-блогеров, которым нужно демонстрировать маршруты на карте, таймлайны, многодневные маршруты, эта система имеет высокую степень соответствия. Аннотации на карте и соединение точек маршрута являются ключевой информацией в таких заметках, каркасы макетов структурируют эту информацию, сохраняя при этом профессиональный уровень верстки.
Но экосистема контента Xiaohongshu гораздо богаче, чем тревел-гиды. Заметки об одежде полагаются на индивидуальный фотографический стиль и цветовую гамму, обзоры косметики требуют HD-макроснимков и сравнительных фотографий продуктов, контент о стиле жизни в значительной степени использует коллажи из нескольких изображений и рукописные аннотации. «Верстка» для этих типов контента — это не структурированное представление информации, а выражение личной эстетики и эмоций. 28 каркасов макетов в таких сценариях — не инструмент, а ограничение.

Технические ограничения также реальны. В настоящее время поддерживаются три размера: 1080×1440 (3:4 для Xiaohongshu), 2100×900 (21:9 для публичных аккаунтов) и 1080×1080 (1:1 для публичных аккаунтов). Вертикальные обложки 9:16 для Douyin, горизонтальные обложки 16:9 для Bilibili не поддерживаются. Библиотеки изображений зависят от Unsplash и Pexels, материалы этих платформ ориентированы на качественную фотографию, подходящую для иллюстраций к путешествиям, пейзажам, городской архитектуре. Но охват таких часто требуемых материалов для узконаправленного контента, как крупные планы еды, постановочные фото косметики, предметы одежды, в этих библиотеках ограничен. Стратегия приоритета пользовательских изображений может частично смягчить эту проблему, при условии, что у самого создателя достаточно накопленных реальных фотоматериалов.
Механизм проверки — палка о двух концах. validate-social-deck.mjs может перехватить проблемы верстки перед выводом изображения, гарантируя безошибочность 100 пакетных рендеров. В сценариях операционной работы, требующих ежедневного обновления десятков изображений, это гарантия эффективности. Но это также означает, что любой дизайн, не соответствующий предустановленным правилам макета, будет отклонен скриптом. Создатель, который хочет добавить наклонный текстовый декор или пользовательские отступы в стандартный макет, не может просто перетащить и настроить, как в Canva, а должен напрямую редактировать исходный код HTML и CSS.
Порог локального развертывания — еще один фактор разделения. Создатели, способные запускать скрипты Playwright и Node, могут углубляться в каркасы макетов и скрипты рендеринга для настройки. Но для большинства блогеров Xiaohongshu доступен лишь поднабор функций веб-интерфейса. Фактическая ценность, получаемая этими двумя типами пользователей от этого Skill, сильно различается. Основная пользовательская база open-source проекта — это готовые экспериментировать создатели и разработчики с техническим бэкграундом, а не потребность обычных производителей контента в «однокнопочной генерации изображений».
Универсального ответа нет, но сам факт расхождения технических траекторий уже говорит о многом
Тревел-блогер на Xiaohongshu сталкивается с тремя вариантами: использовать Midjourney для генерации иллюстрированных карт маршрутов, принимая риск маркировки и понижения рейтинга; использовать Bannerbear, настроить шаблон и ежедневно заполнять его данными пакетно, принимая риск однородности шаблонов и последующего антиспам-риска; или использовать Skill мастера Цзана, позволив AI выбрать макет, а затем рендерить изображение через HTML, принимая риск расширения платформой определения «синтезированного контента». Безопасного выбора нет, есть только комбинации с разной структурой рисков.
Такая ситуация сама по себе передает информацию: итеративное противостояние между платформой и AI-инструментами уже началось. Каждое обновление платформой моделей обнаружения завершает период технических преимуществ для ряда инструментов. Каждый раз, когда новый инструмент находит путь обхода, платформа корректирует стратегию. Это не процесс, который сойдется к стабильному состоянию. Срок действия схемы HTML-рендеринга зависит от того, будет ли направление обучения модели аудиовизуального распознавания Xiaohongshu по-прежнему фокусироваться на «характеристиках пикселей диффузионных моделей» или расширится до «всех пикселей, не являющихся исходной фотографией».
Для создателей контента различие между «AI-помощником» и «AI-замещением» приобретает практический смысл. Отношение платформы уже четко определено: поощрение AI как усилителя креативности, противодействие использованию AI для замещения человека в низкокачественном массовом производстве. В Skill мастера Цзана AI принимает решения по верстке, а не генерирует контент, фотографии реальные, макеты основаны на каркасах, предустановленных дизайнерами-людьми. Это как раз попадает в зону «AI-помощника». Те графические материалы, где и текст, и изображения полностью генерируются моделями, являются именно тем объектом, который платформа четко намерена пресекать.
Станет ли такое разграничение операционным критерием для модерации платформы, пока неясно. Но разработчики инструментов уже отвечают на это определение своими техническими выборами.








