Автор: KarenZ, Foresight News
Оригинальное название: Простым языком о новом алгоритме рекомендаций X: от «сбора данных» до «оценки»
Маск изменил рекомендательную систему Twitter с «ручного нагромождения правил и большей части эвристических алгоритмов» на «чистое угадывание предпочтений с помощью ИИ-больших моделей»?
20 января Twitter (X) официально раскрыл новый алгоритм рекомендаций, то есть логику, стоящую за лентой «Для вас» (For You) на главной странице Twitter.
Проще говоря, нынешний алгоритм таков: смешивает «контент от людей, на которых вы подписаны» и «контент со всей сети, который может вам понравиться», сортирует его в соответствии с вашей предыдущей активностью в X (лайки, комментарии и т.д.) по степени привлекательности для вас, дважды фильтрует и в итоге превращает в ленту рекомендаций, которую вы видите.
Ниже приведена ключевая логика, переведенная простым языком:

Создание профиля
Система сначала собирает контекстную информацию о пользователе, чтобы создать «профиль» для последующих рекомендаций:
-
Последовательность действий пользователя: история взаимодействий (лайки, репосты, время просмотра и т.д.).
-
Характеристики пользователя: список подписок, персональные настройки и т.д.
Откуда берется контент?
Каждый раз, когда вы обновляете ленту «Для вас», алгоритм ищет контент в двух местах:
-
Круг знакомых (Thunder): твиты от людей, на которых вы подписаны.
-
Круг незнакомцев (Phoenix): авторы, на которых вы не подписаны, но ИИ, исходя из ваших вкусов, выудит из всего интернета посты, которые могут вас заинтересовать (даже если вы не подписаны на автора).
Эти две кучи контента смешиваются, образуя кандидатные твиты.
Дозаполнение данных и первоначальная фильтрация
После того как выбраны тысячи постов, система извлекает полные метаданные постов (информация об авторе, медиафайлы, основной текст), этот процесс называется Hydration. Затем проводится быстрая очистка, отсеиваются повторяющийся контент, старые посты, посты, опубликованные самим пользователем, контент от заблокированных авторов или содержащий заблокированные ключевые слова.
Этот шаг предназначен для экономии вычислительных ресурсов и предотвращения попадания нерелевантного контента в ключевой этап оценки.
Как выставляются оценки?
Это самая ключевая часть. Модель Transformer на основе Phoenix Grok анализирует каждый оставшийся после фильтрации кандидатный пост и вычисляет вероятность того, что вы совершите с ним различные действия. Это игра в плюсы и минусы:
Плюсы (положительная обратная связь): ИИ считает, что вы, вероятно, поставите лайк, сделаете репост, ответите, нажмете на изображение или перейдете в профиль.
Минусы (отрицательная обратная связь): ИИ считает, что вы, вероятно, заблокируете автора, отключите уведомления (Mute), пожалуетесь.

Итоговый балл = (вероятность лайка × вес) + (вероятность ответа × вес) – (вероятность блокировки × вес)...
Стоит отметить, что в новом алгоритме рекомендаций Author Diversity Scorer (оценщик разнообразия авторов) обычно вступает в дело после того, как ИИ подсчитает итоговый балл. Когда обнаруживается, что в партии кандидатных постов есть несколько материалов от одного и того же автора, этот инструмент автоматически «занижает» баллы последующих постов этого автора, чтобы вы видели более разнообразный круг авторов.
Наконец, посты сортируются по баллам и отбираются те, у которых баллы最高.
Вторичная фильтрация
Система еще раз проверяет топ-N постов с наивысшими оценками, отфильтровывает нарушающие правила (например, спам, насилие), убирает дубликаты из одной и той же ветки (thread) и, наконец, упорядочивает их по убыванию баллов, превращая в ленту, которую вы видите.

Краткий итог
X уже удалила все ручные функции и большую часть эвристических алгоритмов из своей рекомендательной системы. Ключевой прогресс нового алгоритма заключается в том, чтобы «позволить ИИ самостоятельно изучать предпочтения пользователей»,实现了从«告诉机器怎么做»到«让机器自己学会怎么做»的跨越 (осуществлен переход от «указания машине, что делать» к «позволению машине самой научиться, как делать»).
Во-первых, рекомендации стали точнее, «многомерное прогнозирование» лучше соответствует реальным потребностям. Новый алгоритм с помощью большой модели Grok прогнозирует多种用户行为 — не только «поставите ли вы лайк / сделаете репост», но и «перейдете ли по ссылке», «как долго будете просматривать», «подпишетесь ли на автора», и даже предсказывает «пожаловатесь ли / заблокируете». Такое детализированное研判 (изучение и суждение) позволило достичь前所未有的 степени соответствия рекомендуемого контента подсознательным потребностям пользователя.
Во-вторых, механизм алгоритма относительно справедливее и в определенной степени может打破«大号垄断»的魔咒 (разрушить заклятие «монополии крупных аккаунтов»), давая новым и малым аккаунтам больше возможностей: у старых «эвристических алгоритмов» был致命问题 (смертельный недостаток): крупные аккаунты благодаря历史高互动量 (исторически высокому уровню взаимодействия) получали высокий охват при любой публикации, а новые аккаунты, даже с качественным контентом, закапывались из-за «отсутствия накопленных данных». Механизм изоляции кандидатов позволяет независимо оценивать каждый пост, независимо от того, является ли другой контент в той же партии вирусным. В то же время, Author Diversity Scorer также снижает вероятность засилья последующих постов одного и того же автора в одной партии.
Для компании X: это мера по снижению затрат и повышению эффективности, обмен вычислительных мощностей на人力 (человеческие ресурсы), обмен ИИ на удержание пользователей. Для пользователей мы сталкиваемся с «супермозгом», который постоянно пытается угадать наши мысли. Чем лучше он нас понимает, тем больше мы от него зависим, но именно потому, что он слишком хорошо нас понимает, мы глубже погружаемся в «информационные пузыри» (information cocoons), сплетенные алгоритмом, и更容易成为情绪化内容的精准捕获对象 (легче становимся точными объектами захвата эмоционального контента).
Twitter:https://twitter.com/BitpushNewsCN
Группа в TG比推:https://t.me/BitPushCommunity
Подписка в TG比推: https://t.me/bitpush





