# Сопутствующие статьи по теме Обучающие данные

Новостной центр HTX предлагает последние статьи и углубленный анализ по "Обучающие данные", охватывающие рыночные тренды, новости проектов, развитие технологий и политику регулирования в криптоиндустрии.

Последнее интервью Фэйфэй Ли: Люди тоже не учатся исключительно на реальных данных

В интервью для a16z Ли Фэйфэй, сооснователь World Labs, и Ли Юньчжу, сооснователь SceniX, обсуждают слияние компаний и их общее видение развития пространственного интеллекта и робототехники. Ключевые темы: 1. **Пространственный интеллект как следующая цель ИИ:** World Labs фокусируется на создании больших моделей мира, позволяющих ИИ генерировать, понимать и взаимодействовать с реальным или виртуальным пространством. Робототехника рассматривается как первая и важнейшая область применения этой технологии. 2. **Решение проблемы данных:** В отличие от языковых моделей, робототехника страдает от острой нехватки обучающих и оценочных данных. World Labs и SceniX объединяются, чтобы решить эту проблему с помощью симуляции. 3. **Подход Real-to-Sim-to-Real:** SceniX разрабатывает конвейер для переноса реальных условий в высокоточные цифровые двойники. Это позволяет проводить масштабируемое обучение и, что критически важно, безопасную и быструю оценку роботизированных систем в симулированной среде, прежде чем развертывать их в реальном мире. 4. **Роль симуляции:** Симуляция рассматривается не как замена реальным данным, а как важное дополнение. Она позволяет проводить контрфактические рассуждения, систематически варьировать условия (освещение, физику) для повышения надежности и ускорять обучение, что невозможно или опасно в физическом мире. 5. **Инфраструктура, а не конкретные модели/роботы:** Компании создают универсальную инфраструктуру — «цифровой полигон» для обучения и оценки роботов любых форм-факторов с использованием любых моделей. Акцент делается на долговечности инфраструктуры, а не на конкретных, быстро устаревающих алгоритмах. 6. **Практический путь внедрения:** Стратегия предполагает постепенное внедрение: от структурированных (заводы) к полуструктурированным средам (склады, отели), где роботы уже могут решать практические задачи, и лишь в дальней перспективе — в неструктурированные (дома). 7. **Цель на два года:** К 2026 году цель — подтвердить эффективность совместной платформы на нескольких ключевых вертикалях, получив проверенные примеры успешного внедрения у реальных клиентов, что станет основой для дальнейшего масштабирования. Объединение компетенций World Labs в области генеративных 3D-моделей (Marble) и SceniX в области робототехники и симуляции направлено на создание фундамента для нового этапа развития ИИ, способного не только понимать, но и действовать в мире.

marsbit1 ч. назад

Последнее интервью Фэйфэй Ли: Люди тоже не учатся исключительно на реальных данных

marsbit1 ч. назад

Toss Включает 30 Миллионов Пользователей В Экономику Данных ИИ В Партнерстве С Poseidon

Компания Poseidon, специализирующаяся на инфраструктуре данных для ИИ, объявила о партнерстве с финансовой платформой Toss от Viva Republica. В результате около 30 миллионов пользователей Toss в Южной Корее получат возможность через приложение Numo вносить реальные данные (голос, изображения, видео) для обучения ИИ и получать за это вознаграждение. Это решает ключевую проблему индустрии — нехватку качественных реальных данных, которых нет в открытом доступе. Каждый вклад отслеживается и регистрируется в сети DATA, обеспечивая прозрачность происхождения данных и выплат. Партнеры планируют отработать модель в Корее, а затем выйти на глобальные рынки. Руководство обеих компаний подчеркивает растущий спрос на качественные данные и важность создания прозрачной системы вознаграждения пользователей. Poseidon, привлекшая $15 млн инвестиций, уже зарегистрировала через Numo более 711 тысяч наборов данных по всему миру.

TheNewsCrypto06/26 13:25

Toss Включает 30 Миллионов Пользователей В Экономику Данных ИИ В Партнерстве С Poseidon

TheNewsCrypto06/26 13:25

Фонд DATA запускается для решения многомиллиардного узкого места в обучающих данных для ИИ

«Фонд данных» (The DATA Foundation) анонсирует запуск сети DATA и платформы Trace для решения проблемы «узкого горлышка» в обучающих данных ИИ. Проект, ранее известный как Story, представил публичный аудиторский слой с флагманской интеграцией крупнейшего рынка данных Kled, где уже зарегистрировано 1,5 млрд записей, предоставленных пользователями. Основная цель — создать инфраструктуру доверия для рынка обучающих данных ИИ, который столкнулся с нехваткой качественной информации из-за исчерпания общедоступных веб-данных. Платформа Trace генерирует неизменяемые конфиденциальные квитанции для каждого вклада, обеспечивая проверяемое происхождение и лицензирование данных. Это позволяет лабораториям ИИ легально и прозрачно получать данные в масштабе, гарантируя их качество и происхождение. Проект также включает миграцию токена $IP в $DATA и расширяет сеть участников через такие приложения, как Numo, обеспечивая создателей данных реальными выплатами. Новая экосистема призвана стать основой для ответственного и проверяемого развития передового искусственного интеллекта.

TheNewsCrypto06/25 21:56

Фонд DATA запускается для решения многомиллиардного узкого места в обучающих данных для ИИ

TheNewsCrypto06/25 21:56

Или фуллстек, или провал: Истинные цели покупки Cursor xAI за 600 миллиардов долларов

**Аннотация:** Статья анализирует стратегическую сделку на сумму 600 млрд долларов, в рамках которой xAI (дочерняя компания SpaceX) приобрела Anysphere, создателя инструмента для ИИ-программирования Cursor. Автор, партнер венчурного фонда Tara Tan, утверждает, что истинная цель приобретения — не доля рынка Cursor (которая снижается), а доступ к высококачественным данным для обучения, которые генерируют 7 миллионов разработчиков, ежедневно использующих платформу. Эти данные, особенно из области программирования, считаются чрезвычайно ценными для улучшения модели xAI Grok. На примере стремительного роста Anthropic (выручка выросла в 540 раз за 28 месяцев во многом благодаря продукту Claude Code) автор обосновывает ключевую тезу: чтобы стать крупным игроком в сфере ИИ, компания должна строить **полноценный стек (full-stack)**, объединяющий вычислительные мощности (инфраструктуру), базовую модель и конечные приложения. Такой подход создает замкнутый цикл: лучшие приложения приносят больше уникальных данных для обучения, что улучшает модель и инфраструктуру, что, в свою очередь, улучшает пользовательский опыт и экономику модели. Это также создает конкурентный барьер за счет уникальных данных и блокировки рабочих процессов пользователей. Автор прогнозирует, что в ближайшие годы компании-разработчики моделей будут либо активно развивать собственные приложения, либо агрессивно скупать компании на уровне приложений, чтобы завершить свой стек и обеспечить устойчивое конкурентное преимущество.

marsbit06/18 09:42

Или фуллстек, или провал: Истинные цели покупки Cursor xAI за 600 миллиардов долларов

marsbit06/18 09:42

Почему "гипотеза коммунальных услуг" Сэма Олтмана вызвала споры об авторских правах

На этой неделе генеральный директор OpenAI Сэм Алтман на саммите по инфраструктуре BlackRock выдвинул аналогию, заявив, что в будущем искусственный интеллект станет коммунальной услугой, как электричество или вода, и люди будут покупать его «по объёму». Хотя концепция «ИИ как утилиты» не нова, акцент Алтмана на «покупке у нас» — то есть оплате токенов OpenAI — вызвал резкую критику в соцсетях. Основное возмущение вызвано тем, что модели ИИ обучаются на огромных массивах данных (тексты, арт, код), созданных людьми, часто без их разрешения и компенсации, а теперь этот продукт предлагается продавать обратно создателям. Статья разбирает это противоречие. Во-первых, нарратив об «ИИ-коммуналке» адресован в первую очередь инвесторам (таким как BlackRock), чтобы оправдать триллионные инвестиции в вычислительную инфраструктуру. Во-вторых, проводится ключевое различие: традиционные коммунальные услуги (вода, свет) создают новую инфраструктуру, в то время как ИИ в основном рекомбинирует уже существующие творения человечества без чётких правовых и финансовых оснований. В-третьих, модель оплаты по токенам не соответствует принципам коммунальных услуг (равный доступ, регулируемые тарифы). Цены на ввод и вывод токенов сильно различаются, что ведёт к дискриминационному ценообразованию. Хотя в США суды пока склоняются к трактовке обучения моделей как «добросовестного использования», сама практика покупки данных (например, OpenAI с Reddit) подрывает этот аргумент. Таким образом, хотя ИИ действительно становится инфраструктурой, до статуса настоящей «коммунальной услуги» ему не хватает трёх элементов: урегулирования вопросов авторских прав на данные для обучения, прозрачного и недискриминационного ценообразования и публичных механизмов управления. Инфраструктуризация ИИ должна включать не только наращивание мощностей, но и создание механизмов справедливого распределения выгод от использования данных.

marsbit05/27 10:04

Почему "гипотеза коммунальных услуг" Сэма Олтмана вызвала споры об авторских правах

marsbit05/27 10:04

В области генерации видео с помощью ИИ «значительное превосходство» стало реальностью

В области генерации видео с использованием искусственного интеллекта китайские компании, такие как ByteDance (Seedance 2.0) и Kuaishou (Kling 3.0), демонстрируют лидирующие позиции по сравнению с американскими аналогами, такими как OpenAI Sora. Ключевыми факторами этого отрыва являются преимущества в данных и практическом применении. Китайские компании имеют доступ к огромным объёмам высококачественных видеоданных с поведенческими метками от таких платформ, как Douyin и Kuaishou. Эти данные, отражающие реальные предпочтения пользователей, служат отличной основой для тренировки моделей. Кроме того, интеграция ИИ-инструментов в экосистемы (например, Seedance в видеоредактор CapCut) создаёт цикл обратной связи, постоянно улучшающий модели. Практическое применение также сильнее в Китае. Основные сценарии включают: создание рекламных видео для электронной коммерции, что значительно снижает затраты для продавцов; генерацию рекламных роликов; и производство коротких сериалов (short-form dramas), которые можно монетизировать. Американские инструменты в основном остаются на стадии экспериментов. Однако китайский ИИ сталкивается с проблемами. Это значительный разрыв в вычислительных мощностях (по оценкам, в 8 раз меньше, чем у США), проблемы с авторскими правами на тренировочные данные (как в случае с исками голливудских студий), растущие коммерческие расходы на генерацию видео и отставание в развитии базовых языковых моделей, которые лежат в основе видео-ИИ. Таким образом, хотя Китай достиг реального лидерства в специализированной области генерации видео, этот успех не является абсолютным и существует на фоне структурных вызовов в более фундаментальных аспектах ИИ.

marsbit05/21 04:37

В области генерации видео с помощью ИИ «значительное превосходство» стало реальностью

marsbit05/21 04:37

活动图片