# Сопутствующие статьи по теме Снижение затрат

Новостной центр HTX предлагает последние статьи и углубленный анализ по "Снижение затрат", охватывающие рыночные тренды, новости проектов, развитие технологий и политику регулирования в криптоиндустрии.

Только что родилась первая в мире сверхвысокочастотная мировая модель, без NVIDIA, разгон до 50 кадров/с

Китайская компания Moxin Tech совместно с командой академика Пань Юньхэ из Чжэцзянского университета представила MoWorld — первую в мире модель Flash World Model, способную работать в режиме реального времени со скоростью свыше 50 кадров в секунду. Это первая модель, полностью созданная на базе отечественных NPU, что позволило снизить стоимость вывода на 70% по сравнению с аналогами на GPU. Модель преодолела ключевое препятствие для коммерциализации — низкую частоту кадров, которая ранее мешала применению в робототехнике, играх и симуляциях. MoWorld поддерживает длинные последовательности до 2000 кадров и обеспечивает 6 степеней свободы управления камерой. Технология открывает возможности для игровой индустрии, обучения роботов и автономного вождения, кинопроизводства, цифровых двойников и 3D-реконструкции. Разработка демонстрирует, что полный цикл создания и развёртывания современных мировых моделей возможен на отечественных вычислительных платформах, что снижает зависимость от иностранных решений и открывает новые перспективы для промышленного внедрения. Компания Moxin Tech привлекла более $100 млн инвестиций, в том числе от Huawei Hubble и фондов стратегического капитала.

marsbit07/08 04:16

Только что родилась первая в мире сверхвысокочастотная мировая модель, без NVIDIA, разгон до 50 кадров/с

marsbit07/08 04:16

Когда американские гиганты массово «бегут» к китайским AI-моделям

Генеральный директор Coinbase Брайан Армстронг заявил, что переход на китайские AI-модели GLM 5.2 и Kimi 2.7 позволил компании сократить расходы на искусственный интеллект вдвое, несмотря на рост объема использования. Это достигнуто за счет внедрения системы автоматической маршрутизации запросов, оптимизации кэширования (повышение命中 до 60%) и метода "контекстного инжиниринга" для работы с моделями. Тенденция набирает обороты: стартап Lindy и Snowflake также сообщают о значительной экономии после перехода на такие модели, как DeepSeek и GLM. Сравнение цен показывает разрыв в 5-7 раз в пользу китайских аналогов по сравнению с Claude Opus или GPT, при том что разница в производительности для многих задач незначительна. Это сигнализирует о сдвиге в отрасли: конкуренция смещается от чистой производительности к экономической эффективности. Пользователям стоит reconsider подход: использовать разные модели под разные задачи, оптимизировать контекст запросов и учитывать кэширование. Растущий спрос на более доступные альтернативы может оказать давление на ценовую политику лидеров рынка, таких как OpenAI и Anthropic, что в итоге выгодно для потребителей.

链捕手07/03 16:10

Когда американские гиганты массово «бегут» к китайским AI-моделям

链捕手07/03 16:10

Если пузырь ИИ уже лопается, кто останется в живых?

Искусственный интеллект находится в фазе пузыря, о чем свидетельствуют чрезмерные инвестиции в инфраструктуру и разрыв между затратами и доходами. Однако, как и в случае с пузырем доткомов, этот этап является необходимым для развития прорывных технологий. Пузырь лопнет, устранив компании без реальной ценности, но оставив после себя прочную физическую и технологическую базу. Ключевой момент — стремительное падение стоимости обработки токенов (на 99,7% с 2023 года), что, вопреки ожиданиям, ведет к взрывному росту спроса на ИИ-сервисы. По принципу «парадокса Джевонса», снижение цены ведет к экспоненциальному росту потребления. ИИ перестает быть просто чат-ботом и становится основой для интеллектуальных агентов, трансформирующих код, финансы, медицину, право и производство. Рынок переживает глубокую трансформацию: ценность смещается от капитальных затрат (CapEx) на инфраструктуру к операционным расходам (OpEx) на приложения, которые решают реальные бизнес-задачи. В то время как спекулятивные проекты исчезнут, оптимизированные модели и дешевые вычислительные мощности станут основой для «интеллектуальной эры», где ИИ, подобно электричеству, будет неотъемлемой частью всех отраслей. Шум пузыря стихнет, но фундаментальная производительная сила технологий ИИ останется.

链捕手06/15 04:37

Если пузырь ИИ уже лопается, кто останется в живых?

链捕手06/15 04:37

Скрытый лидер в сфере искусственного интеллекта на устройстве, которого жаждет Apple: рождается первая когнитивная модель, 4B паритет с GPT-5.4

Apple стремится к искусственному интеллекту на устройстве, и появляется тёмная лошадка: создана первая когнитивная модель, 4B параметров сопоставимы с GPT-5.4. Растущие затраты на вычисления, такие как случай с Amazon, подчеркивают проблему стоимости токенов для ИИ. Andrej Karpathy предложил концепцию «когнитивного ядра» — модели, лишённой обширных знаний, но сохраняющей способности к рассуждению и планированию. Китайская компания Nextie (明日新程) воплотила эту идею, создав первую в отрасли когнитивную модель для устройств — Xincheng Alpha. При 4 млрд параметров она демонстрирует эффективность, сопоставимую с крупными моделями в триллион параметров (как GPT-5.4), в задачах коллективного интеллекта (дебаты, голосование). Её значение трёхстороннее: 1. Улучшает качество решений в системах с несколькими агентами. 2. Резко сокращает затраты на вычисления, позволяя развёртывание на устройстве (ноутбуки, роботы). 3. Открывает путь к активным (Proactive) ИИ-агентам, которые действуют автономно, а не просто реагируют на запросы. Команда Nextie, ранее создавшая модель Rinna, известна эффективностью небольших моделей. Когнитивная модель меняет экономику ИИ, предлагая высокое качество при низких затратах, что может переопределить будущее ИИ-продуктов, сместив фокус с реактивных на активные системы.

marsbit06/09 12:07

Скрытый лидер в сфере искусственного интеллекта на устройстве, которого жаждет Apple: рождается первая когнитивная модель, 4B паритет с GPT-5.4

marsbit06/09 12:07

Приводит ли один отчёт о сокращении памяти к неоправданному падению акций?

Резкое падение акций производителей памяти для ИИ, таких как Micron и SK Hynix, было вызвано отчетом SemiAnalysis о возможном сокращении объема памяти CPU (SOCAMM/LPDDR) в стоечных серверах Nvidia Rubin NVL72 примерно с 55 ТБ до 28 ТБ. Рынок среагировал на негативный заголовок массовой распродажей, хотя отчет не касался ключевого компонента — памяти HBM4 для GPU, которая остаётся критически важной для производительности ИИ-ускорителей. Автор отчета позже уточнил, что это не катастрофические новости, а оптимизация конфигурации для обеспечения сроков поставок. Падение отражает высокую перекупленность сектора и общее снижение аппетита к риску. Влияние, в основном, затрагивает поставщиков системной памяти CPU (например, Micron), в то время как логика роста для поставщиков HBM (например, SK Hynix) остается в силе, но пострадала от общей рыночной паники. Ключевые вопросы остаются: подтвердит ли Nvidia окончательную спецификацию, и будет ли снижение стоимости одного сервера компенсировано ростом объемов поставок. Окончательную оценку ситуации дадут будущие отчеты компаний о доле доходов от HBM и SOCAMM, а также данные по реальным объемам выпуска серверов Rubin.

marsbit06/05 06:31

Приводит ли один отчёт о сокращении памяти к неоправданному падению акций?

marsbit06/05 06:31

Снижение цены на MiMo на 99% — не маркетинг! Ло Фули разбивает доводы скептиков в Twitter.

Сяоми объявила о снижении цен на API MiMo-V2.5 на 99%, что вызвало спекуляции о ценовой войне. Руководитель проекта Луо Фули опубликовал технический блог, объясняя снижение цен инженерными улучшениями, а не маркетингом. Ключевые оптимизации включают: 1. **Гибридная архитектура SWA:** В модели 60 из 70 слоев используют Sliding Window Attention (окно 128 токенов), сокращая объем KVCache в 7 раз. 2. **Двухпульный KVCache:** Раздельное управление памятью для полного внимания и SWA, повышая эффективность использования GPU и поддерживая в 5 раз больше одновременных пользователей. 3. **Высокий % попадания в кэш:** Улучшенный механизм кэширования префиксов обеспечивает попадание в кэш для 93-95% запросов на повторное чтение контекста, минимизируя вычисления. 4. **Распределенный кэш GCache:** Кэш развернут на SSD GPU-серверов, устраняя отдельные затраты на хранилище. 5. **Интеллектуальная маршрутизация LLM-Router:** Система оптимизирует распределение запросов, повышая производительность и сокращая задержки. 6. **Многотокеновое предсказание (MTP):** Модель предсказывает несколько токенов за шаг, ускоряя генерацию ответов. Эти шесть инженерных оптимизаций, работая вместе, значительно снизили себестоимость обработки запросов, сделав снижение цены на 99% экономически обоснованным при сохранении рентабельности. Луо Фули подчеркивает, что это демонстрация реальных инженерных возможностей, а не маркетинговый ход.

marsbit05/31 10:38

Снижение цены на MiMo на 99% — не маркетинг! Ло Фули разбивает доводы скептиков в Twitter.

marsbit05/31 10:38

Kraken сокращает более 150 рабочих мест, поскольку ИИ меняет операции криптобиржи

Криптобиржа Kraken сократила более 150 сотрудников в рамках мер по снижению затрат, достигнутых за счет внедрения искусственного интеллекта в операционную деятельность. По данным источников, это может привести к отсрочке первичного публичного размещения акций (IPO) биржи в США до следующего года, при этом целью выхода на американский рынок остается 2027 год. В криптоиндустрии отмечают, что рост использования ИИ в этом году уже привел к сокращению тысяч рабочих мест, включая масштабное увольнение 4000 сотрудников в Block Inc. в феврале. Решение Kraken совпадает с действиями других компаний сектора, таких как поставщик данных Dune, который также объявил о сокращении штата для оптимизации работы. Откладывание IPO Kraken связано со сложной ситуацией на рынке: падение стоимости криптовалют негативно отразилось на финансовых показателях публичных компаний в первом квартале. Ранее биржа уже отменяла планы по IPO в марте из-за неблагоприятных рыночных условий.

TheNewsCrypto05/18 14:16

Kraken сокращает более 150 рабочих мест, поскольку ИИ меняет операции криптобиржи

TheNewsCrypto05/18 14:16

Актеры AI для ролей второго плана и ниже: режиссер Юй Чжэн заявляет, что живую игру невозможно заменить технологиями

Недавно дискуссия о замене актёров второго плана и менее значимых ролей на ИИ-персонажей возглавила тренды соцсетей, что свидетельствует о глубоком проникновении генеративного ИИ в кинопроизводство. Известный сценарист Юй Чжэн публично выступил против, подчеркнув незаменимость живой актёрской игры. Хотя ИИ-актёры уже способны выполнять сложные действия и создавать уникальные образы, демонстрируя эффективность в сокращении затрат и сроков производства (особенно в мини-сериалах), их ограничения становятся всё очевиднее. Алгоритмы не способны передать эмоциональную глубину и жизненную теплоту, а зрители психологически не готовы к эмоциональному отклику на цифровые образы. Эта тенденция отражает период напряжённости между технологиями и искусством в киноиндустрии. Как отметил Юй Чжэн, ИИ может быть временным трендом и инструментом для отсеивания посредственности, но ядро творчества по-прежнему заключается в человеческой мысли и эмоции. Сегодня, когда цифровые модели сосуществуют с живой игрой, ключевой задачей отрасли становится поиск баланса между технологическим прогрессом и человеческим подходом.

marsbit03/18 08:39

Актеры AI для ролей второго плана и ниже: режиссер Юй Чжэн заявляет, что живую игру невозможно заменить технологиями

marsbit03/18 08:39

Gradient выпускает фреймворк Echo-2 RL, повышая эффективность исследований ИИ более чем в 10 раз

Gradient представила фреймворк распределённого обучения с подкреплением Echo-2, который повышает эффективность исследований ИИ более чем в 10 раз. Новая архитектура полностью разделяет Learner и Actor, сокращая стоимость пост-обучения модели на 30 млрд параметров с $4500 до $425. Технология использует асинхронное обучение с разделением вычислений и памяти, задействует нестабильные GPU-инстансы и гетерогенные видеокарты через Parallax. Решение сохраняет точность моделей благодаря таким инновациям как ограниченная устареваемость, отказоустойчивое планирование и протокол связи Lattica. Gradient также анонсировала платформу RLaaS Logits (logits.dev), открытую для студентов и исследователей, чтобы трансформировать ИИ-разработку от капиталоёмкой к эффективно-итерационной модели.

marsbit02/12 16:40

Gradient выпускает фреймворк Echo-2 RL, повышая эффективность исследований ИИ более чем в 10 раз

marsbit02/12 16:40

活动图片