# Сопутствующие статьи по теме Архитектура

Новостной центр HTX предлагает последние статьи и углубленный анализ по "Архитектура", охватывающие рыночные тренды, новости проектов, развитие технологий и политику регулирования в криптоиндустрии.

Снижение цены на MiMo на 99% — не маркетинг! Ло Фули разбивает доводы скептиков в Twitter.

Сяоми объявила о снижении цен на API MiMo-V2.5 на 99%, что вызвало спекуляции о ценовой войне. Руководитель проекта Луо Фули опубликовал технический блог, объясняя снижение цен инженерными улучшениями, а не маркетингом. Ключевые оптимизации включают: 1. **Гибридная архитектура SWA:** В модели 60 из 70 слоев используют Sliding Window Attention (окно 128 токенов), сокращая объем KVCache в 7 раз. 2. **Двухпульный KVCache:** Раздельное управление памятью для полного внимания и SWA, повышая эффективность использования GPU и поддерживая в 5 раз больше одновременных пользователей. 3. **Высокий % попадания в кэш:** Улучшенный механизм кэширования префиксов обеспечивает попадание в кэш для 93-95% запросов на повторное чтение контекста, минимизируя вычисления. 4. **Распределенный кэш GCache:** Кэш развернут на SSD GPU-серверов, устраняя отдельные затраты на хранилище. 5. **Интеллектуальная маршрутизация LLM-Router:** Система оптимизирует распределение запросов, повышая производительность и сокращая задержки. 6. **Многотокеновое предсказание (MTP):** Модель предсказывает несколько токенов за шаг, ускоряя генерацию ответов. Эти шесть инженерных оптимизаций, работая вместе, значительно снизили себестоимость обработки запросов, сделав снижение цены на 99% экономически обоснованным при сохранении рентабельности. Луо Фули подчеркивает, что это демонстрация реальных инженерных возможностей, а не маркетинговый ход.

marsbit05/31 10:38

Снижение цены на MiMo на 99% — не маркетинг! Ло Фули разбивает доводы скептиков в Twitter.

marsbit05/31 10:38

Альма-матер 'Цинхуа' выпускник 00-х Ван Гуан представил новую работу: разрушение парадигмы предобучения Transformer с использованием 1/900 токенов и 1/432 вычислительной мощности

Новая работа выпускника Университета Цинхуа, Ван Гуана (р. 2000), предлагает альтернативу дорогому и ресурсоёмкому предварительному обучению больших языковых моделей. Исследователи представили HRM-Text — эффективную модель, основанную на иерархической рекуррентной архитектуре (HRM), которая заменяет стандартный Transformer. Ключевые инновации включают: 1. **Архитектура HRM:** Использует модули с медленной (H) и быстрой (L) временной шкалой, выполняющие несколько рекуррентных обновлений на один токен. Это увеличивает вычислительную глубину без роста числа параметров. 2. **Целевая функция обучения:** Модель обучается непосредственно на парах "инструкция-ответ", вычисляя потери только для ответной части с использованием маски PrefixLM (двунаправленное внимание для инструкции, причинное — для ответа). 3. **Методы стабилизации:** MagicNorm (гибридная нормализация) и Warmup Deep Credit Assignment (постепенное увеличение глубины обратного распространения градиента) обеспечивают стабильность глубокого рекуррентного обучения. Эксперименты показывают, что HRM-Text 1B, обученная всего на 40B уникальных токенах с бюджетом около $1500, демонстрирует производительность, сопоставимую с открытыми моделями размером от 2B до 7B параметров. При этом она требует до 900 раз меньше токенов и до 432 раз меньше вычислений для обучения. Модель достигает, например, 60.7% на MMLU и 84.5% на GSM8K. Основные направления будущих исследований: разделение "знаний" и "рассуждений", внедрение адаптивного времени вычислений для снижения затрат на вывод, проверка масштабируемости на больших моделях и оптимизация развёртывания архитектуры PrefixLM.

marsbit05/26 03:17

Альма-матер 'Цинхуа' выпускник 00-х Ван Гуан представил новую работу: разрушение парадигмы предобучения Transformer с использованием 1/900 токенов и 1/432 вычислительной мощности

marsbit05/26 03:17

Почему Zhipu AI вырос почти на 30% за один день?

**Чжипу ворвался на рынок: почему акции компании взлетели почти на 30% за один день?** Компания "Чжипу" (Zhipu AI), известная как "первая акция глобальной большой модели", показала резкий рост акций — на 26% за день. Причина — технический прорыв: запуск API высокоскоростной версии модели GLM-5.1, генерирующей текст со скоростью **400 токенов в секунду** (около 200 иероглифов). **Почему скорость стала ключевым фактором?** До сих пор конкуренция на рынке ИИ шла по двум направлениям: размер модели (больше параметров) и цена. Однако с переходом от чат-ботов к автономным агентам (Agent) задержка в ответах стала критически важной. Задачи агента требуют десятки или сотни циклов обращения к модели, и каждый сэкономленный миллисекунд суммируется, существенно влияя на общую производительность. Скорость превращается из технического показателя в фактор, определяющий интеллектуальный потолок системы. **Сложность достижения такой скорости** Текущие лидеры рынка — OpenAI GPT-4o, Anthropic Claude — работают на скоростях 80-150 токенов/с. Показатель "Чжипу" в 400 токенов/с опережает средний уровень отрасли в 3-5 раз. Это достижение стало возможным благодаря одновременным инновациям на трех уровнях: 1. **TileRT (движок логического вывода):** Компилирует всю модель в единый, непрерывно работающий "двигатель", минимизируя простои GPU и накладные расходы на запуск операций. 2. **Гетерогенный параллелизм:** Оптимизирует распределение вычислений между несколькими графическими процессорами (GPU), адаптируя стратегию под разные типы операций (например, разреженный поиск и плотные вычисления), чтобы избежать потерь на синхронизацию. 3. **ZCube (сетевая архитектура):** Заменяет стандартную древовидную сетевую топологию на плоскую и полностью связанную. Это сокращает количество "прыжков" при передаче данных между GPU с 3 до 2 и, что самое главное, проектирует сеть таким образом, что между любыми двумя GPU существует только один оптимальный путь. Это устраняет саму возможность сетевых заторов. **Практические и рыночные последствия** Для "Чжипу" это означает: * Увеличение пропускной способности кластера на **15%** (больше пользователей при том же оборудовании). * Снижение задержек при пиковой нагрузке на **40.6%** (более стабильная работа). * Сокращение затрат на сетевое оборудование примерно на **треть**. В долгосрочной перспективе эти инновации подрывают монополию комплексных решений NVIDIA (GPU + NVLink + InfiniBand), открывая возможности для производителей альтернативных чипов (например, Huawei Ascend) и меняя структуру спроса на сетевые компоненты (выгоду получат производители высокоплотных коммутаторов и высокоскоростных оптических модулей). Прорыв "Чжипу" демонстрирует, как оптимизация инфраструктуры *вокруг* GPU может кардинально повысить эффективность и снизить стоимость вычислений ИИ.

marsbit05/23 01:24

Почему Zhipu AI вырос почти на 30% за один день?

marsbit05/23 01:24

Десять лет ставок на Cerebras: как чип ИИ размером с вафлю покорил Nasdaq

14 мая 2026 года компания Cerebras Systems, разработчик революционных AI-чипов в масштабе целой кремниевой пластины (wafer-scale), успешно провела IPO на NASDAQ (CBRS), показав рост на 68% в первый день. Эта статья, написанная ранним инвестором Стивом Вассалло, рассказывает историю 19-летнего партнерства с основателем Эндрю Фельдманом — от компании SeaMicro до Cerebras. Идея Cerebras родилась в 2014-2015 годах, когда Фельдман и его сооснователи (Гэри Лаутербах, Шон Либ, Майкл Джеймс и JP) увидели фундаментальную проблему: GPU, ставшие стандартом для AI, были неоптимальны из-за ограниченной пропускной способности памяти. Они решили заново изобрести компьютер для искусственного интеллекта с нуля, создав единый чип размером с целую пластину (в 58 раз больше традиционного). Это потребовало решения беспрецедентных инженерных задач: питания, охлаждения и обеспечения электрической целостности на огромной площади. В 2016 году, несмотря на скептицизм в индустрии и среди некоторых партнеров, Вассалло, уверенный в видении команды, инвестировал в компанию. Путь к успеху был трудным: первый прототип «задымился», каждые 6-8 недель приходилось преодолевать новые системные проблемы. Ключом к прорыву стала глубокая техническая экспертиза команды, их дисциплина в работе с законами физики и неуклонная настойчивость. Первый работающий компьютер Cerebras был запущен в августе 2019 года. История IPO — это кульминация десятилетия упорной работы команды, построенной на доверии, взаимном уважении и редкой способности Фельдмана объединять талантливых людей вокруг амбициозных, казалось бы, невозможных задач. Успех Cerebras демонстрирует, что революция в вычислениях может происходить не только через увеличение числа GPU, но и через фундаментальное переосмысление самой архитектуры компьютера.

marsbit05/15 03:57

Десять лет ставок на Cerebras: как чип ИИ размером с вафлю покорил Nasdaq

marsbit05/15 03:57

Основатель a16z: В эпоху агентов действительно важное изменилось

Марк Андреессен, основатель a16z, в интервью подкасту Latent Space обсуждает трансформацию ИИ. Он подчеркивает, что нынешний прогресс ИИ — результат 80-летнего развития, а не внезапный прорыв. Ключевые изменения включают появление агентов (ИИ-систем, сочетающих LLM, оболочку, файловую систему и инструменты планирования), которые способны автономно выполнять задачи, используя существующие программные инфраструктуры. Андреессен предсказывает, что традиционные интерфейсы уступят место взаимодействию через агентов, а программное обеспечение станет более доступным и автоматизированным. Он также отмечает важность открытого исходного кода, локальных вычислений и необходимость решения проблем безопасности, идентификации и институциональных барьеров для широкого внедрения ИИ.

marsbit04/25 02:07

Основатель a16z: В эпоху агентов действительно важное изменилось

marsbit04/25 02:07

Ant Group Digital Technology впервые представила новую архитектуру для экономики агентов, охватывающую четыре уровня: идентификацию, платежи, управление рисками и соответствие требованиям

20 апреля Ant Digital Technologies впервые представила на фестивале Web3 концепцию архитектуры для экономики интеллектуальных агентов — «4R Full-Stack». Она включает четыре уровня: среда выполнения агентов (Agentic Runtime), платежные системы (Payment Rails), реестр агентов (Agent Registry) и корневая инфраструктура (Root Infrastructure). Цель архитектуры — создать технологическую основу для ИИ-агентов, охватывающую идентификацию, платежи, управление рисками и соответствие требованиям. По словам CTO компании Янь Ин, текущая экономика агентов сталкивается с четырьмя ключевыми пробелами: уязвимости в логике prompt-инжиниринга, отсутствие доверенной идентификации ИИ, ограничения платежных систем, ориентированных на людей, и риски сотрудничества между незнакомыми агентами. Решение требует перепроектирования базовой инфраструктуры. Архитектура включает: DTClaw для контроля выполнения действий агентов с поддержкой многомодельности и стандартов соответствия; встроенные платежные каналы с поддержкой микротранзакций и межсетевого взаимодействия; систему идентификации на основе DID и ERC-8004; а также базовый уровень с использованием Jovay Layer2 и ZKVM для обеспечения доверенных вычислений и быстрых расчетов. Янь Ин подчеркнула, что ИИ вступает в эпоху экономики агентов, где ключевым изменением становится способность владеть активами и совершать транзакции. Архитектура 4R основана на многолетнем опыте Ant Digital в области финансовой безопасности, блокчейна и приватных вычислений.

marsbit04/20 09:25

Ant Group Digital Technology впервые представила новую архитектуру для экономики агентов, охватывающую четыре уровня: идентификацию, платежи, управление рисками и соответствие требованиям

marsbit04/20 09:25

Основатель a16z: В эпоху агентов действительно важное изменилось

Марк Андреессен, основатель a16z, анализирует эпоху ИИ-агентов как результат 80-летней эволюции технологий, а не внезапного прорыва. Ключевые изменениями являются: переход от чат-ботов к агентам с архитектурой «LLM + shell + файловая система + markdown + cron/loop», что позволяет им сохранять состояние, самоанализироваться и использовать инструменты Unix. Браузеры и графические интерфейсы уступают место агентам, которые выполняют задачи автономно, а люди лишь формулируют цели. Инвестиции в ИИ, в отличие от дотком-пузыря, поддерживаются крупными компаниями и быстро монетизируются. Андреессен подчеркивает важность открытого исходного кода, локальных вычислений на устройствах и необходимость решения проблем безопасности, идентификации и финансовой инфраструктуры для агентов. Он отмечает, что внедрение ИИ замедляется институциональными барьерами, а не технологическими ограничениями.

marsbit04/20 00:05

Основатель a16z: В эпоху агентов действительно важное изменилось

marsbit04/20 00:05

Тонкий Harness, Толстый Skill: Истинный источник 100-кратной продуктивности ИИ

Гарри Тан, президент и CEO Y Combinator, утверждает, что истинный источник 100-кратного роста производительности ИИ заключается не в более мощных моделях, а в системном дизайне — концепции «тонкой обвязки (thin harness) и толстых навыков (fat skills)». Ключевые элементы: 1. **Навыки (Skills)** — многоразовые markdown-документы, описывающие процессы, а не задачи. 2. **Обвязка (Harness)** — легкий фреймворк, управляющий выполнением, контекстом и безопасностью. 3. **Резолвер (Resolver)** — маршрутизатор контекста, загружающий нужные данные в нужное время. 4. **Разделение латентного (творческое мышление) и детерминированного (стабильные вычисления)**. 5. **Диаризация (Diarization)** — сжатие информации из множества документов в структурированную сводку. Пример из YC: система анализирует 6000 заявок founders, обогащает данные, выявляет расхождения между словами и действиями, группирует участников и автоматически улучшает навыки на основе обратной связи. Это создает самообучающуюся систему, растущую с каждым циклом без переписывания кода. Итог: эффективность определяется не моделью, а архитектурой, где навыки накапливают экспертизу, а обвязка остается минимальной. Это обеспечивает долгосрочный рост производительности.

marsbit04/13 04:23

Тонкий Harness, Толстый Skill: Истинный источник 100-кратной продуктивности ИИ

marsbit04/13 04:23

活动图片