# Сопутствующие статьи по теме Экономия затрат

Новостной центр HTX предлагает последние статьи и углубленный анализ по "Экономия затрат", охватывающие рыночные тренды, новости проектов, развитие технологий и политику регулирования в криптоиндустрии.

Только что: Claude Fable 5 продлен на 5 дней, вот стратегия экономии

7 июля срок бесплатного доступа к Claude Fable 5, самому мощному языковой модели от Anthropic, был неожиданно продлен до 12 июля. Пользователи получили дополнительные 5 дней для использования модели с еженедельным лимитом в 50%. В сообществе активно обсуждаются методы «спасения» возможностей Fable 5. Разработчики предлагают способы переноса его «стиля мышления» в другие модели, такие как Opus 4.8, и извлечения знаний для создания собственных эффективных систем. Anthropic официально представила две архитектуры для оптимизации затрат: 1. **Режим советника (Advisor)**: Основную работу выполняет более дешевая модель Sonnet 5, а Fable 5 привлекается только для консультаций в ключевые моменты. Это позволяет достичь 92% производительности Fable 5 при затратах около 63%. 2. **Режим оркестратора (Orchestrator)**: Fable 5 выступает в роли командующего, который планирует задачи и распределяет их между несколькими «рабочими» экземплярами Sonnet 5. В задаче проверки фактов эта схема показала 96% эффективности при снижении затрат до 46% по сравнению с использованием одной только Fable 5. Основной посыл — использовать самую мощную и дорогую модель не для всей работы, а только для критически важных решений и планирования, делегируя объемные задачи более экономичным моделям. Это позволяет значительно сократить расходы после окончания бесплатного периода.

marsbit07/08 00:56

Только что: Claude Fable 5 продлен на 5 дней, вот стратегия экономии

marsbit07/08 00:56

Может ли DeepSeek сэкономить Китаю 1 триллион долларов?

Статья анализирует, как DeepSeek может радикально снизить затраты на инфраструктуру искусственного интеллекта в Китае за счет повышения эффективности оборудования, а не за счет снижения цен на чипы. Основная проблема современного ИИ — высокая зависимость от дорогих и дефицитных компонентов, особенно памяти HBM. В статье на примере будущей платформы Nvidia Vera Rubin (стоимостью около $7,8 млн) показано, как быстро растут расходы на память. DeepSeek атакует эту проблему с помощью трех ключевых технологий в своей модели V4: 1. **Сжатие «памяти» (контекста):** Технология Multi-head Latent Attention (MLA) кардинально сокращает объем кэша KV, необходимого для длинных контекстов, без потери качества, что высвобождает дорогую память HBM. 2. **Эффективное использование «тела» модели:** Применяя архитектуру Mixture of Experts (MoE) и интеллектуальное распределение параметров, модель активирует только небольшую часть своих «экспертов» для каждой задачи, уменьшая нагрузку на высокоскоростную память. 3. **Повторное использование вычислений:** Система кэширования позволяет повторно использовать ранее вычисленные результаты (например, при многократном чтении одного документа), заменяя дорогие вычисления дешевым чтением из памяти. В совокупности эти инновации позволяют, согласно автору, увеличить эффективную пропускную способность (производство токенов) на одном аппаратном обеспечении в 4 раза. Это эквивалентно экономии 75% капитальных затрат на оборудование для достижения того же уровня производительности. В перспективе, с ростом ежедневного потребления токенов в Китае до триллионов, такая эффективность может привести к колоссальной экономии на строительстве дата-центров. Автор приводит расчет: если технология DeepSeek позволит избежать необходимости построить эквивалент 3,5 тыс. вычислительных центров (примерная стоимость — 2 млрд юаней каждый), общая экономия может приблизиться к 1 трлн долларов. Таким образом, стратегическая цель DeepSeek — не просто сделать API дешевле, а изменить саму экономику ИИ-инфраструктуры. Это смещает фокус стоимости с самых дефицитных и уязвимых компонентов (передовые GPU и HBM) в сторону более доступных областей (оптимизация ПО, системная инженерия, стандартная память), где Китай имеет больше возможностей для развития. В итоге это может сделать передовые возможности ИИ более доступными для китайской промышленности.

marsbit06/03 00:49

Может ли DeepSeek сэкономить Китаю 1 триллион долларов?

marsbit06/03 00:49

Экономия 3 миллиардов токенов в неделю: руководство по кэшированию Claude Code от инженера Anthropic

Авторы из Anthropic объясняют, как система кэширования (prompt caching) в Claude Code позволяет значительно экономить токены. Кэшированные токены стоят лишь 10% от обычных. Например, 91 миллион кэшированных токенов эквивалентны по стоимости примерно 9 миллионам обычных. Кэш делится на три уровня: системный (инструкции, инструменты), проектный (CLAUDE.md, правила) и диалоговый (история общения). Ключевой принцип — префиксное соответствие: если начало нового запроса совпадает с уже обработанным, модель использует кэш. Время жизни кэша (TTL) в подписке Claude Code составляет 1 час. Для API и Sub-agent по умолчанию — 5 минут. Основные советы пользователям: 1. Не оставлять сессию бездействующей более часа. 2. При смене задачи выполнять четкий «handoff» (резюмировать прогресс) и начинать новую сессию. 3. Помещать большие документы в Projects, а не в диалог. 4. Избегать переключения моделей (включая режим «opus plan»), так как это сбрасывает кэш. Эти привычки помогают поддерживать высокий процент повторного использования кэша, что снижает затраты, увеличивает эффективность сессий и уменьшает нагрузку на сервис. Мониторинг показателя cache read в панели управления помогает оценить эффективность использования кэша.

marsbit05/24 00:38

Экономия 3 миллиардов токенов в неделю: руководство по кэшированию Claude Code от инженера Anthropic

marsbit05/24 00:38

活动图片