Fable 5 вручную создаёт свой первый CUDA «суперъядерный код», за 2,5 часа получая прирост в 18,7 раз
Fable 5 в рамках теста KernelBench-Mega самостоятельно, «вручную», написал и оптимизировал высокоэффективное ядро CUDA для задачи декодирования Kimi-Linear (W4A16). На RTX PRO 6000 его решение показало ускорение в 18.7 раз по сравнению с базовой линией, значительно опередив модели вроде Claude Opus 4.8 (14.4x) и GPT-5.5 (4.34x).
Ключевым достижением стало создание первого в истории бенчмарка «мега-ядра»: Fable 5 объединил все этапы вычислений для одного токена (деквантование int4, свёртку, внимание и т.д.) в один запуск GPU-ядра с 14 барьерными синхронизациями, тогда как другие модели требовали от 4 до 14 отдельных запусков. Это минимизировало накладные расходы и позволило производительности масштабироваться с ростом контекста.
Весь процесс создания кода занял 2.5 часа и около 550 тысяч токенов, причём модель 64% времени потратила на анализ производительности и микро-бенчмаркинг перед написанием кода. Соучредитель Anthropic Джек Кларк назвал это началом цикла «рекурсивного самосовершенствования» (RSI), когда ИИ, улучшая собственные вычислительные инструменты, ускоряет своё же развитие, создавая самоподдерживающийся цикл прогресса.
marsbit07/07 07:37