Fable 5手搓首个CUDA「超级内核」,2.5小时狂飙18.7倍
在KernelBench-Mega基准测试中,Anthropic的Fable 5模型展现了卓越的GPU编程能力。它通过“纯手搓”CUDA代码,为一项混合解码任务编写了史上首个真正的“超级内核”,即将整个推理流程融合进单个内核一次性执行,极大减少了内核启动开销。在RTX PRO 6000上,其性能达到了基准线的18.7倍,远超Claude Opus 4.8的14.4倍和GPT-5.5的4.34倍,实现断层领先。值得注意的是,其性能优势随上下文长度增加而扩大。
Fable 5的创作过程历时约2.5小时,消耗55万token,其大部分时间用于分析性能上限等前置工作,随后高效优化代码。Anthropic联合创始人Jack Clark将此视为“递归自我提升(RSI)循环”的开端,即AI通过自我优化底层代码,可能形成一个加速自身发展的飞轮。文章同时指出,这种技术飞跃也伴随着对未来的复杂反思,Clark本人亦描绘了一个未来可能因风险而禁绝通用计算的科幻场景,体现了技术进步背后的“撕裂感”。
marsbit07/07 07:35