3B小模型,编程得分比肩Opus 4.5,神秘模型引发热议,原是国产
最近,一个名为VibeThinker-3B的30亿参数小型语言模型引发关注。它在编程等可验证推理任务上的性能,可与Gemini 3 Pro、GPT-5 high、Claude Opus 4.5等前沿大模型相媲美。该模型由新浪微博团队开发,基于Qwen2.5-Coder-3B构建,采用升级版Spectrum-to-Signal流程进行训练,强化了数据合成、质量过滤和课程学习,并应用了多领域推理强化学习等技术。其在AIME26、LiveCodeBench等数学与编程基准测试中成绩突出。报告提出“参数压缩覆盖假设”,认为在任务结构清晰、反馈可靠的可验证推理领域,推理能力可以被高度压缩,小型模型也能达到前沿水平,这与依赖大量参数覆盖事实的通用知识能力形成对比。作者强调,其目标是探索小模型在特定能力维度的边界,而非替代大模型。该模型已公开,但其在需要通用知识的领域表现有限。
marsbit06/18 00:23