Dwarkesh Patel:下一代AI,可能是干活干出来的
硅谷知名播客主持人Dwarkesh Patel探讨了下一代AI训练范式的可能方向。他指出,当前前沿实验室关注的RLVR(可验证奖励强化学习)虽然在代码、数学等可验证、可重复的任务上进展迅速,但其在复杂现实任务(如创业、法律、市场决策)中可能受限,因为这些任务反馈慢、变量多、环境不可重置。
Dwarkesh提出,AI的真正突破可能需要从“发布前训练”转向“发布后学习”。关键在于让模型能够从真实部署中积累经验,并将这些经验有效压缩并“写回”模型权重,实现持续学习。他提到了两种潜在技术方向:一是“在策略自蒸馏”(OPSD),将模型在长上下文中获得的经验蒸馏回基础模型;二是“梦境”模拟,即AI根据观察构建内部模拟环境进行练习。
未来的训练流程可能是:先通过RLVR训练出基本智能体,再将其部署到真实任务中,从用户反馈和项目经验中持续学习。这意味着AI进步的核心数据源可能从互联网文本和实验室任务,转向智能体在真实世界中自行产生的经验。
marsbit06/28 23:49