# 代码的所有文章

在 HTX 新闻中心浏览与「代码」相关的最新资讯与深度分析。潘盖市场趋势、项目动态、技术进展及监管政策,提供权威的加密行业洞察。

Show me《指环王》,卡帕西强推大模型评测新基准

大神卡帕西宣布推出全新大模型评测基准“指环王”,用《指环王》小说开篇文字提示大模型(以Opus 5为例),要求其使用Three.js代码库生成一个完整、可交互的3D中土世界场景。这一测试旨在替代过去流行的“鹈鹕骑自行车”SVG测试,以评估模型在复杂项目规划、长上下文理解、空间推理以及代码生成与调试等方面的综合能力。 Opus 5耗时约2小时,消耗100万token,生成了约5500行代码,最终产出了一个风格粗犷但能运行的中土世界demo,展现了从文学描述到程序化3D场景的转换能力。不过,作品也存在画面粗糙、人物漂浮等明显缺陷,暴露出当前大模型尚无法真正“进入”并实时理解自身生成的动态世界。 众多网友随后进行了类似创意尝试,例如生成旧金山3D场景、搭建纽约数字孪生、甚至创建可交互的虚拟演唱会,显示了利用大模型降低3D内容与轻量游戏开发门槛的潜力。 卡帕西和社区讨论认为,“鹈鹕测试”已不足以区分顶尖模型,而“指环王基准”这类需要长时间、多步骤协作的复杂任务,更能检验模型的深层推理与工程实现能力。尽管存在计算成本高、评价标准待完善等争议,但该测试可能揭示了模型通用推理能力正自然延伸至三维世界构建。同时,这也引发思考:当大模型能自主协调代码、视觉、音频生成时,专用AI视频生成工具的角色或将面临变革。

marsbit08/03 08:54

Show me《指环王》,卡帕西强推大模型评测新基准

marsbit08/03 08:54

全网骂Claude变笨,Anthropic下场揭秘:坑你的不是模型

近日,Anthropic官方发文澄清了用户关于Claude“变笨”的普遍误解。问题的核心并非模型能力下降,而是用户混淆了“模型选择”与“努力度”两个关键设置。 今年3月,许多开发者发现Claude Code性能骤降,任务完成不彻底。原因在于Anthropic为降低延迟,将“努力度”默认档位从“高”调至“中”,导致模型投入工作量减少,而非模型本身变弱。 官方解释了两者的区别: - **模型**:代表AI的“脑子”,即固定的知识权重,决定其“会不会”某项任务。换模型是更换其底层能力。 - **努力度**:代表AI的“态度”,决定其单次任务中愿意投入多少工作量,如读取文件、运行测试、深入验证的彻底程度。高努力度能生成数倍于低努力度的思考与操作。 因此,当Claude表现不佳时,应先检查提示词与上下文。若AI“不够努力”(如跳过必要步骤),应调高努力度;若属于“不会”(上下文充足仍犯错),才需更换更强模型。 一个反直觉的结论是:较小模型(如Sonnet)配合高努力度,其表现可能优于强大模型(如Opus)在低努力度下的表现。关键在于根据任务复杂度合理“调度”模型与努力度,这已成为有效使用AI编程工具的核心技能。盲目升级模型而不调整努力度,可能既浪费成本又无法解决问题。

marsbit07/12 05:56

全网骂Claude变笨,Anthropic下场揭秘:坑你的不是模型

marsbit07/12 05:56

1600代码造出水下曼哈顿, Fable 5让Karpathy看呆了

AI模型Fable 5近期重新上线,其强大的3D世界生成能力引发了广泛关注。AI评测平台Arena.ai的Peter Gostev利用该模型,仅用约1600行代码,便一次性生成了63个复杂且细节丰富的互动3D场景,涵盖城市景观、自然奇观、艺术名画再现、微观视角及科幻想象等多个主题。 其中最令人惊叹的包括一座沉于水下的曼哈顿,其建筑、街道纹理栩栩如生;以及将梵高《星空》、莫奈《睡莲》等名画解构成可穿梭飞行的三维空间。这些场景不仅视觉震撼,更展现出模型对物理交互、动态细节(如熊捕鱼时鱼的挣扎)的深层理解与跨模态生成能力。 著名AI研究员、刚加入Anthropic的Andrej Karpathy观看后深感震撼,认为模型在创造丰富、可玩世界方面实现了质的飞跃,并提出了“fablemaxxing”一词来形容这种突破。 Gostev指出,Fable 5的优势在于能协调海量元素一次性生成连贯世界,显著减少了调试时间。尽管其在复杂游戏性上仍有局限,部分生成结果需筛选,但其在Arena.ai的Agent Arena榜单上已以巨大优势登顶,证明了其强大的实际任务完成能力。 此次演示揭示了当前AI模型在空间理解与创造性构建方面的惊人进步。无论是开发者还是使用者,都可能发现过去模型无法完成、而新一代模型可以胜任的新领域。探索才刚刚开始。

marsbit07/06 09:48

1600代码造出水下曼哈顿, Fable 5让Karpathy看呆了

marsbit07/06 09:48

老黄:Prompt已死,整个AI圈都在疯狂追Loop

近期,硅谷AI圈掀起“Loop Engineering”(循环工程)热潮,业界普遍认为传统手动编写提示词(Prompt)的模式即将被淘汰。英伟达CEO黄仁勋、吴恩达、Anthropic及OpenAI等多位专家和机构均指出,未来核心不再是设计单次指令,而是构建能够自主运行、迭代的AI循环系统。 循环工程的核心在于将人类从实时干预中解放出来,转变为系统架构师。人类只需一次性定义目标、停止条件、验证机制、记忆存储及调度规则,随后AI系统便可自动执行“发现任务→执行→验证→持久化→再发现”的闭环流程,实现24/7不间断工作。其中,独立的验证环节尤为关键,需设立专门的评估智能体对输出进行客观审查,避免自我美化。 这一转变意味着代码生成成本大幅降低,而人类的判断力成为关键稀缺资源。然而,全自动循环也可能带来验证债务、代码理解脱节、认知依赖及token消耗失控等风险。因此,成功的循环设计需融入严谨的判断与监督,否则可能放大错误或导致技术债务。 目前,相关实践指南和白皮书已在网络广泛传播,标志着AI开发正从“提示工程”迈向“循环工程”的新范式。尽管自动化能力增强,但工程师的核心角色并未消失,而是升级为循环系统的设计者与决策者,确保AI在正确方向上高效运行。

marsbit06/29 08:37

老黄:Prompt已死,整个AI圈都在疯狂追Loop

marsbit06/29 08:37

活动图片