# AI训练的所有文章

在 HTX 新聞中心流覽與「AI训练」相關的最新資訊與深度分析。潘蓋市場趨勢、專案動態、技術進展及監管政策,提供權威的加密行業洞察。

近百名玩家涌入具身数据 : 一年融资44.7亿,谁能真靠“卖数据”赚钱?

近百名玩家涌入具身数据领域,行业一年融资约44.7亿元。该行业已成长为一个独立赛道,但整体仍处早期阶段。 数据采集主要有四大技术路线:真机遥操、无本体采集、仿真合成和互联网视频蒸馏。其中,采用跨路线采集方案的公司最多,单独押注真机遥操的玩家也占相当比例。行业现有年产能估计在160万至180万小时数据,短期目标是在1-3年内扩大15到20倍,但相比大语言模型的数据需求仍有巨大差距。 从玩家构成看,独立数据服务商已成为最大群体(占40%),其次是国资数据平台和机器人公司。超过六成的数采公司是“具身原生”企业,而数据基础设施(infra)公司则有约七成来自AI数据标注等领域的“跨界转型”。 资本方面,过去一年有15家“独立具身数据服务商”获得融资,总额约44.7亿元,但这仅为同期具身智能全行业融资额的一个零头。头部公司光轮智能融资占行业总融资近七成,其余多数公司融资轮次较早、金额较小。共有69家投资机构出手,但无一重仓,显示出资本态度谨慎。 行业面临的核心挑战是:尽管产能快速扩张、玩家众多,但尚未有公司能明确验证“纯卖数据”是一门可持续盈利的生意。未来一两年将是商业模式验证的关键窗口期。

marsbit07/12 02:30

近百名玩家涌入具身数据 : 一年融资44.7亿,谁能真靠“卖数据”赚钱?

marsbit07/12 02:30

拖更三年,北大校友翁荔最新长文刷屏

前OpenAI副总裁翁荔(Lilian Weng)发表了一篇关于AI扩展定律(Scaling Laws)的深度分析文章。文章指出,这条指导了AI行业数百亿美元投入的核心定律,远比人们想象的更为脆弱。 文章回顾了Scaling Laws的基本思想,即模型性能随规模扩大而可预测地提升。然而,OpenAI与DeepMind在关键问题上得出了相反结论:给定算力,资源应更多分配给模型还是数据?OpenAI的Kaplan团队认为模型增长应更快,而DeepMind的Chinchilla团队则认为应等比增长。后来研究发现,这一分歧源于参数统计口径的差异和实验规模不足,导致Kaplan的结论仅适用于小规模场景。 更关键的是,被行业广泛采纳的Chinchilla最优配比公式本身也存在方法论瑕疵。2024年有团队复现发现,其损失函数因取均值而非求和,导致优化器提前停止,输出并非最优解。此外,用于外推的关键参数精度不足,放大了误差。 文章进一步指出,经典Scaling Laws的根本前提——高质量数据无限供应——正在崩塌。数据重复训练不可避免,新研究引入了惩罚项来修正公式,并发现大模型对数据重复更敏感。这解释了行业为何转向强化学习、测试时计算和合成数据等新路径。 翁荔的博客以其清晰深入的技术解析著称,这篇文章历时三年完成。她于2025年联合创立了新公司Thinking Machines Lab。文章强调,下一代AI的进步不仅依赖算力规模,更取决于对这些基础定律细节更精确的理解与运用。

marsbit06/26 04:52

拖更三年,北大校友翁荔最新长文刷屏

marsbit06/26 04:52

活动图片