# 自然语言处理的所有文章

在 HTX 新闻中心浏览与「自然语言处理」相关的最新资讯与深度分析。潘盖市场趋势、项目动态、技术进展及监管政策,提供权威的加密行业洞察。

ACL 2026华人霸榜,最佳论文一作全华人,杰出论文几乎包场

ACL 2026计算语言学顶会于7月在美国圣地亚哥举行,规模创历史新高,共收到12148篇投稿,同比增长45%。本届会议被大语言模型(LLM)主题主导,相关词汇在论文标题中出现频率极高。 会议评选出三篇最佳论文,一作均为华人学者: 1. 《The Imperfective Paradox in Large Language Models》:通过“未完成体悖论”这一经典语言学现象测试大模型,发现开源模型普遍存在“目的论偏见”,即倾向于认为有目标的动作都会完成,揭示了模型更像“叙事预测引擎”而非逻辑推理者。 2. 《Memory efficiency and resource-rational encoding in sentence processing》:通过为Transformer模型添加工作记忆约束(注入噪声),迫使模型学习更高效地分配有限的记忆资源。结果发现,这种约束让模型的阅读节奏更接近人类,并促成了更压缩、更范畴化的表征。 3. 《Characterizing the Expressivity of Local Attention in Transformers》:利用形式语言理论解释了为何“局部注意力”机制在节省计算成本的同时,常能提升模型效果。研究表明,局部注意力引入了新的表达能力,与全局注意力互补,结合使用能获得最丰富的表达力。 此外,会议还评选了18篇杰出论文,华人在其中占据显著比例,尤其在强化学习、大模型安全与智能体等热门方向成果突出。 本届ACL数据显示,中国大陆作者占比高达54.0%,美国以18.4%位列第二。会议投稿量、审稿规模及参会人数均大幅增长,体现了该领域的空前繁荣与激烈竞争。

marsbit07/09 11:56

ACL 2026华人霸榜,最佳论文一作全华人,杰出论文几乎包场

marsbit07/09 11:56

从“词元”到“符元”:Token 中文名背后的 AI 底层认知之争

近期,全国科学技术名词审定委员会推荐将AI领域的“Token”译为“词元”,引发广泛讨论。尽管专家认为“词元”符合单义性、简明性等原则,且易于传播,但这一译名在多模态AI发展的背景下存在长期适配性问题。文章提出“符元”作为替代方案,并从多个维度展开分析: 首先,Token虽起源于自然语言处理,但本质是跨模态的“离散符号单元”,而非仅限于语言的“词”。以初始应用场景定义概念,易造成认知局限。 其次,“词元”依赖“词”的类比扩展(如“词云”),但类比不应替代定义。术语需严格区分解释性隐喻与本体性定义,避免语义漂移。 第三,“词”具有强语义锚定效应,易使公众误解Token仅涉及文本,而忽略其图像、语音等多模态应用,增加长期解释成本。 第四,“词元”在语言学中已对应“Lemma”(词的原形),造成一词多义冲突,违背术语单义性原则。 第五,从信息论和计算理论看,Token本质是符号层的离散单元,而非语义层的语言单位。“符元”更贴合其计算本体。 第六,“词元”回译英文时易歧义(如对应word unit或morpheme),而“符元”可稳定对应“symbolic unit”,保障国际学术交流的清晰性。 最后,术语统一应基于“概念同构”而非“语言同形”。“词元”与“嵌入”“注意力”等机制性术语并列时,会造成结构层级混乱。 综上,术语选择关乎AI领域的认知基石。“符元”更符合Token的符号本质,具备跨模态稳定性和回译一致性,利于构建长期自洽的概念体系。

marsbit04/10 10:43

从“词元”到“符元”:Token 中文名背后的 AI 底层认知之争

marsbit04/10 10:43

活动图片