清华特奖获得者顾煜贤,加入DeepSeek

marsbit发布于2026-07-06更新于2026-07-06

文章摘要

近日,DeepSeek正大规模招聘,同时其V4正式版将于本月中旬上线。在该版本的论文作者列表中,出现了清华大学2021级博士生、2025年研究生特等奖学金获得者顾煜贤的名字。据悉,顾煜贤已正式加入DeepSeek。 顾煜贤师从黄民烈教授,研究方向聚焦于提升大语言模型全生命周期的效率,主要涵盖预训练数据筛选、模型压缩中的知识蒸馏以及高效模型架构三个方向。其代表性工作包括PDS、MiniLLM和Jet-Nemotron等。其中,MiniLLM是一种知识蒸馏方法,已被谷歌、阿里等公司采用;Jet-Nemotron是一种高效混合架构模型,在性能媲美主流大模型的同时实现了显著的生成加速。 顾煜贤的论文引用量已近5000,并多次在NeurIPS、ICLR等顶会发表论文。他的加入将为DeepSeek带来其在算法效率与模型优化方面的深厚专长。

最近,DeepSeek 开启了疯狂招人,岗位涉及算法、研发、产品、运维、数据工程师以及职能等多个部门。

与此同时,DeepSeek V4 正式版将于本月中旬上线。在此前的 DeepSeek V4 论文作者列表中,我们发现了清华大学 2021 级博士生、2025 年研究生特等奖学金获得者顾煜贤(Yuxian Gu)的名字

就我们所知,顾煜贤已经正式加入了 DeepSeek

顾煜贤还曾获得 2025 年度苹果博士奖学金以及蚂蚁 In-Tech 奖学金。

「硬件资源受限时,算法创新就成为突破计算瓶颈的关键。」清华人顾煜贤表示。他是清华大学计算机系毕业年级博士生,本科同样毕业于清华大学。

个人主页显示,顾煜贤在清华大学交互式人工智能课题组(Conversational AI, CoAI)学习,师从黄民烈教授。

个人主页地址:https://t1101675.github.io/

他的研究主要关注如何在大语言模型的全生命周期中提升效率,覆盖预训练、下游适配和推理等关键阶段,最近主要从三个方向展开相关研究:

预训练数据筛选:致力于构建理论和算法,优化大语言模型训练中的数据选择过程,从而训练出更强大、更高效的模型。代表性工作包括 PDS、Instruction Pre-training 和 Learning Law。

模型压缩中的知识蒸馏:设计新的方法,将大模型的知识有效迁移到更小、更易部署的模型中。该方向的代表性成果包括 MiniLLM 和 MiniPLM。

高效模型架构:探索并设计新的模型架构,在降低计算成本的同时提升模型性能,相关工作包括 Jet-Nemotron。

在 Google Scholar 主页,顾煜贤的论文引用量已近 5000,超过 1000 的论文有两篇,分别是《Pre-trained models: Past, present and future》和《MiniLLM: Knowledge distillation of large language models》。

顾煜贤作为一作,多次在 NeurIPS、ICLR、ACL 等国际 AI 学术顶会上发表论文。

机器之心在去年报道过「Jet-Nemotron」,一种全新的混合架构语言模型新系列,在达到 SOTA 全注意力模型精度的同时,还具备卓越的效率。

Jet-Nemotron 的核心创新主要体现在以下两点:

后神经架构搜索 (Post Neural Architecture Search,PostNAS):一种高效的后训练架构探索与自适应 pipeline,可适用于任意预训练的 Transformer 模型。

JetBlock:一种新型的线性注意力模块,其性能显著优于 Mamba2 等先前的设计。

论文地址:https://arxiv.org/pdf/2508.15884

当时,2B 版本的 Jet-Nemotron 性能就能赶超 Qwen3、Qwen2.5、Gemma3 和 Llama3.2 等最 SOTA 开源全注意力语言模型,同时实现了显著的效率提升。在 H100 GPU 上,其生成吞吐量实现了高达 53.6 倍的加速(上下文长度为 256K,最大 batch size)。

在 MMLU 和 MMLU-Pro 基准上,Jet-Nemotron 的准确率也超过了一些 MoE 全注意力模型,如 DeepSeek-V3-Small 和 Moonlight,尽管这些模型的参数规模更大。

在更早的 2024 年,顾煜贤及其合作者提出了一种将大语言模型蒸馏为更小语言模型的知识蒸馏方法,首先利用反向 Kullback-Leibler 散度(KLD)替代标准知识蒸馏方法中的正向 KLD 目标,随后推导出一种有效的优化方法来学习这一目标。

他们将得到的学生模型命名为 「MiniLLM」。在指令跟随场景下的大量实验表明,相比基线方法,MiniLLM 能生成更精准的回答,整体质量更高,同时具有更低的曝光偏差、更好的校准能力,以及更强的长文本生成性能。

谷歌、阿里、英伟达等领先的开源社区和产业平台已采用这一方法。

论文地址:https://arxiv.org/pdf/2306.08543

我们也期待顾煜贤在人生的下一段「DeepSeek」中,带来更多新的成果。

本文来自微信公众号“机器之心”(ID:almosthuman2014),作者:关注AI人才的机器之心

相关问答

Q顾煜贤加入DeepSeek前,在清华大学取得了哪些主要荣誉?

A顾煜贤在清华大学取得了多项荣誉,他是清华大学2021级博士生、2025年清华大学研究生特等奖学金获得者,同时还曾获得2025年度苹果博士奖学金以及蚂蚁In-Tech奖学金。

Q顾煜贤在DeepSeek V4的研发中扮演了什么角色?

A顾煜贤的名字出现在DeepSeek V4的论文作者列表中,这表明他参与了该模型的研发工作。文章提到他“已经正式加入了DeepSeek”。

Q顾煜贤的研究主要关注哪个领域,并包含哪三个具体方向?

A顾煜贤的研究主要关注如何在大语言模型的全生命周期中提升效率。具体包含三个方向:预训练数据筛选、模型压缩中的知识蒸馏、高效模型架构。

Q文章中提到顾煜贤的哪项代表性工作被谷歌、阿里、英伟达等公司采用?

A文章中提到,顾煜贤及其合作者提出的知识蒸馏方法“MiniLLM”,已被谷歌、阿里、英伟达等领先的开源社区和产业平台采用。

Q顾煜贤参与研发的“Jet-Nemotron”模型在效率上有何突出表现?

A根据文章,2B版本的Jet-Nemotron模型在H100 GPU上,其生成吞吐量实现了高达53.6倍的加速(上下文长度为256K,最大batch size),同时在MMLU等基准测试上的准确率超过了一些参数规模更大的MoE模型。

你可能也喜欢

Hyperliquid旗下HYPE在熊市中表现优于市场,随着AQAv2即将上线

加密货币交易员Pentosh1指出,去中心化衍生品交易所Hyperliquid的原生代币$HYPE是“熊市中表现最好的资产”,其代币经济模型可能使其在下一个牛市周期中继续取得成功。该观点基于Hyperliquid的收入分配结构:平台永续合约和现货市场产生的几乎所有交易费用都用于在公开市场回购并销毁$HYPE代币,而非留存于国库。 自2024年11月以来,Hyperliquid已销毁约4.62亿枚$HYPE,价值约12.7亿美元,约99%的协议费用用于资助代币回购。该销毁计划的规模直接取决于Hyperliquid处理的交易量,该交易所估计处理了全行业40%-70%的去中心化永续合约交易量,累计交易量已达数万亿美元。 另一个关键催化剂是即将在6天后(8月26日)激活的AQAv2机制。该机制将把平台上超过50亿美元USDC储备所产生收益的大约90%,注入用于回购的代币基金。分析师估计,这可能在现有机制基础上,每年额外增加1.35亿至1.6亿美元的回购资金。 近期,$HYPE价格因美国前总统特朗普关于监管机构正努力使Hyperliquid“完全合规”进入美国的言论而出现20-25%的短期上涨,推动其市值达到约180亿美元。交易员认为,代币销毁机制已证明其能随交易活动规模有效运作,而不依赖于市场炒作周期。

cryptonews.ru5小时前

Hyperliquid旗下HYPE在熊市中表现优于市场,随着AQAv2即将上线

cryptonews.ru5小时前

交易

现货
活动图片