2026年3月,还在读高中的陈广宇,与月之暗面 Kimi 团队研究员张宇、苏剑林并列为《Attention Residuals》论文的共同第一作者。这项技术能把大模型训练效率提升25%,是 Kimi K3 模型的核心支撑技术之一。相关成果让马斯克两次赞叹:“Impressive。”

这距离陈广宇接触大模型短短一年多,他到底走过了怎样一条非典型成长路线?

陈广宇的非典型成长路线概览

中学阶段:尝试电商、组织开源社区、参加算法竞赛。

2025年2月:参加中学生黑客松,结识导师,开始转向前沿技术。

2025年3月:借助 Gemini 读论文、自学机器学习。

2025年5月:分享技术博客,被 Tilde Research CEO 邀请去硅谷实习。

2025年7月:赴硅谷实习七周,参与真实的 AI 研发项目。

2025年11月:加入 Kimi 团队,在内部黑客松中获得冠军。

2026年3月:以共同第一作者身份发表《Attention Residuals》

2026年6月:高中毕业,目前仍在 Kimi 团队从事机器学习研究

如果这条成长路线打破了你的认知,不用惊讶:传统观念中的“非典型”,正在成为 AI 时代的”新典型“。以下沿着时间线,详细描述。

中学阶段

• 陈广宇出生于2009年,曾就读于贝赛思国际学校。

• 早期探索比较“非典型”:

◦ 尝试用家长身份注册 Shopify 店铺。

◦ 组织青少年开源社区。

◦ 参加 USACO(美国信奥赛)铂金组。

• 不是单纯学科型选手,而是偏向开源和商业尝试。

注|Shopify 是帮助商家搭建和经营网店的平台。

注|USACO 是美国信息学奥林匹克竞赛,铂金组是最高竞赛组别。

2025年2月:Moonshot 48 中学生黑客松

这是关键转折点。

• 就读学校:贝赛思国际学校(惠州),高中在读。

• 赛事名称:Moonshot 48黑客松。

• 主办方:北京探月学校。

• 时间:2025年2月28日—3月2日,48小时极限创造。

• 面向:13—17岁中学生,免费。

• 主题:AI for Good。

• 陈广宇展示项目:“ThirdArm” / 第三只机械辅助手。

• 他在这场活动上结识了评委 董科含。

注|黑客松,也称“黑客马拉松”,通常要求参与者在限定时间内组队构思、开发并展示作品。此次 Moonshot 48 黑客松是由北京探月学校主办。

注 | 北京探月学校,是一所覆盖小学、初中和高中的民办学校,强调自主学习、跨学科探索与真实项目实践。学校主办的 Moonshot 48 中学生黑客松,鼓励青少年在48小时内将创意做成可以展示的作品。主题为“AI for Good”,即用 AI 创造社会价值

人物小注|董科含曾任奇绩创坛投资与运营负责人。奇绩创坛(MiraclePlus)是由陆奇创办、支持早期科技创业的投资与创业加速机构,为团队提供资金、辅导和资源对接。

人物小注|陆奇,奇绩创坛创始人,卡内基梅隆大学计算机科学博士,曾任雅虎执行副总裁、微软执行副总裁,以及百度集团总裁兼首席运营官。详见奇绩创坛官方团队介绍。

在 Moonshot 48 上,董科含给陈广宇的建议是:把注意力转向更前沿的技术方向。这成为陈广宇后续转向 AI/ML 的重要推力。

2025年3月:用 Gemini 自学机器学习

• 他开始用非常规方式入门 ML:

◦ 每天把论文上传给 Gemini。

◦ 通过向 Gemini 提问来学习。

• 体现了他在好奇心驱动下,利用AI 工具的自学方式。

注|Gemini 是谷歌推出的 AI 助手,可辅助阅读论文、解释概念和分析代码。陈广宇通过上传论文、持续提问,把它作为自学机器学习的辅助工具。

注 | ML: 机器学习的简称,研究如何让计算机从数据中学习规律。

2025年5月:DeltaNet 技术博客破圈

• 他在社交平台X(Twitter)分享了一篇关于DeltaNet 的技术博客。

• 获得该领域关键贡献者 杨松琳 的回复。

• 杨松琳的回复让这篇技术分享获得更多关注,引起美国 AI 初创公司 Tilde Research CEO 的注意

• Tilde Research CEO 主动联系陈广宇,并最终提供了去硅谷的实习机会。

这是第二个关键节点:公开分享技术内容,直接带来前沿圈子的人脉和机会。

注|DeltaNet 是高效序列建模领域的一种模型架构。可以将这类研究理解为:探索让模型处理序列信息时更高效的方法。

注 | 杨松琳:当时在麻省理工学院(MIT)攻读博士,主要研究线性注意力与高效大模型架构,是 DeltaNet 相关研究的重要贡献者。简单说,她研究的是如何让大模型更高效地学习和处理信息。

注 | Tilde Research:美国 AI 初创公司,专注于大模型内部机制、模型架构与高效训练研究。

2025年7月:独自飞往硅谷实习

• 飞往美国加州 帕洛阿尔托。

• 在 Tilde Research 开始为期 七周 的实习。

• 参与项目:内存优化混合专家模型(MoMoE)。

• 除了技术,他还学到如何拓展公司规模等实际业务。

注|七周实习的前两周,他负责定义并推进了一个涉及144张 H100 显卡的探索性项目。实习期间,陈广宇参与了旨在降低显存占用、提高模型训练效率的 MoMoE 开源项目。

2025年11月:加入 Kimi

• 以 实习生身份 加入 月之暗面(Kimi)团队。

• 担任 机器学习研究员。

• 在 Kimi 内部 48小时黑客马拉松 中获得冠军。

• 作为 共同第一作者 完成 Kimi 核心论文《Attention Residuals》。

注|月之暗面(Moonshot AI)是 Kimi 背后的人工智能公司。它与前文由探月学校主办的 Moonshot 48 中学生黑客松是不同的主体。

注|《Attention Residuals》可译为“注意力残差”,于2026年3月16日首次提交至 arXiv。它探索用可学习的权重,改善模型不同层之间的信息汇集方式。“共同第一作者”表示多位作者被标注为作出同等重要贡献。陈广宇与月之暗面 Kimi 团队研究员张宇、苏剑林并列共同第一作者。研究分工可参见苏剑林的《Attention Residuals 回忆录》。

2026年6月

• 高中毕业。

• 目前仍在 Kimi 团队从事机器学习研究。

注 | 根据其个人主页,目前仍在 Kimi 团队从事机器学习研究。

以上资料来源:公开报道、活动与机构介绍、研究论文及作者回顾,相关链接见文中。

回看这条成长路线

核心是:不按部就班 、兴趣驱动,利用AI 自学,走进高质量的前沿赛事,公开分享自己的思考与成果,用实习和黑客松快速证明能力。

当然,这条路也离不开学校提供的实践场景、导师的指导,以及愿意给年轻人机会的团队,而这样的支持与机会,我们相信,在 AI 时代会越来越普遍。

能力,不必等到拿到文凭才被承认(更何况,目前绝大部分学历并不管用)。

换个角度看,时代已经提供了新的舞台,我们证明能力的方式,也该更新了。陈广宇的成长路径虽“非典型”,却体现了 AI 时代让能力被看见的典型方式:公开分享思考,参与开源项目,用 AI 把想法做成产品,在真实的问题中交出答案。

我们的思考

当一纸文凭不再是未来的保证,学历与能力的关系正在被重新审视,AI 时代,能力可以先于文凭被看见。

陈广宇的经历,是否可以让有教育焦虑的家长思考:当孩子的学习偏离熟悉的升学路线、兴趣超出我们的经验时,我们能否先更新自己的认知,再判断他的探索是否有价值?

我们看不懂的方向,未必没有前途;我们熟悉的路线,也未必通向未来。

我们也相信,当下一定有一群家长正密切关注AI技术正在怎样改变世界,同时也愿意带着孩子在实践中寻找未来属于他们的机会。

如果你是这样的家长相信你已经开始搜索 北京探月学校的黑客松是否也接受外省学生参赛了(对的,他们接受外省学生参赛,可以参考《三联生活周刊》对活动负责人及学生的采访)

如果你是这样的家长,如果你也在寻找这些答案,欢迎加入我们与我们一起分享前沿信息、交流实践经验、寻找适合孩子的机会。

17792219017

关于我们:

团队自2018年起深耕算法竞赛训练,8年教学实践经验,竞赛成绩断层领先。

2023年开始探索AI教育,2025年落地面向青少年的基于强化学习的自动驾驶实践项目。

2026年团队成员担任大学生AI智能体赛事评委,并已举办5期青少年黑客松,持续指导中小学生独立开发AI智能体应用,让他们学会借助AI自主学习以及不断拓展能力边界。

团队还自主搭建了OPC模拟经营平台:学生从一张商业地图出发,招募数字员工、配置与优化智能体Skills、组织AI员工协作,在模拟的市场竞争与现金流约束下开展经营,理解商业逻辑、检验经营决策。

我们相信,在AI时代,利用AI终身学习的能力以及借助AI OPC的商业能力才是立身之本。

联系我们

阅读量:—