今日观察者

天才杨植麟:从清华学霸到科技创业者的成长之路

来源:今日观察者 科技

天才杨植麟:从清华学霸到科技创业者的成长之路

中国大模型,夺回定价话语权。

作者:孙欣

来源:中国企业家杂志

7月16日晚9点,距WAIC(世界人工智能大会)开幕尚不足24小时,月之暗面(Kimi)突然抛出重磅炸弹——发布Kimi K3,瞬间抢尽风头。

K3最引人注目的标签,是高达2.8万亿的参数规模。作为全球首款万亿级开源大模型,它支持100万Token的上下文窗口,在多项主流评测中,成绩超越了GPT-5.6与Fable 5。

不少AI一线从业者评价:在全模态、长上下文及复杂任务场景下,Kimi K3在国内处于断层式领先。

配套的定价策略同样引发热议。Kimi K3未缓存输入价为20元/百万Token,输出为100元/百万Token,位列国产模型第一梯队——比DeepSeek V4 Pro贵出20倍;而这一价格仅为海外模型Fable 5的30%、GPT-5.6 Sol的60%。

高盛在研报中定性:“这标志着中国模型迈向拥有定价权的全新节点。”

“Impressive(令人印象深刻)。”马斯克在X平台为K3点赞。随后,他在预热Grok 4.5时喊话:“有望超过Kimi。”对此,月之暗面联合企业业务负责人黄震昕于7月21日对媒体坦然回应:“拭目以待,希望他们跟我们掰一掰手腕。”

K3引发的震荡,剧烈搅动着资本市场。

7月17日,英伟达、谷歌、Meta、英特尔四家科技巨头股价走低。美国媒体报道称,虽非单一因素所致,但K3无疑是一味关键的催化剂。

港股方面,K3发布次日,智谱单日大跌28.49%,MiniMax下跌15.62%;华创证券研报指出,尽管当日港股指数低迷,但K3的发布仍是导致智谱和MiniMax股价调整的重要原因。

K3在海外的震动,也将杨植麟推至舆论风口浪尖。

他在清华申请特等奖学金的答辩视频、在卡内基梅隆大学(CMU)攻读博士期间的论文,相继刷屏网络。

一位硅谷风投合伙人在X上发出热度高达千万的质问:为何这样的人才毕业后未留美?这也引得杨植麟在CMU的导师、苹果首任AI总监Russ Salakhutdinov“下场”维护爱徒。

近日,记者联系到Russ教授。他表示:杨植麟表现卓越,不到4年便完成博士学位,这在CMU极为罕见。

“植麟是CMU最顶尖的学生之一,既能思考研究问题,又具备极强的技术能力,还能做底层编程——通常这些能力是分开的,很少见到如此融合的学生。”

Russ称,杨植麟博士期间的研究工作非常杰出,完成了大量基础性的机器学习工作,其关于XLNet(一种广义自回归预训练模型)、Transformer-XL(一种超长上下文语言模型)方向的论文,已成为AI模型的理论基石之一。

毕业之际,众多公司向杨植麟抛出橄榄枝。Russ回忆,他可以轻松留在美国去MIT、普林斯顿任教,但他第一时间坚持回国创业。“对于植麟这样水准的人来说,典型路径是走学术生涯,创业是高风险的事,但他在商业和研究能力上都十分出色。”

虽然Kimi K3的实力获行业认可,但昂贵的调用价格也掀起不小争议。

“贵的原因在于Token消耗高,Agent长任务的结构性成本高。”AI系统研发工程师李佳龙说。AI英语训练产品公司TalkMe创始人贾子健举例:“粗略估算,部署DeepSeek V4 Pro约需8张H100或A100显卡,用同样逻辑运行K3则需20张H100。”

对此,黄震昕回应:“开源模型、中国大模型不该被贴上低价标签,我们做出了SOTA级模型,也该匹配合理的商业定价。”

庞大的参数,也拖慢了K3的运行与交付速度。李佳龙表示:处理复杂任务时,一个完整的编程任务可能耗时超30分钟。贾子健也有同感:“作为C端产品,用户等不了那么久,我们需要兼顾能力和速度。”

他表示,杨植麟曾提及想研究“无限上下文”(infinite context)模型。“目前Kimi上下文长度在100万量级,未来也许他会赋予模型真正无限长的上下文。”

Kimi K3的发布,直接推升了月之暗面在资本市场的价值。7月22日,媒体报道:月之暗面计划于8月启动上市前最后一轮融资,目标投前估值高达500亿美元(约合3380亿元人民币),最快6个月内登陆港股。

这里插播一条课程资讯:

报名「黑马 AI 时代资本战略精品课」,8月14日-16日,卫哲、朱啸虎、吴世春、冯卫东等一线顶级投资人亲临授课,搭配FA专业辅导+黑马投资联盟资源加持,手把手帮你优化融资BP、打磨商业路演,精准传递企业核心资本价值,高效链接多家头部投资机构。

早鸟特惠报名中,欢迎优质创始人同行交流报名。

扫码咨询报名

(翻到底部了解详情)

01

为长程复杂任务而生

K3发布主要提升了哪些能力?大模型应用开发工程师彭明亮将其概括为:最大的体验在于把对话式AI进一步推向项目式AI。

Russ则盛赞:基本与Anthropic、OpenAI的模型处于同一水平。特别是模型开源,将深刻改变整个AI格局,“这让K3极具独特性,极具价值”。

工程师李佳龙通过测试发现,K3前端比GPT-5.6 Sol强10%~15%,“返工率更低,审美更高”。在实际Web开发场景中,Kimi K3生成代码的一次通过率高于OpenAI对应模型,这意味着Coding能力大幅提升。“K3堆参数量的路径确实跑通了。”

多模态方面,Kimi K3取得极大提升,其在BrowseComp基准测试中以91.2%的成绩拿下SOTA,不仅能理解跨模态复杂指令,更将文本、图像、代码整合为可交付的前端产品。

贾子健形容:“K3将国产大模型前端能力拉到了很高水平,生成的网页几乎可以直接上线,视觉完成度远超其他模型。”

在使用体验中,彭明亮总结了K3提升的三个具体能力:任务持续性更强,百万Token的上下文窗口足以装下整个代码库,模型可在一次会话中完成跨文件的工程级修改;前端和视觉交付能力突出;并行Agent子集群能力大幅提升。

这三个维度也对应了杨植麟曾公开提到的Kimi三个发力点:Token效率、长上下文、Agent集群。

技术层面上,K3此次两大核心支撑来自自创的KDA混合线性注意力机制(Kimi Delta Attention),以及注意力残差架构(Attention Residuals)。

简单来说,Kimi可在任务关键节点采用全注意力计算以保证精度,在非关键路径上切换为线性注意力以降低推理成本。Kimi官方数据显示,其百万上下文解码最高快了6.3倍,训练效率提升约25%、额外成本不到2%。

基于此,K3本质上服务于三类场景——长程编程、端到端知识工作和深度推理。

从2025年7月发布K2到一年后上线K3,Kimi已迭代6次。其中4次关键技术迭代中,K2解决了“大”的问题,K2.5解决了“多模态”的问题,K2.6和K2.7 Code解决了“编程特化”的问题——K3则将所有这些能力整合到一个足够长、足够复杂的任务连续体中。

每一次版本升级时,Kimi始终都在回答一个问题:模型能否在更长的任务链条中维持稳定的推理能力。

黄震昕对K3的技术路线做了明确界定:“K3的性能跃升来自于底层原创架构创新,并非蒸馏小模型。”同时,他也强调,Kimi坚持的开源路线不会改变:“核心底层技术和论文均对外公开。”

Kimi K3发布后,OpenAI未来战略主管迪恩·鲍尔在X上发表言论,称开源是“减速主义”,会削弱商业AI公司的投资回报,进而“阻碍整个行业所需的巨额资本投入”。而Russ则力挺“爱徒”的开源策略,认为Kimi开源了不起,且至关重要。

“开放权重、开源永远是更难的那条路——因为你的竞争对手可以拿走模型,研究它、分析它,用它生成数据,再去训练他们自己的模型。这是把优势让给了竞争对手。”Russ说。

但开源给更多用户打开了方便之门。“当前模型贵,主要因为模型大。但K3开源,很多人会对其做蒸馏优化。模型开源后,当用户数据逐渐填充,很多人会把它蒸馏成更小的模型。”Russ说。

他表示:目前许多实验室都会先训练一个大模型,再基于大模型的输出,训练小模型——让小模型尽量追平大模型,同时变得更高效。基于此,他认为后续K3的Token消耗也将大幅降低。

02

“天才”杨植麟

技术与商业的双重底色

Kimi K3的成功,也让外界更加好奇杨植麟的天赋根源和成长轨迹。

“Brilliant,hardworking,humble。”在采访Russ时,他对“用三个词来形容杨植麟”思索良久,表示很难用只言片语概括,最终他给出了上述形容——才华横溢,极其勤奋,谦逊。

杨植麟本硕毕业于清华,后在CMU计算机学院的LTI(语言技术研究所)系读博。作为卡内基梅隆大学机器学习系的资深教授,Russ带过数十名博士生,其中不乏后来在Google Brain、OpenAI和DeepMind担任核心角色的人物。但杨植麟给他留下的印象仍然极不寻常。

“他非常有技术追求,有自己的想法,自主性、执行力非常强。植麟的研究基本上是他自己提出想法,和我讨论后便迅速落实推进。”Russ提到,读博期间,杨植麟一直对自然语言处理(NLP)充满热情,热衷于思考如何构建具有泛化能力、擅长理解语言、生成语言的系统和模型。

“他有很大的抱负,总是去做那些最艰难的事情。”

Russ透露,杨植麟读博期间曾在Google Brain(谷歌大脑)实习,“他做的工作基本上都是在优化TPU(谷歌为机器学习定制的专用AI芯片)”,这是极少数博士生能参与的底层系统工作。

做出类似评价的不止一人,智谱创始人唐杰是杨植麟清华本科期间的老师。他们既是师生,如今也是商场上的对手。

“毫无疑问,杨植麟是我这几年见过最优秀、最有天赋的学生。”杨植麟申请清华特等奖学金的答辩会上,唐杰作为推荐导师如是评价。

在清华求学期间,杨植麟90%的专业课成绩在95分以上,所有编程类课程均为满分,年级排名第一。大二上学期,他加入唐杰的实验室,很快成为实验室核心,提出了一系列优化算法,使计算性能提升了数十倍,被腾讯、新浪、华为等多家公司采用。

大三,杨植麟基于大数据的癌症预测,入选斯坦福大学的本科生访问学者项目。在一次全球癌症预测大赛中,杨植麟提出的基于蛋白质通道的算法击败了来自斯坦福、哥伦比亚等高等研究机构的队伍。截至2025年7月,杨植麟在Google Scholar的论文引用量已超2万次。

在被公认为天才的背面,商业能力是杨植麟不为人知的标签。

“跟斯坦福大学、密歇根大学、麻省理工学院的教授进行讨论,杨植麟非常自如。”那时,杨植麟只有20岁,但唐杰认为在与人交流中,他已经展现出了极强能力。杨植麟也并非“书呆子”,他在清华便组建了乐队,担任鼓手和主要的词曲作者,在学校里拥有大量粉丝。

“他的独特之处在于非常懂技术,是出色的研究者,同时也是优秀的商人,你很难找到一个同时具备这些特质的人。”Russ说。从CMU毕业时,杨植麟向Russ提出了回国愿望。“我想创业,如果我连试都不试一下,我会后悔的。”

在硅谷的圈子里,Russ见过太多技术天才在商场上折戟,也见过太多CEO对技术一无所知,“而植麟能把技术和商业两者完美结合在一起”。

技术领军能力与商业节奏把控,也让月之暗面在激烈的人才大战中,得以保持领先身位。“当CEO是一个非常懂技术的人时,员工会信任他、敬重他。”Russ说。

一名月之暗面前员工曾说,“杨植麟身上有着独特的号召力,引进人才都是从学校的实验室里‘整锅端’。”

03

国产AI拿回定价权

性能登顶的同时,Kimi K3的定价策略也掀起巨大讨论——其价格约为DeepSeek V4 Pro的20倍、智谱GLM-5.2的5倍、Qwen 3.8的4倍。

“用K3不到两天,199元套餐的额度消耗殆尽,朋友开了699会员套餐的额度也很快烧光。”一位AI开发工程师说道。

上线48小时后,Kimi承认“用户对K3的需求逼近当前GPU容量的极限”。为优先保障付费用户的使用体验,Kimi紧急重构了会员体系,拆分出两条独立付费产品线:一类适用于Kimi Web、App、Work的会员;一类是Kimi Code会员,适用于编码工作流。

黄震昕在采访中坦言:Kimi正面临两难选择。放开全部新用户注册,会严重损害存量付费老用户使用体验;优先保障付费客户,则需临时限制新用户注册。“公司最终宁可暂时放弃新增收入,也要守住付费客户的使用体验底线。”

来源:官网截图

贾子健作为企业端调用者认为,“合适模型做合适的事。Kimi是一个需要约20张H100才能跑起来的模型,在长程复杂任务中性价比优越。但不是所有任务都值得支付20倍的溢价。”

而在彭明亮看来,Kimi K3的涨价释放了新信号:模型竞争已经从“低价竞争”转向“能力定价”,而价格在算力有限时,可以承担流量调节的作用。

“评价成本应比较‘完成一个任务的总成本’,而非只看单价。K3完成复杂编程任务所需的轮次更少、返工率更低,综合成本未必更高。”

业内人士则表示:Kimi K3的涨价,意味着其野心已经投向全球竞争。虽然与国内大模型相比不具性价比优势,但其价格约为Fable 5的30%、GPT-5.6 Sol的60%,对海外用户更具竞争力。

商业化层面,黄震昕透露:Kimi对标海外头部AI企业,暂不提供私有化部署服务,核心发力打磨模型基础能力,公司现阶段收入结构中API业务占比最高。

提及未来,Russ预判:“Kimi会和其他实验室一样,做类似GPT的分层模型体系:一个大模型、一个中模型、一个小模型。如果大众需要更高的效率,就跑小模型。拥有前沿水平的基础模型后,做高效化运营是容易的。”

黄震昕则表示:Kimi的参数规模还会持续向上拓展,不会止步于2.8万亿。“如果行业沿着当前路径继续演进,今天关于价格和Token消耗的所有争论,都只是一个更大故事的开场。”

*免责声明:本文章为作者独立观点,不代表i黑马立场。

相关推荐

最新文章