昊梵体育网

一个没有任何海外留学背景的四川南充人,拿着两万块钱的启动资金白手起步,硬是靠自己

一个没有任何海外留学背景的四川南充人,拿着两万块钱的启动资金白手起步,硬是靠自己成了清华大学计算机系副主任,还带头研发出了打破国外垄断的国产大模型ChatGLM。

很多人对顶尖AI科学家的固有印象,大多是海外名校镀金归来。可唐杰的求学道路,完完全全走的是国内体系,从本科读到博士,全部扎根在国内高校,没有出国拿过学位 。出身四川南充普通家庭,少年时代没有得天独厚的资源,能依靠的只有自己埋头苦读。博士毕业之后,不少海外机构、互联网大厂向他抛出高薪邀约,他却选择留在清华,一头扎进冷门的知识挖掘研究当中。

刚留校做科研,手里的启动经费少得可怜,仅有两万块,还是博士论文获奖拿到的奖金。没有充足预算,没有豪华算力集群,他带着少数几名学生,一点点啃海量学术文献,搭建AMiner学术挖掘平台。那时候AI行业的风口还没有到来,资本追捧的是电商、游戏,很少有人看好这份基础研究。整整十三年,他沉在实验室,反复调试算法,梳理全球千万级论文的关联网络,硬生生把一个简陋的校内项目打磨成全球知名的学术检索工具。

这份长年打磨大规模数据的实战经历,为后来做大模型埋下关键伏笔。之后他一步步成长,出任清华大学计算机系副主任,带领知识工程实验室,开始布局预训练大模型赛道。那个阶段,海外GPT系列模型牢牢掌握技术话语权,国内大多团队选择直接跟随海外现成框架做微调,很少有人敢从零搭建一套本土模型架构。

唐杰却做出不一样的判断,一味复刻国外路线,永远只能跟在别人身后。他带着团队另起炉灶,自研GLM通用语言模型架构。这条路太难走,没有现成参考,训练千亿参数模型,算力、数据、算法每一关都是坎。团队内部也出现分歧,有人觉得跟风成熟方案风险更小,从零自研失败代价太高。可唐杰顶住压力,坚持走自主架构路线,带着学生日夜泡在机房,反复调参、排查训练故障,熬过无数次训练崩溃重来的困境。

ChatGPT横空出世之后,国内大模型赛道瞬间沸腾,外界都在期待国产对标产品。唐杰团队加快迭代节奏,在GLM‑130B基座之上快速打磨,推出ChatGLM。这款模型一经开源,立刻震动国内AI圈,它证明国内完全可以不靠照搬海外体系,做出可用的对话大模型,实实在在打破国外大模型的技术垄断局面。

开源之后,ChatGLM迅速被大量企业、高校拿去二次开发,无数本土AI应用以此作为底座。但光鲜成果背后,压力从未消失。算力缺口、数据短板、外界的质疑接踵而至。不少人质疑,国内团队做不出真正的底层创新,只是简单模仿。唐杰没有过多争辩,依旧把重心放在实验室迭代,从GLM‑10B一路迭代到后续的GLM‑4、GLM‑5系列,持续缩小和海外顶尖模型之间的差距 。

我们也要客观看待这份成绩,ChatGLM的出现,不等于国内大模型已经全面超越海外。它更多代表我们跳出单纯复刻的路径,走出属于自己的技术路线。大模型的比拼是一场长跑,基座算法、算力芯片、高质量数据集,整套链条依旧存在不少短板,不是一款模型就可以抹平全部差距。

唐杰最值得思考的地方就在这里。没有海外名校光环,起步仅有两万块科研奖金,靠着长年深耕基础科研,硬生生站上AI前沿赛道。很多人总觉得顶尖科研必须依靠海外履历,可唐杰的经历恰恰说明,本土体系同样能够孕育出世界级的技术带头人。

科研从来不是一蹴而就的奇迹,ChatGLM的爆发,不是短短几个月的灵光一闪,是AMiner十几年大规模数据处理积累,再加上无数个日夜模型调试,才换来的结果。比起最终出圈的模型,更难得的是他敢于不盲从国外主流路线,坚持自主架构的那份定力。

今天国产AI还在追赶的路上,前路依旧布满挑战。但唐杰和团队的实战经历告诉我们,起点普通不代表上限注定受限,沉下心啃硬骨头,本土科研同样可以产出改变行业的成果。

各位读者你们怎么看?欢迎在评论区讨论。

信源:36氪智谱唐杰专题深度报道