《中国大模型简史》第一章回顾2021至2022:悟道把参数推到1.75万亿,盘古、文心思路各不相同,MiniMax在ChatGPT出现前就开始创业。模型越做越大,却没人知道它最终该变成什么。
2021年6月1日,智源大会上,清华教授唐杰发布悟道2.0,称它是「一个孩子」。悟道里最大的模型参数达1.75万亿,当时GPT-3为1750亿,Google Switch Transformer为1.6万亿。参数不等于智能,但AI研究已因此变成规模工程:训练不仅要算法,还要数据、算力、框架和跨机构协作。悟道准备了4.9TB中英文与图文数据,还专门开发了FastMoE训练MoE稀疏模型。

让中国研究者意识到这种变化的是GPT-3。清华NLP研究员刘知远回忆,此前实验室用一两张GPU做研究,仍觉得离国际前沿不远;GPT-3之后,算力差距被拉到另一个数量级。他去找智源院长黄铁军申请算力,很快获批。第一版CPM实际使用64张V100完成训练。

Transformer、BERT和Scaling Laws先后改变了领域共识,「把模型做大」成为方向。智源将高校与企业研究员组织起来,2020年10月启动悟道项目。
但大模型到底该变成什么,当时没有统一答案。智源理事长张宏江把大模型比作「发电厂」:数据作燃料,模型把数据转化为智能,再输送给应用。华为云AI首席科学家田奇则批评传统AI开发是「作坊式」,希望在盘古大模型上实现「工业化」。百度走「知识增强」路线,2019年的ERNIE 1.0会把完整短语和实体遮住让模型猜回来,2021年底又与鹏城实验室联合发布2600亿参数的ERNIE 3.0 Titan。


还有更早创业的人。2021年底,闫俊杰在北京向明势资本创始人黄明明讲Transformer和AGI。黄明明没完全听懂,但只看到一个「模模糊糊的未来」后仍决定投资。闫俊杰后来创办MiniMax。2022年10月,团队做出约300亿参数的模型,能力不够做通用助手,于是先做了角色聊天产品Glow——模型爱「编造」事实,在娱乐场景反而成了特色。
2022年,清华与智谱发布1300亿参数的GLM-130B,论文罕见地记录了训练中的loss spike和发散问题。模型权重、代码、日志全部开放,INT4量化后只需4张RTX 3090就能运行。

外部条件也在同年改变。8月,美国通知NVIDIA向中国出口A100及H100需获得许可;10月,美国商务部发布先进计算出口管制规则。NVIDIA随后为中国市场推出A800。11月30日,OpenAI把ChatGPT作为免费研究预览版上线。这个产品没有论文、没有参数解释,只有一个聊天框:输入文字,模型回答。

回头看,从悟道2.0到ChatGPT上线前的两年里,中国团队已经把模型做到千亿甚至万亿参数,却仍没有人能笃定回答:做出来之后,它究竟该变成什么?ChatGPT后来用最简单的聊天框给出了一种答案。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断