北京中关村学院7名博士生仅用一个暑假,借助数百个AI智能体组成的自动化团队,从零训练出7B大模型ZGCM-1。团队现已全面开源各阶段数据配方、训练代码、日志与中间Checkpoint,完整展示了“AI造AI”的工程实践路径。
北京中关村学院的7名博士生,利用一个暑假的时间,从零开始训练出了一个7B参数规模的大语言模型——ZGCM-1。
随后,团队将各阶段的训练数据、配方、模型权重、训练代码、中间Checkpoint以及训练日志全部开源,便于研究者追溯与复现完整训练链路。
评测数据显示,ZGCM-1在多项通用基准中与Qwen3-8B等同体量模型性能相当;在部分数学推理和检索任务上,亦能比肩更大规模的模型。而在大厂通常需要数百人团队协作的训练工程背后,这支7人小团队靠的是调度数百个AI智能体(Agent)协同推进,实践了“AI4AI”的研发范式。

这7名学生背景涵盖人工智能、网络、化学、生物和网络安全。以往他们多基于开源模型做微调,但在阅读诸多技术报告后,数据清洗的具体标准、训练异动如何定位等工程细节仍充满疑问。吃火锅时的一次讨论催生了一个想法:既然读报告弄不懂,不如从头训练一个模型走通全程。
在导师给予算力支持后,团队先快速复现小模型验证了可行性,随后正式开启7B模型的预训练。面对复杂的工程挑战,团队让Agent从底层原理切入进行调研与讲解,再结合具体代码和实验进行闭环验证。
预训练涉及万亿级Token的筛选、清洗、去重与格式校验,工作量远超7个人的承载上限。为此,团队搭建了由数百个Agent组成的人工智能协同队伍,分为数据、实验与评测等子团队,并依托自研的ZGent平台搭建类似论坛的任务分派与追踪系统。
人类研究员负责设立目标、定义约束与关键决策,Agent则负责承接具体执行:

模型完工后,团队按照L1至L5的自主性标准对研发任务进行了量化评估:实验监控与部署已达到L4自主性,Agent可在给定边界内自主规划和纠偏;但在模型架构和学习算法设计上仍处于L2,核心架构方向仍需人类主导。


即使有Agent协助,模型训练依然充满工程不确定性。在一次训练中,Loss持续下降但模型能力却出现倒退。排查后发现,问题出在底层数据分片与Shuffle环节,导致实际数据配比发生偏移。
吸取教训后,团队建立了ACE原子能力评测体系,将模型能力拆解为18类、183个子项,设计了2503个探针。在分布式评测系统支持下,几分钟内即可完成一次体检,确保权重变动带来的能力涨跌清晰可循。

为了在有限算力下支撑长推理与多轮工具调用,团队在架构上采用了局部注意力与全局注意力结合的方案,将上下文窗口从16K逐步扩展至256K。在256K上下文下,吞吐量相比全注意力方案提升约3.94倍,KV Cache占用降至原本的六分之一。

团队还结合了Muon优化器与FP8低精度训练,并利用延迟缩放等技术抑制极端激活值以保障稳定性。在16K预训练达到相同Loss的前提下,整体效率相比标准BF16/AdamW基线提升约4.2倍。
在SFT阶段,团队发现更严苛的数据筛选使样本减少约44.9%,整体性能反而提升;长思维链数据占比过高会导致指令遵循变差,Agent数据也不能脱离通用语料孤立训练。

在14项推理评测中,ZGCM-1在同规模开源模型中保持着极具竞争力的表现。

团队决定将中间Checkpoint、日志、配方与代码一同公开,旨在为开源社区提供一份可追溯、可复现的完整大模型训练工程记录。目前,该团队已着手探索数百B级别模型的训练,继续验证多Agent协作在超大规模训练场景下的扩展边界。
开源资源索引:
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断