前途科技前途科技
  • 服务
  • 关于
  • AI
    • AI 大模型
    • 具身智能
    • 算力芯片
  • 科技
    • 智能终端
    • 软件·互联网
    • 汽车·出行
    • 科学前沿
  • 资源中心
    • 深度研究
      • AI 前沿
      • 教程
      • AI 知识库
      • 案例研究
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们
AI 前沿/09.15 · 00:00/5 MIN/编译自 思邈/0 阅读

7名博士生用几百个Agent从零训练7B大模型并全开源

北京中关村学院7名博士生仅用一个暑假,借助数百个AI智能体组成的自动化团队,从零训练出7B大模型ZGCM-1。团队现已全面开源各阶段数据配方、训练代码、日志与中间Checkpoint,完整展示了“AI造AI”的工程实践路径。

北京中关村学院的7名博士生,利用一个暑假的时间,从零开始训练出了一个7B参数规模的大语言模型——ZGCM-1。

随后,团队将各阶段的训练数据、配方、模型权重、训练代码、中间Checkpoint以及训练日志全部开源,便于研究者追溯与复现完整训练链路。

评测数据显示,ZGCM-1在多项通用基准中与Qwen3-8B等同体量模型性能相当;在部分数学推理和检索任务上,亦能比肩更大规模的模型。而在大厂通常需要数百人团队协作的训练工程背后,这支7人小团队靠的是调度数百个AI智能体(Agent)协同推进,实践了“AI4AI”的研发范式。

ZGCM-1模型能力概览及主要技术路线

从一顿火锅到从零预训练

这7名学生背景涵盖人工智能、网络、化学、生物和网络安全。以往他们多基于开源模型做微调,但在阅读诸多技术报告后,数据清洗的具体标准、训练异动如何定位等工程细节仍充满疑问。吃火锅时的一次讨论催生了一个想法:既然读报告弄不懂,不如从头训练一个模型走通全程。

在导师给予算力支持后,团队先快速复现小模型验证了可行性,随后正式开启7B模型的预训练。面对复杂的工程挑战,团队让Agent从底层原理切入进行调研与讲解,再结合具体代码和实验进行闭环验证。

几百个Agent分工协作的工程体系

预训练涉及万亿级Token的筛选、清洗、去重与格式校验,工作量远超7个人的承载上限。为此,团队搭建了由数百个Agent组成的人工智能协同队伍,分为数据、实验与评测等子团队,并依托自研的ZGent平台搭建类似论坛的任务分派与追踪系统。

人类研究员负责设立目标、定义约束与关键决策,Agent则负责承接具体执行:

  • 数据清洗:Agent根据质量指标编写清洗脚本,自动分析数据分布并迭代过滤规则。
  • 实验监控:具备从任务提交、日志监测到故障定位、配置调整的全流程能力,并能主动优化训练框架的I/O瓶颈。
  • 经验复用:团队将技术决策、排错记录与脚本沉淀为可复用的Skill,使新接入的Agent能够继承已有经验。

人与Agent共同参与研发

模型完工后,团队按照L1至L5的自主性标准对研发任务进行了量化评估:实验监控与部署已达到L4自主性,Agent可在给定边界内自主规划和纠偏;但在模型架构和学习算法设计上仍处于L2,核心架构方向仍需人类主导。

AI研发自主性的五个等级

不同研发任务中的AI自主性评级

踩坑排障与微观能力评测

即使有Agent协助,模型训练依然充满工程不确定性。在一次训练中,Loss持续下降但模型能力却出现倒退。排查后发现,问题出在底层数据分片与Shuffle环节,导致实际数据配比发生偏移。

吸取教训后,团队建立了ACE原子能力评测体系,将模型能力拆解为18类、183个子项,设计了2503个探针。在分布式评测系统支持下,几分钟内即可完成一次体检,确保权重变动带来的能力涨跌清晰可循。

ACE原子能力评测结果

架构优化与算力效率提升

为了在有限算力下支撑长推理与多轮工具调用,团队在架构上采用了局部注意力与全局注意力结合的方案,将上下文窗口从16K逐步扩展至256K。在256K上下文下,吞吐量相比全注意力方案提升约3.94倍,KV Cache占用降至原本的六分之一。

注意力方案的效率对比

团队还结合了Muon优化器与FP8低精度训练,并利用延迟缩放等技术抑制极端激活值以保障稳定性。在16K预训练达到相同Loss的前提下,整体效率相比标准BF16/AdamW基线提升约4.2倍。

在SFT阶段,团队发现更严苛的数据筛选使样本减少约44.9%,整体性能反而提升;长思维链数据占比过高会导致指令遵循变差,Agent数据也不能脱离通用语料孤立训练。

SFT数据处理流程

全流程开源与更大模型探索

在14项推理评测中,ZGCM-1在同规模开源模型中保持着极具竞争力的表现。

ZGCM-1与同规模模型在14项推理评测中的排名对比

团队决定将中间Checkpoint、日志、配方与代码一同公开,旨在为开源社区提供一份可追溯、可复现的完整大模型训练工程记录。目前,该团队已着手探索数百B级别模型的训练,继续验证多Agent协作在超大规模训练场景下的扩展边界。

开源资源索引:

  • ZGCM-1 技术报告
标签:开源大语言模型AI 智能体模型训练

想了解 AI 如何助力您的企业?

免费获取企业 AI 成熟度诊断报告,发现转型机会

置顶文章

混沌工程从支付带到 AI Agent:三个假设需要改写,四条纪律可以直接抄
置顶

混沌工程从支付带到 AI Agent:三个假设需要改写,四条纪律可以直接抄

拆解快手柯南 AI:Claude Agent SDK 之上的四条稳定性硬约束
置顶

拆解快手柯南 AI:Claude Agent SDK 之上的四条稳定性硬约束

前途科技前途科技
服务关于快讯技术商业报告
前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款
训练与数据处理代码仓库
  • Hugging Face 模型权重
  • Hugging Face 训练数据集
  • 用 Gradio Workflow 重建 AUTOMATIC1111:73 节点工程化答案
    置顶

    用 Gradio Workflow 重建 AUTOMATIC1111:73 节点工程化答案

    //

    24小时热榜

    Anthropic CEO呼吁放缓AI研发,中方批其套用“冷战剧本”
    TOP1

    Anthropic CEO呼吁放缓AI研发,中方批其套用“冷战剧本”

    Anthropic:应通过立法强制推行AI“紧急开关”
    TOP2

    Anthropic:应通过立法强制推行AI“紧急开关”

    3

    混沌工程从支付带到 AI Agent:三个假设需要改写,四条纪律可以直接抄

    2小时前
    混沌工程从支付带到 AI Agent:三个假设需要改写,四条纪律可以直接抄
    4

    MIT用GPT-5.6 Sol实现量子芯片自动校准

    5小时前
    MIT用GPT-5.6 Sol实现量子芯片自动校准
    5

    OpenAI发布Agents API:一次调用搞定云端智能体

    5小时前
    OpenAI发布Agents API:一次调用搞定云端智能体
    6

    智谱天猫开店卖Token,大模型加速驶入消费级货架

    12小时前
    智谱天猫开店卖Token,大模型加速驶入消费级货架
    7

    大模型下半场较量:Anthropic、DeepSeek与智谱囤粮备战

    12小时前
    大模型下半场较量:Anthropic、DeepSeek与智谱囤粮备战
    8

    高瓴创投90后合伙人严文韬或将出任DeepSeek CFO

    12小时前
    高瓴创投90后合伙人严文韬或将出任DeepSeek CFO
    热门标签
    大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

    关注公众号

    前途科技微信公众号

    扫码关注,获取最新 AI 资讯

    免费获取 AI 落地指南

    3 步完成企业诊断,获取专属转型建议

    已有 200+ 企业完成诊断