过去大半年,国内多家主流大模型厂商密集推倒重训,核心症结直指低质垃圾语料。粗放式堆砌参数和语料体量的阶段告终,在算力空转与性能倒挂的教训下,各家厂商不得不重回数据清洗与工程治理的原点补课。
过去大半年,国内一批大语言模型厂商密集启动了“预训练返工”。核心原因只有一个:数据出了严重问题。
有的团队死磕一年做万亿参数模型,落地表现却被参数仅其 1% 的海外小模型反超,排查后发现是被脏数据拖垮;有的团队遭遇标注规则模糊、评测集污染和语料严重冗余,导致模型性能停滞;还有厂商索性将模型推倒重来,重组数据工程团队。算力空转与性能倒挂的惨痛代价,让行业彻底体会到了数据的残酷法则。
大模型启动返工,本质上是在为早期的粗放发展买单。
研发初期,行业普遍迷信“规模即一切”,认为数据量大即可,模型自带容错和鲁棒性。为了凑齐数千亿甚至上万亿 Token 的语料库,大量未经严格清洗的网页爬虫垃圾、采集站内容和来源不明的数据包被一股脑灌入管线。
底层脏数据的杀伤力远超预期。一家中部基模厂商曾将批量抓取的技术博客送入预训练,中途才发现大量内容来自 SEO 采集站的机器生成页,同一段文字被重复了数万次。模型很快在测试中陷入死循环复读,等团队排查定位完成,数万卡时的算力已经烧完,整套版本只能作废。
更致命的还有考核机制的错配。在部分大厂内部,数据团队的 KPI 往往被简化为“交付的数据体积”。这种只看数量、不顾质量的考核机制直接诱发了数据掺水。例如腾讯混元团队曾因标注规则不明确且验收门槛脱节,产出大批不可用数据,叠加测试集被污染,最终只能推翻重洗。对于大语言模型而言,信息密度和洁净度远重于绝对体积,低质语料只会让模型越训越钝。
地基必须重打,但优质数据并不是大厂的天然存量。
社交、电商、搜索与本地生活等场景数据,在移动互联网时代曾是巨头坚固的护城河。然而在大模型时代,这类垂直数据很难直接转化为基模的通用推理能力。即便是拥有海量数据的 Google,在通用模型起步期也未能抢占绝对优势,反而是毫无历史资产包袱的 OpenAI 和 Anthropic 率先突围。大家在通用数据的起跑线上并没有实质差距。

现实中,数据优化几乎没有技术秘方,更多是漫长且枯燥的工程苦力活。卡住各家数据治理进程的,主要是预算偏见与产能瓶颈。
在模型训练的总成本中,算力往往占 40%,人才占 30%,市场营销占 20%,分给数据采集与治理的预算常常不足 10%。对于后训练所需的优质专家长程任务轨迹数据,海外机构单条采购成本可达上万美元,而国内开出的预算往往捉襟见肘。
优质供给严重短缺,倒逼部分厂商走起水下路线。一些团队通过搭建 API 转发中转站或模型路由平台,在承接调用需求的同时截留高阶交互轨迹。但这只能算作非常规的补充渠道,难以维系长期优势。
行业常将“数据飞轮”视作大模型的终极壁垒:模型越强,吸引高难度任务越多,回流的数据越精细,反哺后模型性能进一步提升。但这一闭环目前国内几乎没有厂商真正跑通。
阻碍飞轮运转的核心堵点来自内部与外部的双重制约:
算力可以通过资本集中采购,顶尖算法人才也能通过挖角补齐,但高质量语料的治理与沉淀没有任何捷径。预训练返工只是第一轮阵痛,未来一两年内推倒重来的案例还会继续上演。谁能率先把用户交互到模型训练的数据工程通路彻底打通,谁才真正拿到了下半场的入场券。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断