前途科技前途科技
  • 服务
  • 关于
  • AI
    • AI 大模型
    • 具身智能
    • 算力芯片
  • 科技
    • 智能终端
    • 软件·互联网
    • 汽车·出行
    • 科学前沿
  • 资源中心
    • 深度研究
      • AI 前沿
      • 教程
      • AI 知识库
      • 案例研究
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们
洞察/09.24 · 09:43/4 MIN/编译自 雷锋网/0 阅读

算力救不了脏数据:国内大模型集体启动预训练返工

过去大半年,国内多家主流大模型厂商密集推倒重训,核心症结直指低质垃圾语料。粗放式堆砌参数和语料体量的阶段告终,在算力空转与性能倒挂的教训下,各家厂商不得不重回数据清洗与工程治理的原点补课。

过去大半年,国内一批大语言模型厂商密集启动了“预训练返工”。核心原因只有一个:数据出了严重问题。

有的团队死磕一年做万亿参数模型,落地表现却被参数仅其 1% 的海外小模型反超,排查后发现是被脏数据拖垮;有的团队遭遇标注规则模糊、评测集污染和语料严重冗余,导致模型性能停滞;还有厂商索性将模型推倒重来,重组数据工程团队。算力空转与性能倒挂的惨痛代价,让行业彻底体会到了数据的残酷法则。

粗放式堆量的代价

大模型启动返工,本质上是在为早期的粗放发展买单。

研发初期,行业普遍迷信“规模即一切”,认为数据量大即可,模型自带容错和鲁棒性。为了凑齐数千亿甚至上万亿 Token 的语料库,大量未经严格清洗的网页爬虫垃圾、采集站内容和来源不明的数据包被一股脑灌入管线。

底层脏数据的杀伤力远超预期。一家中部基模厂商曾将批量抓取的技术博客送入预训练,中途才发现大量内容来自 SEO 采集站的机器生成页,同一段文字被重复了数万次。模型很快在测试中陷入死循环复读,等团队排查定位完成,数万卡时的算力已经烧完,整套版本只能作废。

更致命的还有考核机制的错配。在部分大厂内部,数据团队的 KPI 往往被简化为“交付的数据体积”。这种只看数量、不顾质量的考核机制直接诱发了数据掺水。例如腾讯混元团队曾因标注规则不明确且验收门槛脱节,产出大批不可用数据,叠加测试集被污染,最终只能推翻重洗。对于大语言模型而言,信息密度和洁净度远重于绝对体积,低质语料只会让模型越训越钝。

互联网家底失效与预算错配

地基必须重打,但优质数据并不是大厂的天然存量。

社交、电商、搜索与本地生活等场景数据,在移动互联网时代曾是巨头坚固的护城河。然而在大模型时代,这类垂直数据很难直接转化为基模的通用推理能力。即便是拥有海量数据的 Google,在通用模型起步期也未能抢占绝对优势,反而是毫无历史资产包袱的 OpenAI 和 Anthropic 率先突围。大家在通用数据的起跑线上并没有实质差距。

数据治理成为大模型核心

现实中,数据优化几乎没有技术秘方,更多是漫长且枯燥的工程苦力活。卡住各家数据治理进程的,主要是预算偏见与产能瓶颈。

在模型训练的总成本中,算力往往占 40%,人才占 30%,市场营销占 20%,分给数据采集与治理的预算常常不足 10%。对于后训练所需的优质专家长程任务轨迹数据,海外机构单条采购成本可达上万美元,而国内开出的预算往往捉襟见肘。

优质供给严重短缺,倒逼部分厂商走起水下路线。一些团队通过搭建 API 转发中转站或模型路由平台,在承接调用需求的同时截留高阶交互轨迹。但这只能算作非常规的补充渠道,难以维系长期优势。

尚未转动的数据飞轮

行业常将“数据飞轮”视作大模型的终极壁垒:模型越强,吸引高难度任务越多,回流的数据越精细,反哺后模型性能进一步提升。但这一闭环目前国内几乎没有厂商真正跑通。

阻碍飞轮运转的核心堵点来自内部与外部的双重制约:

  1. 组织与人才短板:大厂内部各业务线之间的数据墙依然坚固,数据治理、清洗、工程管线研发等岗位长期处于边缘化地位,专业人才极度紧缺。
  2. 高价值内生场景匮乏:高质量的长程任务轨迹多来自 AI Coding 和高阶办公场景。前者大部分市场份额被海外模型占据,后者的产品复杂度目前仍处于初级阶段,沉淀下的交互记录十分单薄,难以支撑反哺模型的需求。

算力可以通过资本集中采购,顶尖算法人才也能通过挖角补齐,但高质量语料的治理与沉淀没有任何捷径。预训练返工只是第一轮阵痛,未来一两年内推倒重来的案例还会继续上演。谁能率先把用户交互到模型训练的数据工程通路彻底打通,谁才真正拿到了下半场的入场券。

标签:大语言模型预训练数据治理

想了解 AI 如何助力您的企业?

免费获取企业 AI 成熟度诊断报告,发现转型机会

置顶文章

解码快 3.13 倍,端到端只有 1.56 倍:VLM 投机解码的天花板
置顶

解码快 3.13 倍,端到端只有 1.56 倍:VLM 投机解码的天花板

把 MuJoCo 搬上 GPU:MJWarp 迁移的四道闸门与三种不报错的错误
置顶

把 MuJoCo 搬上 GPU:MJWarp 迁移的四道闸门与三种不报错的错误

前途科技前途科技
服务关于快讯技术商业报告
微信咨询二维码

咨询微信

扫码添加微信咨询

前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款
解码快 3 倍,端到端只快 1.5 倍:VLM 推测解码 DSpark 的账怎么算
置顶

解码快 3 倍,端到端只快 1.5 倍:VLM 推测解码 DSpark 的账怎么算

//

24小时热榜

SpaceX 16天内发射第三次美太空军机密任务
TOP1

SpaceX 16天内发射第三次美太空军机密任务

Anthropic旗下Claude自主发现类CRISPR新酶系统
TOP2

Anthropic旗下Claude自主发现类CRISPR新酶系统

3

TikTok与阿拉巴马州就青少年成瘾指控达成至少1亿美元和解

21小时前
TikTok与阿拉巴马州就青少年成瘾指控达成至少1亿美元和解
4

两项新研究证实土卫二具备探测生命迹象的潜力

21小时前
两项新研究证实土卫二具备探测生命迹象的潜力
5

波音737 MAX曝软件故障:降落时或致自动驾驶失效

21小时前
波音737 MAX曝软件故障:降落时或致自动驾驶失效
6

未经专属训练,GPT-6 Astra 成功控制真实汽车跑完全程

21小时前
未经专属训练,GPT-6 Astra 成功控制真实汽车跑完全程
7

OpenAI Academy 升级,新增开发者与企业管理学习路径

11小时前
OpenAI Academy 升级,新增开发者与企业管理学习路径
8

OpenAI 升级 GPT-6 提示词缓存:Token 成本最高省 90%

11小时前
OpenAI 升级 GPT-6 提示词缓存:Token 成本最高省 90%
热门标签
大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

关注公众号

前途科技微信公众号

扫码关注,获取最新 AI 资讯

免费获取 AI 落地指南

3 步完成企业诊断,获取专属转型建议

已有 200+ 企业完成诊断