字节跳动 Seed 基础模型团队新设四个一级部门,将分散的预训练数据和强化学习能力集中,并把后训练团队按办公与对话场景拆分为 Work 和 Chat。调整背后是一套新的组织逻辑:不再按文本、代码、视觉各自为战,而是围绕数据、强化学习与产品任务重组。
大模型竞争开始比拼组织,这次轮到字节。
8 月 19 日,据晚点 LatePost 报道,字节跳动 Seed 基础模型团队新设 Pretrain Data(预训练数据)、Horizon RL(强化学习)、Product Posttrain-Work(面向办公场景的产品后训练)和 Product Posttrain-Chat(面向对话场景的产品后训练)四个一级部门,分别由李成刚、唐晟宇、秦禹嘉、朱文佳负责,均向吴永辉汇报。
据悉,四个新部门之下的分支架构与带队人选也已落定,而这些更细的调整,或许更能透露出此次组织变动背后的真实意图。
先看模型能力侧的两个部门。
Pretrain Data 由原先分散在文本、编程、视觉理解和语音方向的预训练数据团队合并而来,下设文本预训练(沈科)、代码预训练(Xia Xiao)、视觉预训练(林毅)和语音预训练四个分支,统一为 Omni 全模态模型和超大模型供给数据。
负责人李成刚曾从 0 到 1 搭建字节搜索系统,先后负责今日头条网页搜索和 TikTok 视频搜索的技术工作。其麾下沈科是超大模型预训练数据的核心人物;Xia Xiao 则是开源代码模型 Seed-Coder 的核心作者之一。
相比数据条线,Horizon RL 动作更大。它整合了分散在推理、视觉理解等方向的后训练团队,下设 RL Scaling(岳宇)、Reasoning(王明轩)和视觉强化学习(吴侑彬)三个分支,负责强化学习,提升模型的基础智能上限。
王明轩此前在火山翻译,北航本科、中科院计算所博士,曾在腾讯任高级研究员,多次拿下 WMT 机器翻译评测冠军;岳宇是字节与清华 AIR 联合开源的强化学习系统 DAPO 的算法作者之一。
Seed 此前公开过 DAPO、VAPO 等强化学习工作,并持续把 RL 用于更长链路的推理和 Agent 能力。把几个方向和负责人放在一起,Horizon RL 的意图就比较清楚了——它并不是简单把原来的后训练团队换个名字,而是把 Reasoning、视觉语言模型等不同方向中的 RL 能力进一步集中。
据晚点 LatePost 报道,Seed 在调整公告中称,此次调整旨在“合并相似工作、减少 overlap,内聚在一起”。
有接近字节的人士称,调整后,文本、代码、视觉这些老方向并没有消失,只是换了一种管法。以视觉为例:预训练数据归 Pretrain Data 的林毅,训练后的强化学习归 Horizon RL 的吴侑彬,两人互不隶属,但视觉的数据和强化学习本是一根链条,所以吴侑彬在视觉方向上还要同时向林毅汇报。
类似的安排还有:唐晟宇在执掌 Horizon RL 之外,同时管着代码预训练;此前主导多模态交互与世界模型的周畅,同时管着视觉预训练。
产品侧的两个部门,由原先统一的应用后训练团队按用户任务一分为二。
Product Posttrain-Work 服务 B 端,下设 GUI(吴志勇)和由原有 Agent 办公团队合并而来的分支,负责 Agentic 模型的整合与发布,针对办公场景优化模型的 Agentic 能力,包括支持豆包和 Dola 的任务模式。
负责人秦禹嘉是四个新部门负责人中的 90 后,师从清华教授刘知远,曾是面壁智能核心成员、开源工具学习引擎 BMTools 的作者,2024 年 7 月才通过“Top Seed”人才计划加入字节,是 GUI 智能体 UI-TARS 的第一作者,两年升至一级部门负责人。GUI 分支负责人吴志勇,公开信息显示其曾参与 OS-Atlas、SeeClick 等 GUI 智能体开源工作。
原本由朱文佳负责的 Application 团队继续保留,并更名为 Product Posttrain-Chat。它与新成立的 Product Posttrain-Work 分别面向 C 端对话和办公任务,下设豆包和 Dola Chat 分支,负责人严林同时吸收了吴双志的原班人马,主要优化搜索问答、对话体验、个性化和安全等能力,同时控制推理成本。
严林是中科院计算所硕士,豆包大语言模型 Alignment 团队负责人。有知情人士称,吴双志则转往火山引擎,负责火山 API 支持,向吴迪汇报——吴迪同时掌管字节机器学习中台和火山引擎算法团队。
一拆一合的逻辑很有意思:过去大模型产品更多按模型能力来分,比如语言、视觉、代码;现在则更多按用户要做什么来分。Chat 面向搜索、问答、对话等 C 端需求,Work 则面向办公场景和复杂任务,等于把 AI Coding 中已经积累的工具调用、电脑操作和复杂任务执行能力,进一步用到日常办公中。
从人员安排来看:Work 交给更熟悉 Agent 的年轻团队,Chat 由在字节内部成长起来的严林负责,吴双志这样的后训练人才则更多流向火山引擎。
接近字节的内部人士称,字节现在的定位看似已经清晰:豆包、Dola 负责短期做大用户规模;Work 押注新的 Agent 办公场景;火山则承担更长期的企业服务和模型商业化。
放到行业里,Seed 这轮调整并不孤立:腾讯上月将混元的大语言模型部与多模态模型部合并为基础模型部,由姚顺雨统一负责;Meta 的超级智能实验室也按模型、研究、产品、Infra 四块重组。
可以看到,模型向 Omni 发展后,不同模态之间的边界变得模糊;Reasoning 和 Agent 成为竞争重点后,RL 也不再只是某个模型的“后训练环节”。Agent 还在拉近模型和产品之间的距离——模型不只是理解和生成,还要调用工具、执行任务,最终直接参与到产品和业务流程中。
Seed 这次调整得更加彻底:它换掉的是整套组织逻辑——不再按文本、代码、视觉各自为战,而是把这些能力打散,重新装进数据、强化学习和产品任务里。
框架已经搭起来了,接下来要看的,是这套组织方式能不能真正跑通。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断