曾因字节跳动算力纠纷事件引发广泛争议的北大博士生田柯宇完成3000万美元融资,公司估值达2亿美元。五源资本和IDG押注其自回归视觉路线,试图通过构建AI专属符号语言大幅降低视频生成成本,向李飞飞等学界代表发起挑战。
一家仅有10人规模、尚未正式命名且未推出公开产品的初创实验室,近期完成了3000万美元融资,估值直接推升至2亿美元。领投方包括五源资本与IDG等知名投资机构。
这家公司的创始人正是曾在国内AI圈引起轩然大波的北大博士生田柯宇。两年前,他曾身陷字节跳动索赔诉讼风波,却同时以第一作者身份拿下了NeurIPS 2024最佳论文奖。如今,在顶级风险投资的支持下,他选择在世界模型赛道另辟蹊径,与李飞飞创立的World Labs等团队展开正面竞争。
田柯宇切入世界模型赛道的核心逻辑在于:人类自然语言的信息维度过低,无法完整表达物理世界的丰富细节,不仅会丢失物理信息,还会浪费算力。
为了绕开这个瓶颈,他的团队正在尝试创造一套AI专属的符号系统。目前,团队已构建了一套包含20万个符号的“视觉词典”。虽然这些机器符号无法被人类直观理解,但大模型可以用它们来对视频画面进行高效表征、极限压缩和时序预测。田柯宇表示,该方法能够将生成一秒钟视频的推理成本降低至少一个数量级。
团队计划使用约1亿小时的视频数据进行预训练,打造适用于机器人、自动驾驶以及交互式视频等场景的物理基座模型,预计于2027年正式发布。这套符号体系的核心价值在于解决传统视觉模型的指代模糊问题,大幅增强长序列物理模拟的稳定性。

这一理念源于其在NeurIPS 2024获奖的代表作《Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction》(VAR)。该论文的核心突破在于让视觉生成模型能够像大语言模型一样,依靠Scaling Law实现能力的稳定扩展。

在VAR诞生前,主流视觉生成路线主要分为以Sora为代表的扩散模型和早期光栅扫描式的自回归模型。前者推理耗时长、算力开销巨大;后者则强行将二维图像拉平成一维序列,丢失了原生的空间几何关系。VAR提出了“下一尺度预测”机制,保留二维结构,以多尺度残差形式由粗到细分层并行预测细节。这不仅将生成速度提升了20倍,还首次在视觉生成中验证了Scaling Law,模型在参数扩展到23亿时自然涌现出了图像修复与指令编辑等零样本能力。
在学术荣誉加身的同时,田柯宇也曾深陷争议漩涡。

2024年年中,田柯宇在字节跳动实习期间,因对团队内部的GPU算力资源分配不满,利用Hugging Face加载权重文件的安全机制篡改优化器代码,干扰了其他同事的模型训练任务。这一行为导致团队后续多项研发受阻。字节跳动随后解除其实习协议,并向法院提起诉讼。法院最终判决田柯宇违反实习合同,赔偿字节跳动50万元并返还实习期薪资。

在近期接受彭博社采访时,田柯宇正面回应了当年的事件,承认当时的行为是“以暴制暴”,并坦言如果重新来过会采取更明智的处理方式。这场风波反映出大厂AI实验室在严苛算力竞争下的组织困境,同时也给田柯宇在体制内和学术界的公开合作蒙上了阴影,最终促使他选择独立创业。

当前世界模型赛道正在经历剧烈分化:李飞飞的World Labs主打基于空间重构的三维理解;杨立昆创办的AMI Labs探索联合嵌入预测架构(JEPA);宇树与Momenta等企业则聚焦于具身智能的规划控制。
李飞飞团队的空间重构路线注重三维几何的严谨性,但在工程实现上算力成本极其高昂。相比之下,田柯宇选择的符号压缩自回归路线试图绕过显式的3D几何重建,将视频当成极度压缩的信息流,让大模型通过海量数据预测自动领悟物理规律。
在商业落地场景中,高昂的算力成本是世界模型普及的最大阻碍。田柯宇通过极限压缩大幅削减单位时间生成成本的构想,成为打动投资机构的关键抓手。

不过,该路线仍面临严峻的技术挑战:仅凭20万个符号的时空压缩,能否在长时序交互中稳定涌现出准确的物理因果规律,目前尚未在大规模工程中得到充分验证。此外,1亿小时视频的数据清洗难度,以及10人团队的基础设施运维能力,都是其未来兑现技术承诺必须跨过的门槛。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断