NVIDIA 创始人黄仁勋与 OpenAI 首席科学家 Ilya Sutskever 展开深度对话,剖析了深度学习爆发、通过数据压缩实现无监督学习的底层逻辑,以及 GPT-4 构建世界模型与迈向多模态的技术演进路径。

在 NVIDIA 主办的一场深度对话中,NVIDIA 创始人兼 CEO 黄仁勋与 OpenAI 联合创始人兼首席科学家 Ilya Sutskever,围绕现代深度学习的演进历程与人工智能的未来展开了全面探讨。
回溯现代 AI 的爆发起点,Ilya 表示自己最早投身人工智能源于对意识与人类体验的好奇。2002 年前后,计算机根本不具备自主学习能力。直到他在多伦多大学师从 Geoffrey Hinton,才确信神经网络这一能够自动编程的并行计算架构,具备模拟人类大脑学习机制的巨大潜力。
在 AlexNet 诞生前,业界并不清楚 GPU 该如何高效服务于深度学习。Hinton 建议团队尝试 GPU,随后 Alex Krizhevsky 编写出了极快的高性能卷积核函数。恰逢李飞飞团队构建的大规模图像数据集 ImageNet 出现,卷积神经网络在 GPU 上的大规模并行训练最终大幅刷新了计算机视觉纪录,拉开了深度学习革命的序幕。

2015 年底 OpenAI 创立时,全球深度学习研究人员极其稀缺。Ilya 回忆,当时团队坚持了两个关键直觉,其中最核心的一条便是「通过压缩实现无监督学习」。
当时学术界普遍认为无监督学习难以突破,但 Ilya 坚信,如果能将数据压缩到极致,模型就必然能够提取其中蕴含的所有隐藏规律。训练自回归生成模型在数学本质上就是高效率的数据压缩。
在早期的情绪神经元研究中,团队使用循环神经网络 LSTM 预测亚马逊商品评论的下一个字符,意外发现网络内部自发涌现出了专门表征情感极性的神经元。这直接证明了「下一个词预测」具有挖掘深层语义与数据规律的能力,奠定了后续 GPT 系列模型的技术信仰。
OpenAI 早期投入大量精力训练 AI 智能体对战复杂即时战略游戏 Dota 2。许多人曾视其为弯路,但该项目沉淀了深厚的强化学习工程经验。
随着 GPT 确立为底层基座模型,团队将 Dota 2 项目积累的强化学习机制,平移为基于人类反馈的强化学习(RLHF),最终促成了 ChatGPT 的质变。
针对「大语言模型只是文字概率统计」的普遍误解,Ilya 指出,当模型在数以万亿计的文本中精准预测下一个词时,它实际上构建了一个高维的「世界模型」。
文本是物理世界与人类社会的投影。模型在压缩统计规律的过程中,被迫理解事件因果、人类动机、情感逻辑与社会交互。预测越准确,模型还原世界的分辨率就越高。
预训练阶段赋予了模型理解世界的广度,而基于人类反馈的微调则是确立规则与意图传达的过程。人类教师并非传授新知识,而是指导模型成为安全、有条理且符合预期的助手。
谈及 GPT-4 相比前代的核心区别,Ilya 认为关键在于预测精度的质变带来的更高可靠性。GPT-4 表现出了连贯的多步骤数学推导能力与复杂的逻辑遵循能力。

在多模态拓展上,Ilya 强调了视觉模态的两层价值:
展望未来,Ilya 认为 AI 技术的首要攻坚方向是「建立人类的信任」。大语言模型必须在长文档摘要中做到关键信息零遗漏、在复杂生成中完全遵循用户意图,并在面对未知时主动承认不足或发起追问。
Ilya 感叹,历经 20 年发展,深度学习的基础算法骨架并未彻底颠覆,但随着模型参数规模和高质量数据的指数级扩张,人工神经元在正确训练下所展现出的涌现能力,已经彻底重塑了人类对机器智能的认知边界。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断