在IBC大会上,NVIDIA大幅扩充了NVIDIA AI for Media工具集,涵盖伪造视频检测、单目3D人体姿态估计、实时慢动作插帧等技术,并发布体育智能开发手册与多语言本地化工作流,全面推动广电与流媒体向软件定义AI架构演进。
在阿姆斯特丹举行的 IBC 大会上,NVIDIA 宣布对其面向传媒与娱乐行业的解决方案 NVIDIA AI for Media 进行全面升级。通过整合 GPU 加速的 SDK、NIM 微服务及参考工作流,NVIDIA 正在为实时转播、体育分析与流媒体分发提供一整套生成式 AI 工具栈。
NVIDIA 带来了 Synthetic Video Detector (SVD) NIM 微服务。该服务用于判断视频素材是否为 AI 生成,在文本生成视频(文生视频)检测中的准确率达 99.3%,在图生视频检测中也达到了 97.7%。
行业合作伙伴已开始将该工具集成到生产流程中:
面向体育赛事转播等高动态场景,NVIDIA 推出了多项画质与帧率增强技术:
针对跨国转播需求,NVIDIA 更新了 LipSync 与 Active Speaker Detection NIM 微服务。LipSync 能够在保留自然眨眼与头部运动的同时,将画面中的嘴部动作精准匹配至多语言音轨,并大幅改善了面部遮挡场景下的牙齿与唇部纹理细节。NDI 正在将这些微服务集成到现有转播管线中,实现单一视频流向多语种画面的实时转换,降低多语言分发成本。
配套的 Studio Voice 微服务还加入了全新麦克风配置文件,可在消除背景噪音与混响的同时,自定义语音输出的音色质感。

除了单一模型,NVIDIA 正在推进媒体基础设施的底层软件化:
媒体交换层(MXL)集成:NVIDIA Holoscan for Media 正式整合 MXL,作为开放参考架构,帮助软件定义的媒体应用在分布式计算环境中动态交换音视频数据,使传统广播功能与 AI 推理运行在同一加速计算集群上。

体育智能开发手册(Sports Intelligence Playbooks):帮助赛事组织方与转播商利用自有的赛事录像和标注数据,微调 Nemotron 等开源多模态模型。测试数据显示,经过专门微调后,多模态模型在特定体育场景下的问答准确率从 53% 提升至 94%。结合 NVIDIA AI-Q 蓝图,机构还能将这些专业模型包装为可自主调取系统数据、执行转播任务的 AI 智能体。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断