通用大模型正从代码渲染与空间规划两个维度跨界切入AI视频领域,改写行业能力边界;字节、快手与MiniMax等专业视频厂商则通过全链路Agent加速向上游渗透,加固护城河。
过去一个月,AI 视频领域最热烈的讨论并非源自 Seedance、可灵或 MiniMax 等专业视频模型,而是跨界闯入的通用大语言模型。
Anthropic 旗下的 Claude Opus 5.5 依靠编写前端代码渲染视频,催生出大量科普动画、创意短片与音乐 MV,甚至带火了名为「Vibe Video」的全新创作范式;GPT-6 Astra 则化身「AI 导演」,通过操作 Blender、Unreal Engine 与 DaVinci Resolve 等专业软件,负责场景白模搭建、镜头预演和剪辑执行,逐步掌控视频生产的上游规划环节。
通用模型没有在写实画质上正面硬刚,而是从代码渲染与空间规划两条路径切入,重新划定了 AI 视频的能力边界。

9 月 22 日发布的 Claude Opus 5.5 主打编程与 Agent 任务能力,但在随后的测试中,开发者发现它可以通过编写前端代码生成完成度极高的动画视频。
创作者仅需输入提示词或情绪板,模型即可自主完成任务规划与脚本开发。X 平台博主制作的反乌托邦短片在数小时内生成,浏览量迅速突破 2000 万。马斯克也公开评价这一表现让其“真切感受到了 AGI 的深远影响”。

与传统视频生成模型直接输出像素画面不同,Claude 采用纯代码渲染逻辑:通过编写 SVG、Canvas、Three.js 以及 Remotion 等前端代码,定义视觉元素与运动轨迹,在无头浏览器中逐帧录制并经 FFmpeg 编码合成 MP4 文件。在这个流程中,模型同时担任导演、制片、画师与剪辑师。

这种方式具备极高的可编辑性与极低的迭代成本,修改镜头仅需变动几行代码即可精确调整参数。但其局限同样明显:擅长图表、数据可视化和抽象 3D 场景,难以处理写实真人与复杂物理交互,目前主要渗透轻量商业与科普内容。

GPT-6 Astra 走向了另一条路径:充当「导演+制片」,重构影视工业化工作流。
在连续穿越多个空间的一镜到底测试中,Astra 先在 Blender 中搭建白模场景并规划运镜路线,待空间逻辑与机位无误后再交由 Seedance 2.5 渲染,有效解决了 AI 视频常见的空间错乱和穿模问题。

在 DaVinci Resolve 21.1 接入原生 MCP 服务器后,Astra 可直接操作剪辑软件,将 75 分钟原始素材自动粗剪为包含 96 个片段、调色和字幕的 22 分钟成片。

依托 3D 空间理解与世界模型能力,Astra 让镜头调度和空间布局变成了可修改、可复用的数字资产。

面对通用大模型的分流和上游挤压,专业视频厂商正加速向全流程生产渗透:



通用大模型的优势在于创意发散与代码调度,但在商业短剧、品牌广告等核心场景中,稳定的写实画质与成熟的工业流协同依然不可或缺。专业视频厂商通过全链路布局守住上游入口,避免沦为单纯的后端渲染器,双方正从对抗走向深度互补的产业协作。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断