谷歌DeepMind发布Gemini Omni 1.1 Flash,新增场景扩展、首尾帧控制、360p快速预览与4K超分等功能,让生成式视频更可控、更高效。模型已通过Gemini API开放,开发者现可在Google AI Studio中调用。
谷歌 DeepMind 今天正式推出 Gemini Omni 1.1 Flash,为开发者带来一组新的创意控制与生成视频能力。Gemini Omni 本身主打真实世界推理,而这次更新让 Omni 1.1 通过 Gemini API 在 Google AI Studio 中达到专业生产级水准。
无论是构建生成视频工作流、创意工具还是媒体编辑软件,这些更新都让生成视频更可控、迭代更快,也更接近真实部署的要求。具体来看:

场景扩展功能允许你接续现有视频,从结尾处无缝生成后续画面。Omni 1.1 现在可以分析最多 10 秒的先前上下文——此前模型只能参考最后 1 秒,因此在视觉一致性和叙事连贯性上有了明显提升。你可以按 10 秒增量扩展视频,累计最长 40 秒。
通过 Gemini API 扩展场景的示例:
from google import genai
client = genai.Client()
interaction = client.interactions.create(
model="gemini-omni-1.1-flash",
previous_interaction_id=previous_video_interaction.id,
input=[
{"type": "text", "text": "Continue the scene."}
],
response_format={
"resolution": "360p",
},
)
通过指定一段镜头的起始帧和结束帧,Omni 1.1 能在两个关键帧之间生成连续视频。这个功能非常适合复杂的相机环绕、缩放转场或无缝循环片段。示例提示词包括:穿米色西装鼓手的低角度特写,镜头快速横摇至吹萨克斯的老者和旋转中的芭蕾舞者;或者镜头推近电视屏幕,看到相同的人物与场景,全程无跳切。
开发者可以先生成 360p 分辨率轻量预览,速度最高提升 60%(基于360p与720p系统吞吐量对比),成本只有 Omni 1.1 标准 720p 输出的三分之一。这特别适合快速原型、分镜迭代和开发平台内的快速渲染。示例提示词是一段微观视角下的海洋硅藻,玻璃般的硅质外壳呈现琥珀、铜、绿松石和紫色调,背景干净,保持显微镜镜头效果。
Omni 1.1 可以生成 1080p 或 4K 高分辨率输出,满足专业制作要求。示例包括鱼群游弋的跟踪镜头、从树林中窜出的小花栗鼠,以及秋日枫叶的微距特写等。
你可以在创作场景时引用最多三秒的视频参考,以保持视觉上下文和角色一致性。例如,上传三段舞者视频和一组角色图片,让狗角色跳经典舞蹈、章鱼角色跳嘻哈、熊角色跳霹雳舞,最终合成一个无剪辑的连续镜头。
这些新能力可以组合使用,开发者可以基于它们构建自定义工具和创意工作流。目前已有客户通过 Agent Platform API 将 Gemini Omni Flash 投入实际生产,探索视频生成在真实场景中的落地。

Omni 1.1 正在向谷歌开发者生态全面开放:
此外,全球所有 Google AI Plus、Pro 和 Ultra 订阅用户今天起可以在 Google Flow 中使用 Omni 1.1;场景扩展功能则在 Gemini 应用 中向上述订阅用户开放。
:
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断