SheepNav
新上线今天101 投票

Gemini Omni 1.1 Flash 发布:开发者获得更精细的视频生成控制

Google DeepMind 于 2026 年 8 月 27 日悄然发布了 Gemini Omni 1.1 Flash,这是一次面向开发者的大版本更新,旨在将生成式视频从“实验玩具”推向“生产就绪”的工具。此次更新最核心的变化在于:开发者现在可以对视频生成过程进行更精细的控制,包括场景延长、首尾帧插值、4K 分辨率输出,以及更快的原型迭代。

关键能力一览

  • 场景延伸:支持将现有视频片段延长至 40 秒,并保持视觉一致性和叙事流畅性。这对于需要扩展镜头时长的创作者来说,意味着可以避免重新生成带来的风格断裂。
  • 首尾帧插值:开发者可以指定起始帧和结束帧,让模型自动生成平滑的过渡动画,模拟专业摄像机的运动轨迹。这一功能在动画制作和动态分镜中尤为实用。
  • 4K 超清输出:最终成品可以无损升级到 4K 分辨率,满足广告、影视等专业场景的清晰度要求。
  • 360p 快速预览:在创作过程中,开发者可以使用低分辨率预览来快速测试想法,大幅降低计算成本和时间消耗。

行业背景与意义

生成式视频领域竞争激烈,Runway、Pika 等初创公司早已布局,而 Google 凭借 Gemini 系列模型试图在底层能力上建立壁垒。此次更新体现了两个趋势:一是从“生成”转向“编辑”,强调对内容的控制而非简单的文字转视频;二是面向开发者生态,通过 API 开放能力,让第三方工具能够集成这些功能。

值得注意的是,Google 同时将模型上线到了 Google AI StudioGemini Enterprise Agent Platform,这意味着从个人开发者到企业级应用都能快速接入。这或许是对 OpenAI Sora 尚未全面开放的一种策略性回应,也表明 Google 希望在 B 端市场率先卡位。

使用建议

对于正在构建视频编辑软件、广告自动化工具或内容生成平台的团队,Gemini Omni 1.1 Flash 提供了现成的解决方案。建议先从 360p 预览开始,确认创意方向后再进行 4K 输出,以平衡成本与质量。当然,目前生成式视频仍面临版权、真实性等争议,开发者应在应用中明确标注 AI 生成内容。

总体而言,这次更新将生成式视频的实用性提升到了一个新高度,但能否在竞争激烈的市场中脱颖而出,还要看实际生成效果和开发者的接受度。

延伸阅读

  1. 英伟达拟以130亿美元收购AI模型库Hugging Face
  2. AI高管跳槽潮再起:Thinking Machines联合创始人Barret Zoph转投Google
  3. AI行业抨击特朗普芯片税计划:'最愚蠢的竞争方式'
查看原文