Google DeepMind 发布 Gemini Omni 1.1 Flash,强化生成视频创作控制
Google DeepMind 发布 Gemini Omni 1.1 Flash,通过 Gemini API 和 Google AI Studio 面向开发者提供更可控的生成视频能力。
推荐理由:官方发布了能力细节和 API 用法,开发者可以据此评估它在视频生成工作流中的可控性和成本。
AI 视频生成与理解:文生视频模型、视频编辑工具与影视创作变革的追踪。
Google DeepMind 发布 Gemini Omni 1.1 Flash,通过 Gemini API 和 Google AI Studio 面向开发者提供更可控的生成视频能力。
推荐理由:官方发布了能力细节和 API 用法,开发者可以据此评估它在视频生成工作流中的可控性和成本。
Google DeepMind 发布 Nano Banana 2 Lite(gemini-3.1-flash-lite-image)和 Gemini Omni Flash(gemini-omni-flash-preview)。
推荐理由:官方同时给出两款模型的定价、延迟数字和已知限制,开发者可以直接据此评估是否替换现有图像与视频工作流。
Google DeepMind 发布 Gemini Omni 系列首个模型 Gemini Omni Flash,可组合图像、音频、视频和文本输入生成视频,并支持自然语言多轮编辑。
推荐理由:官方说明了视频生成与对话式编辑的具体能力和订阅范围,读者可以据此判断它是否适配现有创作流程。
NVIDIA 发布 Nemotron 3 Nano Omni(30B-A3B)全模态理解模型,支持文档分析、ASR、长音视频理解和 agentic computer use,并在 Hugging Face 开放 BF16、FP8 和 NVFP4 权重。
推荐理由:原文给出完整基准对比和架构细节,读者可以据此评估它是否值得替换现有的多模态工作流。
Overworld 发布实时视频世界模型 Waypoint-1.5,权重已上传 Hugging Face。在 RTX 3090 至 5090 桌面硬件上可实时生成最高 720p、60 FPS 的交互环境,另提供面向游戏笔记本等更广消费级硬件的 360p 档位,Apple Silicon 支持即将推出。
推荐理由:原文给出两档模型的具体硬件门槛、帧率分辨率和约百倍数据训练规模,读者可据此判断自己的设备能否本地运行。
Hugging Face 发布博客,梳理文本生成视频模型从 GAN、Transformer 到扩散模型的演进脉络,并对比文本生成图像任务解释其在计算成本、数据集和视频描述上的挑战。
推荐理由:系统梳理了文本生成视频模型的技术演进、数据集挑战与代表工作,并给出 Diffusers 上的可复用代码与演示入口。