在 SageMaker AI 上用 vLLM-Omni 生成图像与视频(第二部分)
这篇教程演示在 Amazon SageMaker AI 上用同一个 AWS vLLM-Omni DLC 部署两个端点:实时端点运行 FLUX.2-klein-4B 生成图像,异步端点运行 Wan2.1-VACE-1.3B 将图像生成为视频,MP4 结果存入 Amazon S3。
这篇教程演示在 Amazon SageMaker AI 上用同一个 AWS vLLM-Omni DLC 部署两个端点:实时端点运行 FLUX.2-klein-4B 生成图像,异步端点运行 Wan2.1-VACE-1.3B 将图像生成为视频,MP4 结果存入 Amazon S3。
Google Research 发布 AI 视频 Co-Director 研究,在 Gemini 与 Veo 之上构建统一多智能体框架,通过全局优化与世界状态追踪生成连贯的分钟级多镜头视频。
invideo 使用 GPT‑6 Astra 提升视频编辑精度,色彩校正与调色效率提升三倍,并可在一天内制作 50 个自定义特效。
Higgsfield AI 使用 GPT-6 Astra 在一天内推出新的视频功能,为小企业简化视频广告制作,并更快地将新创意工具推向市场。
Google DeepMind 发布 Gemini Omni 1.1 Flash,通过 Gemini API 和 Google AI Studio 面向开发者提供更可控的生成视频能力。
推荐理由:官方发布了能力细节和 API 用法,开发者可以据此评估它在视频生成工作流中的可控性和成本。
Google DeepMind 与 A24 宣布达成首个此类研究合作,围绕多个项目展开长期研发协作,帮助电影人开发新的工作流程与技术。Google 同时对 A24 进行了投资。双方将共同测试、迭代并构建新工具,以拓展未来娱乐创作的可能性。
Google DeepMind 发布 Nano Banana 2 Lite(gemini-3.1-flash-lite-image)和 Gemini Omni Flash(gemini-omni-flash-preview)。
推荐理由:官方同时给出两款模型的定价、延迟数字和已知限制,开发者可以直接据此评估是否替换现有图像与视频工作流。
Google DeepMind 发布 Gemini Omni 系列首个模型 Gemini Omni Flash,可组合图像、音频、视频和文本输入生成视频,并支持自然语言多轮编辑。
推荐理由:官方说明了视频生成与对话式编辑的具体能力和订阅范围,读者可以据此判断它是否适配现有创作流程。
NVIDIA 发布 Nemotron 3 Nano Omni(30B-A3B)全模态理解模型,支持文档分析、ASR、长音视频理解和 agentic computer use,并在 Hugging Face 开放 BF16、FP8 和 NVFP4 权重。
推荐理由:原文给出完整基准对比和架构细节,读者可以据此评估它是否值得替换现有的多模态工作流。
Overworld 发布实时视频世界模型 Waypoint-1.5,权重已上传 Hugging Face。在 RTX 3090 至 5090 桌面硬件上可实时生成最高 720p、60 FPS 的交互环境,另提供面向游戏笔记本等更广消费级硬件的 360p 档位,Apple Silicon 支持即将推出。
推荐理由:原文给出两档模型的具体硬件门槛、帧率分辨率和约百倍数据训练规模,读者可据此判断自己的设备能否本地运行。
OpenAI 表示,Sora 2 视频模型和 Sora 社交创作应用在开发之初就以安全为基础设计,以应对最先进视频模型和全新社交创作平台带来的新型安全挑战。其安全方案依托具体、明确的保护措施构建。
OpenAI 阐述了 Sora 信息流的设计理念:通过个性化推荐激发创作、促进连接,同时保障使用安全。平台配备家长控制和严格的防护机制,让用户体验在创造力与安全之间保持平衡。
创作平台 Higgsfield 借助 OpenAI 的 GPT-4.1、GPT-5 和 Sora 2,让创作者用简单的输入生成电影质感、面向社交平台的视频。该方案面向内容创作者,降低了影视化视频制作的门槛。
Google DeepMind 更新 Veo 3.1 Ingredients to Video,提升基于参考图生成视频的表现力、角色身份一致性和背景与对象一致性。
OpenAI 发布 Sora 2 视频模型与 Sora 应用,并将安全措施作为产品基础,以应对先进视频模型和新社交创作平台带来的新型安全挑战。该方案以具体保护措施为锚点,强调在发布过程中对安全问题的重视。
OpenAI 发布 Sora 2,一个支持同步对话与音效的视频生成模型。同时原文提到 Sora 产品已不再可用。
推荐理由:官方宣布 Sora 2 带同步对话与音效的视频生成能力,读者可借此了解其与此前版本的能力差异。
OpenAI 发布新一代视频与音频生成模型 Sora 2。相较初代 Sora,新模型具备更准确的物理表现、更强的真实感、同步音频、更高的可控性和更广的风格范围。
推荐理由:官方说明列出 Sora 2 在物理准确性、音画同步和可控性上的能力变化,可帮助读者比较视频模型迭代方向。
Invideo AI 使用 OpenAI 的 GPT-4.1、gpt-image-1 和 text-to-speech 模型,将创意构思转化为专业视频,速度提升 10 倍,几分钟即可完成。
Hugging Face 作者 hlky 和 Sayak 开源了一套视频生成数据集构建工具,覆盖获取、过滤和处理三阶段,使用 yt-dlp 下载、LAION-5B-WatermarkDetection 检测水印、OpenCV 评估运动,并用 Florence-2 生成多种字幕。
Hugging Face 推出《AI 艺术工具》通讯第一期,回顾 2024 年 AI 艺术领域的关键进展。
OpenAI 宣布视频生成模型 Sora 上线,用户可在 sora.com 使用。支持生成最高 1080p、最长 20 秒的视频,可选宽屏、竖屏或方形比例,还可导入自有素材进行扩展、混剪与融合,或从文本生成全新内容。
推荐理由:官方公布视频生成的分辨率、时长与素材混用方式,读者可据此判断是否把 Sora 纳入现有视频创作流程。
电影制作组合 Vallée Duhamel 分享了他们如何借助 OpenAI 的 Sora 创作影像、构建新世界。该内容以 OpenAI News 的形式发布了这对双人组对 Sora 辅助电影制作流程的说明与创作经验。
OpenAI 发布 Sora 视频生成模型的系统卡。Sora 接受文本、图像和视频输入并生成新视频,建立在 DALL-E 和 GPT 模型的经验之上,旨在为人们的叙事和创意表达提供更多工具。
推荐理由:官方系统卡说明了 Sora 的输入输出形式和模型来源,读者可以据此了解其能力定位。
自 Sora 上月亮相以来,OpenAI 一直与艺术家合作,探索 Sora 如何辅助他们的创作过程。 (注:正文仅一句话,摘要按原文事实压缩,未添加任何细节。标题中"OpenAI"为来源明确给出的主体,"初体验/印象"保留原标题的 impressions 类型,不改为"发布"。)
OpenAI 发布视频生成模型 Sora,在可变时长、分辨率和宽高比的视频与图像上联合训练文本条件扩散模型,并采用作用于时空 patch 的 Transformer 架构。Sora 可生成一分钟高保真视频,OpenAI 认为扩大视频生成模型规模是构建通用物理世界模拟器的可行路径。
推荐理由:官方说明 Sora 的技术路线和可生成一分钟视频的能力,适合关注视频生成与世界模拟器方向的读者。
Hugging Face 的 🤗 Diffusers 扩散模型库迎来一周年,回顾了一年来的主要功能更新。
Hugging Face 推出实验性演示 AI WebTV,循环播放由开源文生视频模型 Zeroscope(zeroscope_v2_576 生成 576x320、zeroscope_v2_XL 放大至 1024x576)生成的短视频,配乐由 MusicGen 生成,提示词由 ChatGPT 根据人工撰写的主题生成。
Hugging Face 发布博客,梳理文本生成视频模型从 GAN、Transformer 到扩散模型的演进脉络,并对比文本生成图像任务解释其在计算成本、数据集和视频描述上的挑战。
推荐理由:系统梳理了文本生成视频模型的技术演进、数据集挑战与代表工作,并给出 Diffusers 上的可复用代码与演示入口。
OpenAI 通过微调 GPT-3 来驱动并规模化"全托管"视频创作服务。微调后的模型用于提升自动化视频生成的能力与可扩展性。