Google Research 的 Diffusion Controller 如何统一并简化 AI 图像生成控制
Google Research 提出 Diffusion Controller 框架,将去噪生成过程重构为连续控制问题,用轻量级“转向阻尼”网络在冻结基础模型的情况下引导生成方向。
Google Research 提出 Diffusion Controller 框架,将去噪生成过程重构为连续控制问题,用轻量级“转向阻尼”网络在冻结基础模型的情况下引导生成方向。
Google Research 在 ICLR 2026 发表的论文《On the Interpolation Effect of Score Smoothing in Diffusion Models》指出,扩散模型的“创造力”源于神经网络训练对 score function 的平滑效应。
Hugging Face 的 Data is Better Together 社区发布 Apache 2.0 许可的文本生成图像偏好数据集 open-image-preferences-v1,包含 10K 偏好对、超 30K 标注响应,由 250 多名社区成员在不到两周内完成。
OpenAI 发布论文,对连续时间一致性模型做了简化、稳定化和规模化,仅用两个采样步骤即可达到与领先扩散模型相当的样本质量。
OpenAI 介绍了一致性模型训练的改进技术。一致性模型是一类新兴生成模型,无需对抗训练即可一步生成高质量数据样本。
Consistency Models 是 OpenAI 发布的一项生成模型研究,针对扩散模型的问题提出改进。扩散模型虽显著推进了图像、音频和视频生成,但其依赖的迭代采样过程导致生成速度慢。
OpenAI 发布 Image GPT,将与语言模型相同架构的 Transformer 训练在像素序列上,可生成连贯的图像补全和样本。研究建立了生成样本质量与图像分类精度之间的相关性,其最佳生成模型在无监督设置下提取的特征可与顶级卷积网络竞争。
OpenAI 在能量模型(EBM)的稳定、可扩展训练上取得进展,样本质量与泛化能力优于现有模型。EBM 生成时通过持续细化答案投入更多算力,在低温下可生成与 GAN 相当的样本,同时具备似然类模型的 mode 覆盖保证。
OpenAI 发布可逆生成模型 Glow,使用可逆 1x1 卷积,扩展并简化了此前可逆生成模型的工作。模型可生成真实的高分辨率图像,支持高效采样,并能发现可用于操纵数据属性的特征;OpenAI 同时开源模型代码并上线在线可视化工具。