OpenAI 发布改进一致性模型训练的新技术
OpenAI 介绍了一致性模型训练的改进技术。一致性模型是一类新兴生成模型,无需对抗训练即可一步生成高质量数据样本。
OpenAI 介绍了一致性模型训练的改进技术。一致性模型是一类新兴生成模型,无需对抗训练即可一步生成高质量数据样本。
Consistency Models 是 OpenAI 发布的一项生成模型研究,针对扩散模型的问题提出改进。扩散模型虽显著推进了图像、音频和视频生成,但其依赖的迭代采样过程导致生成速度慢。
Stable Diffusion 3 Medium(2B 参数)现已在 Hugging Face Hub 开放,可通过 🧨 Diffusers 使用,并附 DreamBooth 与 LoRA 训练脚本。
推荐理由:Hugging Face 官方讲解了 SD3 的 MMDiT 架构与 Diffusers 用法,附内存与性能优化数据,可直接迁移到自己的推理和微调流程。
Artificial Analysis 与 Hugging Face 推出基于人类偏好的 Text to Image 排行榜和 Image Arena,ELO 分数基于 Arena 收集的 45,000 多条人类图像偏好计算,每个模型生成 700 多张图像。
Canva 是一个视觉传播平台,每月有超过 175 million 人使用它制作演示文稿、视频、文档、网站和社交媒体图片等。世界上大多数知识工作者缺乏设计训练,Canva 凭借易用的界面、丰富的素材库和省时工具,让任何人都能创作出视觉效果出色的内容。
SegMoE 框架正式发布,可将多个预训练扩散模型合并为混合专家模型,已集成 Hugging Face diffusers 并以 Apache 2.0 开源。发布 SegMoE-2x1、SegMoE-4x2 和 SegMoE-SD4x2 三个模型,用户只需编写 config.yaml 运行命令即可在几分钟内创建自己的 MoE 模型。
推荐理由:官方介绍了 SegMoE 的 MoE 架构、三个已发布模型和自制方法,读者可以据此尝试组合预训练扩散模型。
Hugging Face 与 ONNX Runtime 团队介绍用 Olive 优化的 SD Turbo 和 SDXL Turbo 模型,在 NVIDIA GPU 上用 ONNX Runtime CUDA 和 TensorRT 执行提供者加速推理。
Hugging Face 发布教程,讲解如何把 ComfyUI 工作流转换成 Gradio 应用并部署到 Spaces 的 ZeroGPU 免费推理。
推荐理由:原文给出从导出 ComfyUI 工作流到在 Spaces ZeroGPU 免费部署的完整步骤,含模型映射和代码改动细节,可迁移到自己的工作流。
Hugging Face 发布 MUSE 的开源复现 aMUSEd,一个基于 Masked Image Modeling 的非扩散文生图模型,以研究预览形式采用 OpenRAIL 许可发布。
Hugging Face 发布 SDXL Dreambooth LoRA 进阶训练社区指南,将 Replicate SDXL Cog trainer 的 Pivotal Tuning 与 Kohya trainer 使用的 Prodigy 优化器等多项优化组合,脚本已在 diffusers 开源并提供 Colab 与 Spaces 入口。
推荐理由:官方博客给出把 Pivotal Tuning 与 Prodigy 优化器组合进 SDXL Dreambooth LoRA 训练的完整做法与实验对比,参数可直接复用。
Hugging Face 在 Inference API 中实现 LoRA 适配器动态加载/卸载,保持基础模型常驻,使 Hub 上公开 Diffusion 模型的 LoRA 推理大幅提速。
Hugging Face 与 LCM 团队发布 LCM LoRA,通过训练少量 LoRA 适配层而非完整蒸馏模型,让 Stable Diffusion 和 SDXL 的推理步数从 25-50 步降到 4-8 步。
推荐理由:LCM LoRA 只训练少量适配层就能让任意 SDXL 微调模型 4 步出图,文中给出 diffusers 代码和多硬件基准,方法可直接复用。
Hugging Face Diffusers 团队发文讲解如何优化 SDXL 的推理速度和内存占用,测试在 A100(40GB)上进行,每轮生成 4 张图取第 3 次结果。
推荐理由:官方在 A100 上实测了多种 SDXL 推理优化手段并附完整数据表,读者可以按自己的显存和延迟需求直接选用对应技巧。
OpenAI 宣布 DALL·E 3 现已在 ChatGPT Plus 和 Enterprise 中可用。官方为此开发了安全缓解措施栈以支持更广泛的发布,并同步分享了其内容溯源研究的进展。
推荐理由:官方宣布 DALL·E 3 开放范围扩大,并提及安全缓解措施与溯源研究,读者可了解其上线入口与安全准备。
Hugging Face 宣布 Diffusers 现已支持通过 JAX 在 Cloud TPU 上部署 Stable Diffusion XL(SDXL),实现高性能、低成本的推理。
Hugging Face 介绍了如何通过 TRL 库新增的 DDPOTrainer,用强化学习方法 DDPO 微调 Stable Diffusion,使输出更符合人类审美。
3D Gaussian Splatting 是一种光栅化技术,源自论文 "3D Gaussian Splatting for Real-Time Radiance Field Rendering",可从少量图像实时渲染照片级真实感场景。
Hugging Face 发布 Würstchen,一种在高度压缩潜空间中工作的文生图扩散模型,实现 42x 空间压缩。生成速度明显快于 SDXL 且内存占用更低;Würstchen v2 训练用 24,602 GPU 小时,支持最高 1536 分辨率,已集成进 Diffusers,模型权重和 Demo 已在 Hub 上线。
推荐理由:42x 空间压缩带来的训练与推理成本对比有具体数字,适合想低成本跑文生图的读者参考。
Hugging Face Diffusers 团队与 T2I-Adapter 作者合作,为 Stable Diffusion XL 推出 T2I-Adapter 支持,并发布 sketch、canny、lineart、depth、openpose 五种条件的 checkpoints。
推荐理由:原文给出 T2I-Adapter-SDXL 与 ControlNet 的参数量对比、训练配置和完整用法代码,读者可以据此评估并直接上手使用。
Hugging Face 官方教程讲解如何在 🧨 Diffusers 中运行 AudioLDM 2 文生音频管线,并通过 Flash Attention、float16 半精度、torch.compile 编译 UNet、切换 DPMSolverMultistepScheduler 将 10 秒音频的生成时间从约 14 秒降到 1 秒以内,且音质几乎不降。
推荐理由:官方教程给出四种可复用的推理优化方法,把 10 秒音频的生成时间从约 14 秒压到 1 秒以内,可直接迁移到自己的管线。
Hugging Face 与 BentoML 联合演示如何将开源文生图模型 DeepFloyd IF 部署到生产环境。DeepFloyd IF 直接在像素空间工作,由冻结文本编码器 T5-XXL-1.1 和三个级联像素扩散模块组成,可将 64x64 px 图像逐步放大至 1024x1024 px。
Segmind 开源了通过 Block-removal 知识蒸馏训练的压缩版 Stable Diffusion 模型 SD-Small 和 SD-Tiny 的权重与训练代码,参数量分别比基础模型少 35% 和 55%,图像保真度相当。
Hugging Face 博客发布教程,演示用 Shap-E 从文本生成 3D 模型,再经 Blender 减面、Dream Textures 生成无缝贴图和 UV 展开,导出 FBX 并导入 Unity。作者选择 PS1 低多边形风格以规避当前 text-to-3D 保真度不足的问题,并配以顶点光照、浓雾和故障风后期处理还原复古观感。
Apple 与 Hugging Face 将 Stable Diffusion XL 移植到 Core ML,发布完整 pipeline 和 mixed-bit palettization 量化版本,UNet 以平均 4.5 位压缩后体积从 4.8GB 降至 1.4GB(减少 71%)。
推荐理由:原文给出 Stable Diffusion XL 在 Mac 上的 Core ML 移植细节、压缩到 4.5 位后体积从 4.8GB 降到 1.4GB 的数据,以及可复用的混合位宽量化方法。
Hugging Face 的 🤗 Diffusers 扩散模型库迎来一周年,回顾了一年来的主要功能更新。
Hugging Face 展示如何在 Intel 第四代 Xeon(Sapphire Rapids)CPU 集群上微调 Stable Diffusion 模型,采用 textual inversion 技术,仅需 5 张示例图片。
Hugging Face 在伦理与社会通讯第 4 期中探讨文生图模型的偏见来源,包括训练数据(如 LAION-5B)、预训练数据过滤、CLIP 推理、隐空间及事后过滤等环节。
Apple 在 WWDC'23 中更新 Core ML 与 coremltools 的压缩优化能力,配合开源仓库 ml-stable-diffusion,支持将 Stable Diffusion 量化为 8/6/4/2-bit palettization,推荐 6-bit 以在精度损失很小的前提下加快推理并节省内存。
推荐理由:作者亲测 6-bit palettization 带来的生成速度提升,并给出完整转换命令和 Hub 模型,读者可按步骤迁移到自己微调的模型。
Hugging Face 宣布举办首届 Open Source AI Game Jam,参赛者需在作品中或工作流里使用至少一个开源 AI 工具(如 Stable Diffusion),可应用于纹理生成、AI NPC 和文本转语音等场景。
Hugging Face 与 OpenVINO NNCF 合作提出 Stable Diffusion 的 CPU 优化工作流,通过量化感知训练(QAT)结合知识蒸馏和 Token Merging,相比 PyTorch 实现 5.1x 推理加速和 4x 模型体积缩减。
Hugging Face 探索用指令微调让 Stable Diffusion 学会根据指令处理输入图像,如“给自然图像加卡通滤镜”。
Hugging Face 发布博客,梳理文本生成视频模型从 GAN、Transformer 到扩散模型的演进脉络,并对比文本生成图像任务解释其在计算成本、数据集和视频描述上的挑战。
推荐理由:系统梳理了文本生成视频模型的技术演进、数据集挑战与代表工作,并给出 Diffusers 上的可复用代码与演示入口。
Hugging Face 官方博客演示用 🧨 diffusers 在免费版 Google Colab(13GB CPU 内存、T4 15GB 显存)上运行 DeepFloyd 的开源文生图模型 IF,并支持图像变化和局部重绘。
推荐理由:官方博客给出在 13GB 内存免费 Colab 上跑通 40GB 参数 IF 的完整低显存方案,含可复用的代码和量化技巧。
Hugging Face 发布教程,演示多种技术在 Sapphire Rapids CPU 上加速 Stable Diffusion 推理。
Hugging Face 发布教程,详解如何用 diffusers 训练 ControlNet,并以基于 Microsoft FaceSynthetics 10 万合成人脸数据集训练的 Uncanny Faces 面部姿态模型为例。
推荐理由:作者以亲身训练经历给出从数据集构建到训练参数的完整流程,还分享了过拟合教训和 8GB 显存的降配方法。
Hugging Face 发布教程,介绍如何在 Diffusers 中通过 StableDiffusionControlNetPipeline 使用 ControlNet,支持 canny 边缘、OpenPose 姿态等 8 种空间条件控制 Stable Diffusion 生成,并可组合多个条件或与 DreamBooth 微调结合。
推荐理由:原文给出 ControlNet 在 Diffusers 中的完整用法和加速省显存配置,读者可以照搬代码在 Colab 上复现同样的生成效果。
Hugging Face 发布 Diffusers for Mac 1.1,这是一款基于 Core ML 的开源原生 Mac 文生图应用,文生图速度最高可提升至两倍。
Hugging Face 的 AI 游戏开发系列第 4 篇介绍用 Stable Diffusion Image2Image 生成 2D 游戏素材,演示为农场游戏制作玉米图标。
在「AI 做游戏开发」系列第 3 天,作者探讨用 AI 生成 3D 资产,结论是目前 text-to-3D 尚无法实际用于游戏开发。文中盘点 DreamFusion、Point-E、CLIP-Forge、Dream Textures 等最新进展,指出基于 NeRF 的视图合成转出的 mesh 仍需大量后期处理才能 game-ready。
Hugging Face 发文介绍 Mask2Former 和 OneFormer 两个通用图像分割模型现已进入 transformers 库。