跳到正文

#图像生成

今日 1 条
今天10月2日周五
9月30日周三
9月29日周二
9月10日周四
9月3日周四
7月23日周四
  1. Hugging Face Blog66

    Diffusers 原生集成 Nunchaku Lite,支持 4-bit SVDQuant 扩散模型推理

    Hugging Face 宣布 Diffusers 原生支持 Nunchaku 的 SVDQuant 4-bit 推理,通过 Nunchaku Lite 集成路径直接用 from_pretrained() 加载量化 checkpoint,无需独立推理引擎或本地 CUDA 编译。

    推荐理由:Diffusers 原生集成 Nunchaku,W4A4 量化在降显存的同时也降低推理延迟,是可复现的部署方案变化。

7月16日周四
7月6日周一
7月1日周三
4月23日周四
  1. Google Research61

    Google Photos Auto frame 上线 3D 视角重构功能,可自动调整照片拍摄角度

    Google 宣布将一种新的照片视角重构方法作为 Google Photos Auto frame 功能上线,用 ML 模型估计 3D 点图和相机参数,再由生成式扩散模型补全新视角下未拍摄到的区域。方法分 3D 场景与相机估计、生成式修补两阶段,可自动矫正广角前摄的透视畸变,对含人物的合格照片提供一键重构视角的备选结果。

    推荐理由:原文解释了将照片当作 3D 场景重建并重定位虚拟相机的两阶段方法,读者可以了解生成式修图与经典裁剪的区别。

3月5日周四
  1. Hugging Face Blog66

    Hugging Face 推出 Modular Diffusers,用可组合积木构建扩散流水线

    Hugging Face 发布 Modular Diffusers,将扩散流水线拆成文本编码、去噪、解码等可独立运行、自由增删互换的可复用块,作为现有 DiffusionPipeline 的灵活补充。

    推荐理由:原文展示了用可组合积木搭建扩散流水线的完整用法,包括自定义块、模块化仓库和 Mellon 可视化集成,方法可直接复用。

3月4日周三
2月27日周五
2月3日周二
12月24日周三
12月16日周二
11月25日周二
  1. Hugging Face Blog60

    Diffusers 支持 FLUX.2 图像生成

    Hugging Face 官方博客宣布 Diffusers 支持 FLUX.2,提供 Flux2Pipeline 和 Flux2Transformer2DModel 的完整加载与推理示例。

    推荐理由:官方博客给出 FLUX.2 在 Diffusers 中的完整推理代码和量化加载方式,读者可以直接照搬运行文生图流程。

11月20日周四
  1. Google DeepMind80

    Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image)图像生成与编辑模型

    Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image),基于 Gemini 3 Pro 的高保真图像生成与编辑模型,已开始在 Google AI Studio 和 Vertex AI 面向付费预览推出。

    推荐理由:官方发布文给出了模型能力细节、2K/4K 分辨率、接入渠道和定价定位,开发者可据此评估是否切换或叠加使用。

9月2日周二
  1. Hugging Face Blog64

    Hugging Face ZeroGPU Spaces 如何用 PyTorch 预编译提速图像视频生成

    Hugging Face 发文介绍如何在 ZeroGPU Spaces 中用 PyTorch ahead-of-time 编译优化生成式 demo,指出 torch.compile 与 ZeroGPU 短生命周期进程不兼容,需先导出再用 spaces.aoti_* API 编译加载。

    推荐理由:原文给出 ZeroGPU 上 AoT 编译的完整步骤和 FP8、动态形状等进阶技巧,读者可以直接迁移到自己的 Spaces demo。

8月19日周二
8月12日周二
8月1日周五
7月23日周三
  1. Hugging Face Blog67

    Hugging Face 详解如何用 Diffusers 和 PEFT 加速 Flux LoRA 推理

    Hugging Face 发布教程,介绍结合 Flash Attention 3、torch.compile 和 FP8 量化的 Flux.1-Dev LoRA 推理优化配方,在 H100 上相对基线取得 2.23x 加速,并支持 LoRA 热切换而不触发重编译。

    推荐理由:原文给出可直接复用的 LoRA 推理优化配方和 H100、RTX 4090 两套实测延迟数据,并说明热切换避免重编译的限制。

6月19日周四
  1. Hugging Face Blog63

    Hugging Face 教你用 QLoRA 在消费级显卡上微调 FLUX.1-dev

    Hugging Face 发布教程,展示用 QLoRA 配合 diffusers 在单张 GPU 上以约 9GB 峰值显存微调 FLUX.1-dev 学习 Alphonse Mucha 画风,700 步在 RTX 4090 上约 41 分钟完成,标准 BF16 LoRA 则需 26GB。

    推荐理由:官方博客给出完整的 QLoRA 微调配方和实测显存与耗时数据,方法可直接迁移到消费级显卡上的 FLUX.1-dev 定制训练。

5月21日周三
  1. Hugging Face Blog62

    Hugging Face Diffusers 量化后端实战:以 Flux-dev 为例对比 BnB、torchao、Quanto、GGUF 与 FP8

    Hugging Face 发布 Diffusers 量化后端解读文章,以 black-forest-labs/FLUX.1-dev 为例实测 bitsandbytes、torchao、Quanto、GGUF 和 FP8 Layerwise Casting 五种方案。

    推荐理由:文章系统对比了 Diffusers 各量化后端在 Flux-dev 上的内存、速度与画质差异,并给出选型建议和可复现代码。

4月23日周三
3月25日周二
  1. OpenAI News78

    OpenAI 发表 GPT-4o 图像生成系统卡附录

    OpenAI 发表 GPT-4o 系统卡附录,介绍 4o 图像生成,称其比此前 DALL·E 3 系列能力显著更强。它能生成照片级真实输出,并支持以图像作为输入进行转换。

    推荐理由:原文明确了 4o 图像生成相比 DALL·E 3 的能力跃升,读者可以据此判断它在生成与图像转换上的新定位。

2月24日周一
2月4日周二
1月31日周五
1月27日周一
1月16日周四
12月9日周一
10月23日周三
10月22日周二
7月30日周二
6月20日周四