Ideogram 发布 Ideogram 4.5 图像模型,主打局部编辑不影响画面其余部分
Ideogram 发布新模型 Ideogram 4.5,声称编辑图像局部时不会破坏其余部分,只改动用户指定的区域。模型提供四档质量,价格从每张 0.8 到 22 美分,均为原生 2K 分辨率,现已上线 Ideogram 平台和 API,合作方包括 Picsart、Runway、Pika 和 Leonardo AI,开源权重版本也将推出。
Ideogram 发布新模型 Ideogram 4.5,声称编辑图像局部时不会破坏其余部分,只改动用户指定的区域。模型提供四档质量,价格从每张 0.8 到 22 美分,均为原生 2K 分辨率,现已上线 Ideogram 平台和 API,合作方包括 Picsart、Runway、Pika 和 Leonardo AI,开源权重版本也将推出。
Google DeepMind 发布 Nano Banana 2 Lite(gemini-3.1-flash-lite-image)和 Gemini Omni Flash(gemini-omni-flash-preview)。
推荐理由:官方同时给出两款模型的定价、延迟数字和已知限制,开发者可以直接据此评估是否替换现有图像与视频工作流。
Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image),基于 Gemini 3 Pro 的新一代图像生成与编辑模型。
推荐理由:官方发布新图像模型,列出文本渲染、多语言、4K 分辨率等具体能力变化和各产品入口,读者可以对照评估使用方式。
Arm 发布面向图形与游戏开发的 AI 超分辨率方案 Neural Super Sampling(NSS),可在移动 GPU 的 Neural Accelerator 上实时运行。
OpenAI 发表 GPT-4o 系统卡附录,介绍 4o 图像生成,称其比此前 DALL·E 3 系列能力显著更强。它能生成照片级真实输出,并支持以图像作为输入进行转换。
推荐理由:原文明确了 4o 图像生成相比 DALL·E 3 的能力跃升,读者可以据此判断它在生成与图像转换上的新定位。
Stable Diffusion 3.5 Large 发布,提供 8B 基础版和 8B timestep-distilled 版两个 checkpoint,模型已在 Hugging Face Hub 开放并可在 🧨 Diffusers 中使用。
推荐理由:原文给出 Diffusers 中推理、量化加载和低显存训练 LoRA 的具体做法,读者可以直接照着在消费级硬件上使用 8B 模型。
Stable Diffusion 3 Medium(2B 参数)现已在 Hugging Face Hub 开放,可通过 🧨 Diffusers 使用,并附 DreamBooth 与 LoRA 训练脚本。
推荐理由:Hugging Face 官方讲解了 SD3 的 MMDiT 架构与 Diffusers 用法,附内存与性能优化数据,可直接迁移到自己的推理和微调流程。
SegMoE 框架正式发布,可将多个预训练扩散模型合并为混合专家模型,已集成 Hugging Face diffusers 并以 Apache 2.0 开源。发布 SegMoE-2x1、SegMoE-4x2 和 SegMoE-SD4x2 三个模型,用户只需编写 config.yaml 运行命令即可在几分钟内创建自己的 MoE 模型。
推荐理由:官方介绍了 SegMoE 的 MoE 架构、三个已发布模型和自制方法,读者可以据此尝试组合预训练扩散模型。
Hugging Face 发布 MUSE 的开源复现 aMUSEd,一个基于 Masked Image Modeling 的非扩散文生图模型,以研究预览形式采用 OpenRAIL 许可发布。
Hugging Face 发布 Würstchen,一种在高度压缩潜空间中工作的文生图扩散模型,实现 42x 空间压缩。生成速度明显快于 SDXL 且内存占用更低;Würstchen v2 训练用 24,602 GPU 小时,支持最高 1536 分辨率,已集成进 Diffusers,模型权重和 Demo 已在 Hub 上线。
推荐理由:42x 空间压缩带来的训练与推理成本对比有具体数字,适合想低成本跑文生图的读者参考。
Segmind 开源了通过 Block-removal 知识蒸馏训练的压缩版 Stable Diffusion 模型 SD-Small 和 SD-Tiny 的权重与训练代码,参数量分别比基础模型少 35% 和 55%,图像保真度相当。
Hugging Face 发文介绍 Mask2Former 和 OneFormer 两个通用图像分割模型现已进入 transformers 库。
rinna 基于 Stable Diffusion 微调出日语文生图模型 Japanese Stable Diffusion,接受日语提示词并生成反映日语圈文化的图像。
OpenAI 训练了名为 DALL·E 的神经网络,可从文本描述生成图像,覆盖自然语言可表达的广泛概念。
推荐理由:原文说明 DALL·E 能根据自然语言文本描述生成图像,是文本生成图像方向的早期代表工作。