Hugging Face 介绍用 Mask2Former 与 OneFormer 实现通用图像分割
Hugging Face 发文介绍 Mask2Former 和 OneFormer 两个通用图像分割模型现已进入 transformers 库。
Hugging Face 发文介绍 Mask2Former 和 OneFormer 两个通用图像分割模型现已进入 transformers 库。
Hugging Face 发布 AI 游戏开发系列教程第 1 部分,目标是用 AI 工具在 5 天内完成一个可玩的农场游戏。
Hugging Face 发布教程,讲解如何用 🤗 transformers 运行零样本分割模型 CLIPSeg。
推荐理由:教程讲清了 CLIPSeg 的零样本分割原理、文本与图像两种提示用法及低分辨率局限,并给出在 Segments.ai 上精修标注的完整流程。
Hugging Face 联合 Apple 将 Stable Diffusion 权重转换为 Core ML 格式并上传 Hub,支持 v1.4、v1.5、v2 base 和 v2.1 base,可在 Apple Silicon 的 CPU、GPU 和 Neural Engine 上运行。
推荐理由:原文给出在 Apple Silicon 上用 Core ML 跑 Stable Diffusion 的转换与推理方法,包括 Python 和 Swift 两条路径及性能变体选择,可迁移到自己的工作流。
中科大与 Microsoft 开发的 VQ-Diffusion 是一个条件潜在扩散模型,其加噪与去噪过程在由离散向量组成的量化潜在空间上进行,现可通过 🧨 Diffusers 加载 microsoft/vq-diffusion-ithq 管线几行代码运行,支持 FP16 权重。
Hugging Face 联合 Jonathan Whitaker 推出的免费扩散模型课程将于 11 月 28 日发布,并定于 11 月 30 日举办社区直播活动。
Hugging Face 基于大量实验讲解如何用 🧨 Diffusers 的 train_dreambooth.py 微调 Stable Diffusion,并给出推荐设置:低学习率配合逐步增加步数,人脸训练约需 800-1200 步(batch size 2、LR 1e-6),训练人脸时应使用 prior preservation 防止过拟合。
推荐理由:Hugging Face 用多组实验给出 Dreambooth 微调 Stable Diffusion 的学习率、步数、先验保留等关键超参建议,可直接照做。
OpenAI 宣布 DALL·E API 进入公开测试,开发者即日起可以开始用它构建应用。
推荐理由:OpenAI 官方宣布 DALL·E API 进入公测,开发者可直接调用,适合想把它接入应用的开发者了解入口。
Diffusers 自 0.5.1 起支持 Flax,官方教程演示如何在 Google TPU 上用 FlaxStableDiffusionPipeline 运行 CompVis/stable-diffusion-v1-4 推理。
rinna 基于 Stable Diffusion 微调出日语文生图模型 Japanese Stable Diffusion,接受日语提示词并生成反映日语圈文化的图像。
OpenAI 宣布 DALL·E 取消候补名单,新用户可以立即开始创作。官方称部署中积累的经验和安全系统的改进使更大范围的开放成为可能。
Hugging Face 的零代码机器学习平台 AutoTrain 新增图像分类任务,用户无需写代码即可上传数据训练模型。AutoTrain 会自动尝试多个候选模型,演示项目中 5 个候选模型里最佳者达到 84% 准确率,表现差的会被自动停止以免浪费资源;使用 5 个候选模型和少于 500 张图像训练免费,训练好的模型可在 Hub 上通过 inference widget 直接试用。
Hugging Face 发布 diffusers 0.3,为 Stable Diffusion 新增图像到图像生成、Textual Inversion(3-5 张样本即可训练并分享概念,社区已贡献超 200 个概念)和实验性 inpainting 管线。
推荐理由:官方梳理 diffusers 0.3 的图生图、Textual Inversion、低显存优化等新能力,读者可以据此判断扩散模型工具链的可用性变化。
OpenAI 为 DALL·E 推出 outpainting 功能,可在原始图像之外继续生成内容,支持任意尺寸的图像扩展,帮助用户延展画面、讲述更完整的故事。
推荐理由:原文说明 DALL·E 的 outpainting 可让图像扩展到任意尺寸,读者可以据此判断它在图像创作流程中的用途。
Hugging Face 官方博客发布教程,展示如何用 🧨 Diffusers 库运行 Stable Diffusion v1-4 文生图模型,模型由 CompVis、Stability AI 和 LAION 基于 LAION-5B 子集的 512x512 图像训练。
推荐理由:官方教程从StableDiffusionPipeline基础用法讲到自定义推理管线,读者可以按步骤复现文生图并理解潜在扩散的三个组件。
OpenAI 宣布 DALL·E 进入 beta,未来几周将从等待名单中邀请 100 万人使用。用户每月可获得补充的免费 credits,并可按 115 次生成 15 美元的价格购买额外 credits。
推荐理由:官方公布了 DALL·E beta 的邀请规模和免费加付费的信用点定价方式,有助于了解早期图像生成产品的获取门槛。
OpenAI 实施了一项新技术,使 DALL·E 生成的人物图像更准确地反映世界人口的多样性,以此减少偏差、提升安全性。
在 DALL·E 2 研究预览阶段,来自 118 个国家和地区的 3000 多名艺术家已将 DALL·E 融入自己的创作流程。这些早期体验的艺术家帮助 OpenAI 发现了 DALL·E 的新用途,并在功能决策中发挥了重要作用。
OpenAI 公布为 DALL·E 2 设置的多项防护措施,以降低强大图像生成模型带来的风险。这些 guardrails 用于防止生成图像违反其内容政策,从而让 DALL·E 2 能面向更广泛的受众开放。
Hugging Face 发布教程,基于 Ho et al. 2020 的 DDPM 论文和 Phil Wang 的实现,用 PyTorch 逐步实现扩散模型。
推荐理由:逐行实现 Ho et al. 2020 的 DDPM,覆盖前向加噪、损失推导、U-Net 结构与采样训练全流程,便于动手理解扩散模型原理。
OpenAI 更新 DALL·E 2 研究预览:早期用户已生成超过 300 万张图片,并帮助改进了安全流程。OpenAI 将开始从等待名单中每周新增最多 1,000 名用户。
OpenAI 发布论文 Hierarchical text-conditional image generation with CLIP latents,介绍使用 CLIP latents 进行分层文本条件图像生成的方法。材料仅标题可用,正文未抓取到。
这是一篇 Hugging Face 教程,讲解如何用 🤗 datasets 加载图像分类数据集(示例为包含健康与病态豆叶的 beans 数据集,共 3 个类别),再用 🤗 transformers 微调预训练的 Vision Transformer(ViT)模型。
OpenAI 训练了名为 DALL·E 的神经网络,可从文本描述生成图像,覆盖自然语言可表达的广泛概念。
推荐理由:原文说明 DALL·E 能根据自然语言文本描述生成图像,是文本生成图像方向的早期代表工作。
OpenAI 发布 Image GPT,将与语言模型相同架构的 Transformer 训练在像素序列上,可生成连贯的图像补全和样本。研究建立了生成样本质量与图像分类精度之间的相关性,其最佳生成模型在无监督设置下提取的特征可与顶级卷积网络竞争。
OpenAI 在能量模型(EBM)的稳定、可扩展训练上取得进展,样本质量与泛化能力优于现有模型。EBM 生成时通过持续细化答案投入更多算力,在低温下可生成与 GAN 相当的样本,同时具备似然类模型的 mode 覆盖保证。
OpenAI 发布可逆生成模型 Glow,使用可逆 1x1 卷积,扩展并简化了此前可逆生成模型的工作。模型可生成真实的高分辨率图像,支持高效采样,并能发现可用于操纵数据属性的特征;OpenAI 同时开源模型代码并上线在线可视化工具。
OpenAI 介绍了四个围绕生成式模型开展的项目,生成式模型是机器学习中无监督学习的一个分支。文章同时讲解了生成式模型是什么、为何重要以及未来可能的发展方向。