Kakao Brain 联合 Hugging Face 发布 ViT 和 ALIGN 开源模型及 COYO-700M 数据集
Kakao Brain 与 Hugging Face 发布开源图像文本数据集 COYO-700M,以及基于它训练的 ViT 和 ALIGN 模型,其中 ALIGN 为首个开源版本。
Kakao Brain 与 Hugging Face 发布开源图像文本数据集 COYO-700M,以及基于它训练的 ViT 和 ALIGN 模型,其中 ALIGN 为首个开源版本。
Hugging Face 发布教程,介绍如何在 Diffusers 中通过 StableDiffusionControlNetPipeline 使用 ControlNet,支持 canny 边缘、OpenPose 姿态等 8 种空间条件控制 Stable Diffusion 生成,并可组合多个条件或与 DreamBooth 微调结合。
推荐理由:原文给出 ControlNet 在 Diffusers 中的完整用法和加速省显存配置,读者可以照搬代码在 Colab 上复现同样的生成效果。
Hugging Face 博客复盘志愿者团队在 2023 年 2 月土耳其地震后开发 afetharita 应用的过程:用 easyocr 加微调 NER 模型从求助推文截图提取姓名、电话和地址,用 bert-base-turkish 系列微调文本分类模型识别庇护、食物、物流等需求,并将地址经地理编码 API 显示在地图上。
Hugging Face 为 Diffusers 库发布伦理框架,以透明、一致、简洁、可及、可复现、责任六项价值观指导维护者对社区贡献的技术决策。
Witty Works 在 Hugging Face 专家加速计划支持下,将写作助手从基于 spaCy 的语言学特征方案升级为上下文相关的非包容性词汇分类器。专家团队建议采用 Sentence Transformers 架构和 SetFit 少样本微调库,每个特定词仅需 15-20 个标注句子即可达到可用精度,省去大量标注成本。
红队测试是一种激发 LLM 漏洞、诱导其生成有害内容的评估方法,与自然语言提示形式的越狱(jailbreaking)同义,区别于人类不可读的对抗性攻击。文中以 GPT3 的性别歧视与偏见输出、Tay 和 Sydney 聊天机器人事故为例,并提到可用 GeDi、PPLM 引导 GPT3 生成,对经 RLHF 或 SFT 安全微调的模型则需角色扮演等攻击手段。
Hugging Face 发布 Diffusers for Mac 1.1,这是一款基于 Core ML 的开源原生 Mac 文生图应用,文生图速度最高可提升至两倍。
消费返利公司 Fetch(月活用户超 1800 万)在 AWS 与 Hugging Face Expert Acceleration Program 支持下,从第三方方案转向自建 AI 工具处理用户上传的小票。
Hugging Face 宣布与 AWS 扩大长期战略合作,Hugging Face 将 AWS 作为首选云提供商,开发者可通过 Amazon SageMaker、AWS Trainium、AWS Inferentia 等工具在 AWS 上训练、微调和部署模型。双方称此举旨在让生成式 AI 模型更易获取,降低成本,帮助社区将最新研究转化为开放可复现的模型。
Hugging Face 发布教程,介绍 Salesforce Research 的 BLIP-2 模型已登陆 Transformers 库,并演示零样本图像描述、提示式图像描述、视觉问答和对话式提示四类用法。
推荐理由:文章拆解了 BLIP-2 的 Q-Former 架构和两阶段预训练方法,并给出在 Transformers 中跑通图生文、VQA 和对话提示的完整代码。
作者团队将原本跑在 AWS ECS + Fargate 上的 CPU 推理模型迁移到 Hugging Face Inference Endpoints,流程从七步简化为三步。实测中 RoBERTa 文本分类模型在 large 端点延迟约 80ms,比自建容器快一倍以上;成本增加 24% 到 50%(大型实例约每月多 $60),但省去了 API 和容器维护的时间成本。
Hugging Face 发布 🤗 PEFT 库,集成于 Transformers 与 Accelerate,支持 LoRA、Prefix Tuning、P-Tuning、Prompt Tuning 等参数高效微调方法。
推荐理由:官方介绍 PEFT 库的原理与用法,读者可以据此了解只用少量可训练参数微调大模型的可行路径。
Hugging Face 宣布微软亚洲研究院的 SpeechT5 已在 🤗 Transformers 中可用,官方 checkpoint 发布在 Hub 上。
Hugging Face 推出开源工具 AI vs. AI,托管在 Spaces 上,通过持续对战和 ELO 排名(初始分 1200,胜方 +10 / 负方 -10)对多智能体强化学习模型做相对评估。
Hugging Face 测试了 Intel Sapphire Rapids(r7iz.16xlarge)与 Ice Lake(c6i.16xlarge)服务器在 NLP 推理上的表现。
Hugging Face 撰文介绍视觉-语言(vision-language)联合模型,以 OpenAI 的 CLIP 等为代表,这类模型可处理图像与自然语言文本,擅长图像描述、视觉问答、文本引导图像生成等任务。
Hugging Face 过去一年在计算机视觉领域持续投入,Hub 上现已支持 8 个核心视觉任务、超过 3000 个模型和 100 多个数据集,每个任务至少提供 10 个模型检查点。
Hugging Face 宣布 diffusers 正式支持用 LoRA 对 Stable Diffusion 做全量微调和 Dreambooth 训练。
推荐理由:Hugging Face 官方介绍 diffusers 支持 LoRA 微调 Stable Diffusion,给出训练脚本、显存需求和推理加载流程,方法可直接复现。
Hugging Face 与 Microsoft ONNX Runtime 团队合作,通过 Optimum 库的 ORTTrainer API 为 Transformer 模型训练加速,配合 DeepSpeed ZeRO Stage 1 在单台 8 卡 Nvidia A100 节点上测得 39% 到 130% 的加速。
Hugging Face 发布博客,系统梳理让对话智能体有用的关键技术 RLHF、IFT、SFT、CoT 与红队测试,并对比 LaMDA、BlenderBot 3、Sparrow、InstructGPT 与 Anthropic Assistant 的训练数据、模型规模与评估标准。文章指出指令微调所需数据远小于预训练,CoT 微调能提升逐步推理任务表现并减少对敏感话题的回避。
推荐理由:文章系统梳理了 RLHF、IFT、SFT、CoT 等技术如何让对话智能体有用,并对比主流模型差异。
在「AI 做游戏开发」系列第 3 天,作者探讨用 AI 生成 3D 资产,结论是目前 text-to-3D 尚无法实际用于游戏开发。文中盘点 DreamFusion、Point-E、CLIP-Forge、Dream Textures 等最新进展,指出基于 NeRF 的视图合成转出的 mesh 仍需大量后期处理才能 game-ready。
Hugging Face 发文介绍 Mask2Former 和 OneFormer 两个通用图像分割模型现已进入 transformers 库。
Hugging Face 与 PaddlePaddle 达成开源合作,PaddleNLP 将率先接入,其各模态模型库将逐步集成到 Hub 上。
Hugging Face 官方博客发布教程,讲解如何用 Transformers 和 Datasets 构建图像相似度系统:用 nateraw/vit-base-beans checkpoint 提取图像嵌入向量,通过余弦相似度在 beans 数据集 100 个候选样本中检索与查询图最相似的 Top 5。
这是 Hugging Face「AI for Game Development」系列第 2 部分,讲如何用 ChatGPT 辅助游戏设计:作者让 ChatGPT 以专业游戏设计师身份给出农场游戏的关键功能建议(作物多样性、进度系统、动态环境、社交多人、故事主题),并在 5 天开发周期内对前两点做了 gray-box 实现。
Hugging Face 发布图机器学习入门教程,讲解图的基本概念、表示方法及应用任务,涵盖图级、节点级、边级和子图级任务,如 AlphaFold 的节点属性预测和推荐系统中的缺失边预测。文章依次介绍从前神经网络方法到图神经网络(GNN)的学习方式,并简要探讨面向图的 Transformer,聚焦同质图,区分 transductive 与 inductive 两种设置。
Hugging Face 发布 AI 游戏开发系列教程第 1 部分,目标是用 AI 工具在 5 天内完成一个可玩的农场游戏。
Hugging Face 发布教程,介绍如何用 Intel 第四代 Xeon(Sapphire Rapids)CPU 集群在 AWS 上加速 PyTorch 训练。
推荐理由:原文给出在 Intel Sapphire Rapids CPU 集群上做分布式训练的完整步骤和实测数据,读者可以照搬这套方法。
Hugging Face 发布教程,讲解如何用 🤗 transformers 运行零样本分割模型 CLIPSeg。
推荐理由:教程讲清了 CLIPSeg 的零样本分割原理、文本与图像两种提示用法及低分辨率局限,并给出在 Segments.ai 上精修标注的完整流程。
Hugging Face 发布 Model Card Creator 工具、更新版模型卡模板及指南手册,让用户无需编程即可创建模型卡。本次发布还包括标注版模板、Hugging Face 内部用户研究,以及模型文档现状的文献综述。团队未来计划将 Evaluate on the Hub 等工具的自动评估结果导入模型卡工作流。
Hugging Face 伦理与社会团队发文探讨机器学习中的偏见问题,指出 ML 模型作为社会技术系统会放大会加剧不公的社会趋势,且随部署环境不断演变,任何单一技术手段都难以解决。文章分享了在任务定义、数据集构建和模型训练各阶段应对偏见的经验,并介绍了团队开发的相关分析工具。
Hugging Face 发布音频数据集完整指南,演示用 🤗 Datasets 库一行 Python 代码加载和预处理音频数据集。
Habana Gaudi2 在训练和推理上的速度约为 Nvidia A100 80GB 的两倍。BERT 预训练中,Gaudi2 用时 2 小时 55 分钟,相比第一代 Gaudi 的 8 小时 53 分钟实现 x3.04 加速。
借助新发布的 Bumblebee 库——纯 Elixir 实现的 Hugging Face Transformers,GPT2 到 Stable Diffusion 等神经网络模型已可在 Elixir 中运行。
Hugging Face 发布面向生物学家和机器学习从业者的蛋白质深度学习入门文章,讲解 BERT、GPT 等大语言模型背后的迁移学习原理如何应用于蛋白质研究。文章回顾了 2018 年 ULMFiT 和 BERT 开创预训练范式的过程,并配套提供蛋白质语言模型微调与 ESMFold 蛋白质折叠的示例 notebook(PyTorch 与 TensorFlow 版)。
Hugging Face 联合 Apple 将 Stable Diffusion 权重转换为 Core ML 格式并上传 Hub,支持 v1.4、v1.5、v2 base 和 v2.1 base,可在 Apple Silicon 的 CPU、GPU 和 Neural Engine 上运行。
推荐理由:原文给出在 Apple Silicon 上用 Core ML 跑 Stable Diffusion 的转换与推理方法,包括 Python 和 Swift 两条路径及性能变体选择,可迁移到自己的工作流。
Hugging Face 发布教程,讲解如何用 🤗 Transformers 库的 Time Series Transformer 从零训练单变量概率时间序列预测模型,并使用 tourism_monthly 数据集(澳大利亚 366 个地区的月度旅游量)。
中科大与 Microsoft 开发的 VQ-Diffusion 是一个条件潜在扩散模型,其加噪与去噪过程在由离散向量组成的量化潜在空间上进行,现可通过 🧨 Diffusers 加载 microsoft/vq-diffusion-ithq 管线几行代码运行,支持 FP16 权重。
Hugging Face 宣布启动 2023 年实习计划,开放多个岗位:Open Source 团队的 Accelerate 实习和 Text to Speech 实习。
Hugging Face 联合 Jonathan Whitaker 推出的免费扩散模型课程将于 11 月 28 日发布,并定于 11 月 30 日举办社区直播活动。