如何在 Hugging Face Endpoints 上运行隐私保护的 FHE 推理(Concrete ML 教程)
Zama 团队将其基于全同态加密(FHE)的隐私保护机器学习框架 Concrete ML 的预编译模型上线 Hugging Face Endpoints,用户可一键部署 FHE 友好模型(如加密垃圾邮件检测的决策树)并在加密数据上直接推理。
Zama 团队将其基于全同态加密(FHE)的隐私保护机器学习框架 Concrete ML 的预编译模型上线 Hugging Face Endpoints,用户可一键部署 FHE 友好模型(如加密垃圾邮件检测的决策树)并在加密数据上直接推理。
Hugging Face 发布通用多模态模型 Idefics2,参数量 8B,权重以 Apache 2.0 许可开源,支持任意图文序列输入,可回答图像问题、描述视觉内容、从文档提取信息和执行基础算术。
推荐理由:官方发布 8B 开源多模态模型并给出基准对比和训练数据,读者可以直接在 Hub 和 transformers 中上手微调。
Hugging Face 宣布在 Hub 上推出 Deploy on Google Cloud 集成,可将数千个基础模型通过 Vertex AI 或 GKE 部署到用户自己的 Google Cloud 账户中。
Google 与 Hugging Face 合作发布 CodeGemma,包含专注代码填充的 2B 基座、混合代码与自然语言的 7B 基座,以及 7B Instruct 对话版本,均支持 8K 上下文。
推荐理由:原文给出三个模型规格、基准对比与 FIM 提示词格式,读者可以据此选择适合延迟、显存或对话场景的版本。
Hugging Face 宣布与云安全公司 Wiz 合作,已集成 Wiz 用于漏洞管理和云安全态势管理,并自动修复 Spaces 中的问题。Wiz 研究人员通过 pickle 发现其沙箱计算环境的缺陷,相关漏洞已全部修复。官方建议用户在生产环境弃用 pickle、改用 Safetensors,并警告 pickle 未来可能不再受支持。
DuckDB-NSQL-7B 是 MotherDuck 和 Numbers Station 专为 DuckDB SQL 推出的 text2SQL 模型,基于 Meta 的 Llama-2-7b 微调,可生成包括 SELECT 在内的多种有效 DuckDB SQL 语句。
Hugging Face Hub 推出 Deploy on Cloudflare Workers AI 集成,将 Llama 2 7B、Gemma、Mistral 等热门开源模型以 serverless API 形式部署在 Cloudflare 边缘数据中心的 GPU 上,采用按请求付费模式。
开源人形机器人 Reachy 的开发商 Pollen Robotics 发布开源库 pollen-vision,提供面向机器人的零样本视觉模型统一接口,无需训练即可开箱使用。
Hugging Face 博客介绍 embedding 量化方法,展示二值量化可将内存与磁盘占用降至 1/32、检索最快提速 45x,配合 rescoring 可保留约 96% 的检索性能;int8 标量量化占用为 1/4、平均提速 3.66x。
推荐理由:原文给出 embedding 量化的原理、代码与实测数据,读者可以照此在检索场景中权衡内存、速度与精度。
Hugging Face 发布面向非技术读者的 Transformers 入门教程,手把手演示如何在 Hugging Face Space 的 JupyterLab notebook 中运行微软的 Phi-2 大语言模型。
Hugging Face 官方博客介绍 GaLore 如何利用梯度低秩结构降低训练内存,支持在 RTX 4090 等消费级 GPU 上预训练 Llama 架构 7B 模型。优化器状态内存可减少超过 82.5%,可与 8-bit 优化器结合,并支持通过 transformers>=4.39.0 和 galore-torch 使用 galore_adamw 等优化器及 _layerwise 逐层更新。
推荐理由:原文给出GaLore在消费级硬件上预训练7B模型的方法细节和Transformers接入方式,可迁移到实际训练工作流。
Hugging Face 发布 Cosmopedia,一个由 Mixtral-8x7B-Instruct-v0.1 生成的合成数据集,含超 3000 万文件、250 亿 token,旨在复现 Phi-1.5 的训练数据。
推荐理由:官方详解大规模预训练合成数据的构建流程,提示词策划、聚类与去污染方法均可迁移到类似的数据生成项目。
Hugging Face 教你在搭载 Intel Core Ultra 7 155H 的笔记本上本地运行 Microsoft Phi-2:用 Optimum Intel 集成的 OpenVINO 对模型权重做 4-bit 量化(80% 权重 4-bit、其余 8-bit),在 Meteor Lake 的 iGPU 上推理。
Hugging Face 推出 quanto,一个面向 Optimum 的 PyTorch 量化后端,支持 int2/int4/int8 和 float8 权重、int8 和 float8 激活,可在 CUDA、MPS 等任意设备上运行。
推荐理由:原文给出 Quanto 的量化能力边界、完整工作流和 transformers 集成方式,读者可直接照此把 float 模型转到低精度部署。
Hugging Face 发布开源数据集 WebSight,用于训练视觉语言模型将网页截图转换为 HTML 代码。其最新版 WebSight-v0.2 扩展至 200 万个样本,改用真实图像和 Tailwind CSS。基于该数据集微调的模型 Sightseer 可将截图转为可运行的 HTML,并能在生成代码中嵌入与原图相近的图像。
Argilla 与 Hugging Face 发起 Data is better together 实验,几天内吸引 350 位社区贡献者,完成超过 11,000 次提示词评分,并发布含 10,000 条带评分提示词的数据集 10k_prompts_ranked。
BigCode 发布 StarCoder2 系列开放代码模型,含 3B、7B、15B 三个规模,均基于新数据集 The Stack v2 训练,并同步开放模型、数据集及处理与训练代码。
推荐理由:官方完整披露三个模型规模、训练数据与开放范围,读者可据此评估开源代码模型的可复用程度。
Hugging Face 推出 TTS Arena,一个让任何人对比并投票评选 TTS 模型的社区平台,借鉴 LMSys 的 Chatbot Arena 模式。
Hugging Face 发文介绍 Matryoshka 嵌入模型,这种模型可产出多种维度的有用嵌入,将重要信息前置以便截断后仍保持性能。
推荐理由:原文讲清 Matryoshka 嵌入的训练与使用方法,并用对比实验说明截断到 8.3% 维度仍保留 98.37% 性能,方法可直接复用。
Hugging Face 发布 Gemma 模型微调教程,演示用 Transformers、PEFT 与 trl 的 SFTTrainer,通过 LoRA 和 4-bit QLoRA(bitsandbytes、nf4 量化)在 google/gemma-2b 上以 english_quotes 数据集训练模型按指定格式输出名言和作者。
推荐理由:Hugging Face 官方用 LoRA 和 4-bit QLoRA 给出 Gemma 微调的完整可复现代码,覆盖 GPU 和 TPU 两种路径。
Google 发布开源大语言模型家族 Gemma,包含 2B 与 7B 两种规模、各有 base 与 instruction-tuned 共四个模型,基于 Gemini 技术并支持 8K 上下文。
推荐理由:官方博客给出四个开源模型的尺寸、性能对比和 Hugging Face 生态集成方式,读者可据此评估部署与微调路径。
Upstage 于 2023 年 9 月在 Hugging Face 上推出 Open Ko-LLM Leaderboard,构建韩语 LLM 评估生态。该排行榜采用 Ko-MMLU、Ko-ARC、Ko-HellaSwag、Ko-Truthful QA、Ko-CommonGEN V2 五项韩语基准,并采用不公开的私有测试集以防污染。
Hugging Face 在 PEFT 中为 LoRA adapter 新增多種合并方法,可通过 add_weighted_adapter() 调用,包括 cat、linear、svd、ties、dare_linear、dare_ties、magnitude_prune 及其 svd 变体。
推荐理由:官方详细介绍 PEFT 新增的多种 LoRA 合并方法及代码示例,还给出不同场景下的实测选择建议,便于直接复用。
Hugging Face 发布教程,展示用 Mixtral-8x7B-Instruct-v0.1 生成合成数据,再通过 AutoTrain 微调 RoBERTa-base 做金融新闻情绪分类。
推荐理由:原文给出可复用的合成数据蒸馏流程和成本对比数字,读者可以照此把自己的分类任务从 LLM API 迁到专用小模型。
AMD 与 Hugging Face 联合推出 Pervasive AI Developer Contest,向全球开发者免费提供 AMD 硬件用于构建 AI 应用。
SegMoE 框架正式发布,可将多个预训练扩散模型合并为混合专家模型,已集成 Hugging Face diffusers 并以 Apache 2.0 开源。发布 SegMoE-2x1、SegMoE-4x2 和 SegMoE-SD4x2 三个模型,用户只需编写 config.yaml 运行命令即可在几分钟内创建自己的 MoE 模型。
推荐理由:官方介绍了 SegMoE 的 MoE 架构、三个已发布模型和自制方法,读者可以据此尝试组合预训练扩散模型。
Hugging Face 发布了用开源模型实现 Anthropic Constitutional AI 的端到端配方,并开源了基于 TGI 和 vLLM、在 Slurm 集群上做规模化合成数据生成的工具 llm-swarm。
推荐理由:原文给出了开源模型跑通 Constitutional AI 的完整配方与实验数据,读者可以照着复现自己的对齐流程。
Patronus 团队基于 Hugging Face Leaderboard Template 推出 Enterprise Scenarios Leaderboard。
Hugging Face 推出开源的 Hallucinations Leaderboard,通过上下文学习(in-context learning)在多个幻觉相关基准上评估大语言模型的可靠性。
Hugging Face 宣布与 Google Cloud 建立战略合作伙伴关系,围绕开放科学、开源和云硬件展开合作。
推荐理由:来自当事方官方公告,讲清了合作的四个方向和具体落地场景,读者可了解 Hugging Face 模型在 Google Cloud 上的可用路径。
Hugging Face 讲解 ReAct 智能体原理,并发布 ChatHuggingFace 封装让开源模型接入 LangChain。评测显示 Mixtral-8x7B 在含 HotpotQA、GSM8K、GAIA 子集的基准上超越 GPT-3.5,Zephyr-7b-beta 和 Llama2-70b 表现较差;团队建议针对函数调用微调 Mixtral 以冲击 GPT-4。
IBM Research 与 Hugging Face 合作,将轻量级时间序列模型 PatchTSMixer 开源发布至 Transformers 库。
Hugging Face 团队在 OpenHermes-2.5-Mistral-7B 和 Zephyr-7b-beta-sft 两个模型上,用 MT-Bench 实测了 DPO、IPO、KTO 三种无需强化学习的偏好对齐方法。
Vectara 基于开源的 Hugging Face leaderboard 模板发布了新的 HHEM 排行榜,用于评估 GPT-4、Google Gemini、Llama 2 等大语言模型在文档摘要中产生幻觉的频率。
Hugging Face 博客介绍社区开发的轻量微调库 Unsloth,与 Hub、transformers、PEFT、TRL 完全兼容,可配合 SFTTrainer、DPOTrainer、PPOTrainer 使用。
推荐理由:原文给出 Unsloth 与 TRL 的完整用法和 59 组基准数据,微调提速与显存收益可直接迁移到自己的 QLoRA 工作流。
Hugging Face 发布 MUSE 的开源复现 aMUSEd,一个基于 Masked Image Modeling 的非扩散文生图模型,以研究预览形式采用 OpenRAIL 许可发布。
Hugging Face 发布 SDXL Dreambooth LoRA 进阶训练社区指南,将 Replicate SDXL Cog trainer 的 Pivotal Tuning 与 Kohya trainer 使用的 Prodigy 优化器等多项优化组合,脚本已在 diffusers 开源并提供 Colab 与 Spaces 入口。
推荐理由:官方博客给出把 Pivotal Tuning 与 Prodigy 优化器组合进 SDXL Dreambooth LoRA 训练的完整做法与实验对比,参数可直接复用。
Hugging Face 发布 2023 年开源大语言模型年度回顾,指出开源模型可复现研究、便于社区参与和审查模型偏差,并通过复用 checkpoint 降低碳排放。
Mistral AI 发布 Mixtral 8x7B,一个采用 Apache 2.0 许可的开放权重稀疏混合专家模型(SMoE),在多数基准上超过 Llama 2 70B 且推理快 6 倍,多数标准基准上匹配或超越 GPT3.5。
推荐理由:官方给出稀疏专家架构的参数激活比例、基准对比与部署方案,为开源模型选型提供了具体的成本性能参考。
Mistral 发布 Mixtral 8x7B,一个采用 Mixture of Experts 架构的开放模型,在多数基准上超越 Llama 2 70B 并达到或超过 GPT-3.5,MT-Bench 得分 8.30。
推荐理由:Mixtral 8x7B 以 MoE 架构达到开放模型新高度,本文同时给出生态内的推理、量化、微调与部署路径,方法可直接照做。