Hugging Face 介绍二值与标量 Embedding 量化,显著加速检索并降低成本
Hugging Face 博客介绍 embedding 量化方法,展示二值量化可将内存与磁盘占用降至 1/32、检索最快提速 45x,配合 rescoring 可保留约 96% 的检索性能;int8 标量量化占用为 1/4、平均提速 3.66x。
推荐理由:原文给出 embedding 量化的原理、代码与实测数据,读者可以照此在检索场景中权衡内存、速度与精度。
Hugging Face 博客介绍 embedding 量化方法,展示二值量化可将内存与磁盘占用降至 1/32、检索最快提速 45x,配合 rescoring 可保留约 96% 的检索性能;int8 标量量化占用为 1/4、平均提速 3.66x。
推荐理由:原文给出 embedding 量化的原理、代码与实测数据,读者可以照此在检索场景中权衡内存、速度与精度。
Hugging Face 发布面向非技术读者的 Transformers 入门教程,手把手演示如何在 Hugging Face Space 的 JupyterLab notebook 中运行微软的 Phi-2 大语言模型。
Lighthouz AI 与 Hugging Face 合作推出 Chatbot Guardrails Arena,让用户与两个匿名、带 guardrails 的聊天机器人对话,尝试套取虚构银行 XYZ001 客户的姓名、SSN、账号、余额等敏感信息并投票,结果将以 Elo 评分汇入公开排行榜。
Hugging Face 官方博客介绍 GaLore 如何利用梯度低秩结构降低训练内存,支持在 RTX 4090 等消费级 GPU 上预训练 Llama 架构 7B 模型。优化器状态内存可减少超过 82.5%,可与 8-bit 优化器结合,并支持通过 transformers>=4.39.0 和 galore-torch 使用 galore_adamw 等优化器及 _layerwise 逐层更新。
推荐理由:原文给出GaLore在消费级硬件上预训练7B模型的方法细节和Transformers接入方式,可迁移到实际训练工作流。
Hugging Face 发布 Cosmopedia,一个由 Mixtral-8x7B-Instruct-v0.1 生成的合成数据集,含超 3000 万文件、250 亿 token,旨在复现 Phi-1.5 的训练数据。
推荐理由:官方详解大规模预训练合成数据的构建流程,提示词策划、聚类与去污染方法均可迁移到类似的数据生成项目。
Hugging Face 教你在搭载 Intel Core Ultra 7 155H 的笔记本上本地运行 Microsoft Phi-2:用 Optimum Intel 集成的 OpenVINO 对模型权重做 4-bit 量化(80% 权重 4-bit、其余 8-bit),在 Meteor Lake 的 iGPU 上推理。
Hugging Face 推出 quanto,一个面向 Optimum 的 PyTorch 量化后端,支持 int2/int4/int8 和 float8 权重、int8 和 float8 激活,可在 CUDA、MPS 等任意设备上运行。
推荐理由:原文给出 Quanto 的量化能力边界、完整工作流和 transformers 集成方式,读者可直接照此把 float 模型转到低精度部署。
Hugging Face 面向 Enterprise Hub 组织推出 Train on DGX Cloud 服务,基于 Hugging Face AutoTrain 提供无代码微调,支持在 NVIDIA DGX Cloud 上使用 H100 GPU(1x 到 8x 实例)。
Hugging Face 博客介绍如何用 Optimum Intel、Intel Neural Compressor 和 IPEX 将 BGE small/base/large 嵌入模型量化为 int8 并在 Intel Xeon 上加速。
Hugging Face 发布开源数据集 WebSight,用于训练视觉语言模型将网页截图转换为 HTML 代码。其最新版 WebSight-v0.2 扩展至 200 万个样本,改用真实图像和 Tailwind CSS。基于该数据集微调的模型 Sightseer 可将截图转为可运行的 HTML,并能在生成代码中嵌入与原图相近的图像。
Argilla 与 Hugging Face 发起 Data is better together 实验,几天内吸引 350 位社区贡献者,完成超过 11,000 次提示词评分,并发布含 10,000 条带评分提示词的数据集 10k_prompts_ranked。
Hugging Face 展示如何在 Intel Gaudi 2 AI 加速器上,用 Optimum Habana 和自定义 pipeline 类运行 Llama 2 系列(7b、13b、70b)进行文本生成,几行代码即可完成。
BigCode 发布 StarCoder2 系列开放代码模型,含 3B、7B、15B 三个规模,均基于新数据集 The Stack v2 训练,并同步开放模型、数据集及处理与训练代码。
推荐理由:官方完整披露三个模型规模、训练数据与开放范围,读者可据此评估开源代码模型的可复用程度。
Hugging Face 推出 TTS Arena,一个让任何人对比并投票评选 TTS 模型的社区平台,借鉴 LMSys 的 Chatbot Arena 模式。
Hugging Face 发布 AI 水印入门博客,讲解图像、文本和音频内容的加水印方法及优缺点。文中介绍生成时嵌入与生成后添加两大类方法、Nightshade 与 Glaze 等图像防滥用工具、基于红绿 token 的 LLM 文本水印,以及 AudioSeal 语音水印,并列出 Hub 上 IMATAG、Truepic 等相关工具,同时指出文本检测在文本较短或模型未知时可靠性有限。
Hugging Face 发文介绍 Matryoshka 嵌入模型,这种模型可产出多种维度的有用嵌入,将重要信息前置以便截断后仍保持性能。
推荐理由:原文讲清 Matryoshka 嵌入的训练与使用方法,并用对比实验说明截断到 8.3% 维度仍保留 98.37% 性能,方法可直接复用。
Hugging Face 发布 Gemma 模型微调教程,演示用 Transformers、PEFT 与 trl 的 SFTTrainer,通过 LoRA 和 4-bit QLoRA(bitsandbytes、nf4 量化)在 google/gemma-2b 上以 english_quotes 数据集训练模型按指定格式输出名言和作者。
推荐理由:Hugging Face 官方用 LoRA 和 4-bit QLoRA 给出 Gemma 微调的完整可复现代码,覆盖 GPU 和 TPU 两种路径。
Google 发布开源大语言模型家族 Gemma,包含 2B 与 7B 两种规模、各有 base 与 instruction-tuned 共四个模型,基于 Gemini 技术并支持 8K 上下文。
推荐理由:官方博客给出四个开源模型的尺寸、性能对比和 Hugging Face 生态集成方式,读者可据此评估部署与微调路径。
Upstage 于 2023 年 9 月在 Hugging Face 上推出 Open Ko-LLM Leaderboard,构建韩语 LLM 评估生态。该排行榜采用 Ko-MMLU、Ko-ARC、Ko-HellaSwag、Ko-Truthful QA、Ko-CommonGEN V2 五项韩语基准,并采用不公开的私有测试集以防污染。
Hugging Face 在 PEFT 中为 LoRA adapter 新增多種合并方法,可通过 add_weighted_adapter() 调用,包括 cat、linear、svd、ties、dare_linear、dare_ties、magnitude_prune 及其 svd 变体。
推荐理由:官方详细介绍 PEFT 新增的多种 LoRA 合并方法及代码示例,还给出不同场景下的实测选择建议,便于直接复用。
Hugging Face 发布教程,展示用 Mixtral-8x7B-Instruct-v0.1 生成合成数据,再通过 AutoTrain 微调 RoBERTa-base 做金融新闻情绪分类。
推荐理由:原文给出可复用的合成数据蒸馏流程和成本对比数字,读者可以照此把自己的分类任务从 LLM API 迁到专用小模型。
AMD 与 Hugging Face 联合推出 Pervasive AI Developer Contest,向全球开发者免费提供 AMD 硬件用于构建 AI 应用。
Hugging Face 在 TGI 1.4.0 版本和 Inference Endpoints 中推出 Messages API,兼容 OpenAI Chat Completion API,用户可无缝从 OpenAI 模型切换到开源 LLM。
推荐理由:原文给出 TGI Messages API 的兼容范围、参数限制和从 OpenAI 迁移到开源模型的具体做法,方便评估改造成本。
SegMoE 框架正式发布,可将多个预训练扩散模型合并为混合专家模型,已集成 Hugging Face diffusers 并以 Apache 2.0 开源。发布 SegMoE-2x1、SegMoE-4x2 和 SegMoE-SD4x2 三个模型,用户只需编写 config.yaml 运行命令即可在几分钟内创建自己的 MoE 模型。
推荐理由:官方介绍了 SegMoE 的 MoE 架构、三个已发布模型和自制方法,读者可以据此尝试组合预训练扩散模型。
密歇根大学和罗格斯大学研究团队推出 NPHardEval 排行榜,通过基于计算复杂度类的 900 道算法题(覆盖 P、NP-complete、NP-hard 共 9 种算法、10 个难度级别)评估 LLM 推理能力。
Hugging Face 发布了用开源模型实现 Anthropic Constitutional AI 的端到端配方,并开源了基于 TGI 和 vLLM、在 Slurm 集群上做规模化合成数据生成的工具 llm-swarm。
推荐理由:原文给出了开源模型跑通 Constitutional AI 的完整配方与实验数据,读者可以照着复现自己的对齐流程。
Hugging Face 发布 PatchTST 模型上手教程,演示其在 Electricity 数据集上的时间序列预测训练,以及在 ETTh1 数据集上的零样本迁移学习能力,再通过线性探测和微调验证目标域预测性能。
Hugging Face 宣布 Text Generation Inference(TGI)在 AWS Inferentia2 和 Amazon SageMaker 上正式可用,用于大规模部署和提供 LLM 生产级服务。
Patronus 团队基于 Hugging Face Leaderboard Template 推出 Enterprise Scenarios Leaderboard。
Hugging Face 联合 Intel 展示了在第四代 Xeon(借助 AMX 加速)上优化 StarCoder-15B 推理的方法,通过 SmoothQuant 实现 Q8 量化,TTFT 加速约 2.19x、TPOT 加速约 2.20x 且精度无损失;再结合 4bit 权重唯一量化和 assisted generation,实现超过 7x 的推理加速。
Hugging Face 推出开源的 Hallucinations Leaderboard,通过上下文学习(in-context learning)在多个幻觉相关基准上评估大语言模型的可靠性。
Secure Learning Lab 在 Hugging Face 上发布了新的 LLM Safety Leaderboard,专注于大语言模型安全评估,由 HF leaderboard template 驱动。
Hugging Face 宣布与 Google Cloud 建立战略合作伙伴关系,围绕开放科学、开源和云硬件展开合作。
推荐理由:来自当事方官方公告,讲清了合作的四个方向和具体落地场景,读者可了解 Hugging Face 模型在 Google Cloud 上的可用路径。
Hugging Face 讲解 ReAct 智能体原理,并发布 ChatHuggingFace 封装让开源模型接入 LangChain。评测显示 Mixtral-8x7B 在含 HotpotQA、GSM8K、GAIA 子集的基准上超越 GPT-3.5,Zephyr-7b-beta 和 Llama2-70b 表现较差;团队建议针对函数调用微调 Mixtral 以冲击 GPT-4。
Hugging Face 发布教程,演示如何用 facebook/w2v-bert-2.0 checkpoint 和 CTC 在 Common Voice 16.0 约 14 小时的蒙古语数据上微调 Wav2Vec2-BERT。
IBM Research 与 Hugging Face 合作,将轻量级时间序列模型 PatchTSMixer 开源发布至 Transformers 库。
Hugging Face 团队在 OpenHermes-2.5-Mistral-7B 和 Zephyr-7b-beta-sft 两个模型上,用 MT-Bench 实测了 DPO、IPO、KTO 三种无需强化学习的偏好对齐方法。
Hugging Face 与 ONNX Runtime 团队介绍用 Olive 优化的 SD Turbo 和 SDXL Turbo 模型,在 NVIDIA GPU 上用 ONNX Runtime CUDA 和 TensorRT 执行提供者加速推理。
Hugging Face 发布教程,讲解如何把 ComfyUI 工作流转换成 Gradio 应用并部署到 Spaces 的 ZeroGPU 免费推理。
推荐理由:原文给出从导出 ComfyUI 工作流到在 Spaces ZeroGPU 免费部署的完整步骤,含模型映射和代码改动细节,可迁移到自己的工作流。
Vectara 基于开源的 Hugging Face leaderboard 模板发布了新的 HHEM 排行榜,用于评估 GPT-4、Google Gemini、Llama 2 等大语言模型在文档摘要中产生幻觉的频率。