使用 Hugging Face Dataset Viewer API 与 MotherDuck DuckDB-NSQL-7B 实现 Text2SQL
DuckDB-NSQL-7B 是 MotherDuck 和 Numbers Station 专为 DuckDB SQL 推出的 text2SQL 模型,基于 Meta 的 Llama-2-7b 微调,可生成包括 SELECT 在内的多种有效 DuckDB SQL 语句。
DuckDB-NSQL-7B 是 MotherDuck 和 Numbers Station 专为 DuckDB SQL 推出的 text2SQL 模型,基于 Meta 的 Llama-2-7b 微调,可生成包括 SELECT 在内的多种有效 DuckDB SQL 语句。
SetFit 是 Hugging Face 与 Intel Labs、UKP Lab 合作开发的少样本微调框架,在 Banking 77 数据集上,5-shot 表现优于 3-shot GPT-4,无需提示词且训练推理速度比 LLM 方法快一个数量级以上。
Hugging Face 博客介绍 embedding 量化方法,展示二值量化可将内存与磁盘占用降至 1/32、检索最快提速 45x,配合 rescoring 可保留约 96% 的检索性能;int8 标量量化占用为 1/4、平均提速 3.66x。
推荐理由:原文给出 embedding 量化的原理、代码与实测数据,读者可以照此在检索场景中权衡内存、速度与精度。
Hugging Face 发布面向非技术读者的 Transformers 入门教程,手把手演示如何在 Hugging Face Space 的 JupyterLab notebook 中运行微软的 Phi-2 大语言模型。
Hugging Face 官方博客介绍 GaLore 如何利用梯度低秩结构降低训练内存,支持在 RTX 4090 等消费级 GPU 上预训练 Llama 架构 7B 模型。优化器状态内存可减少超过 82.5%,可与 8-bit 优化器结合,并支持通过 transformers>=4.39.0 和 galore-torch 使用 galore_adamw 等优化器及 _layerwise 逐层更新。
推荐理由:原文给出GaLore在消费级硬件上预训练7B模型的方法细节和Transformers接入方式,可迁移到实际训练工作流。
Hugging Face 发布 Cosmopedia,一个由 Mixtral-8x7B-Instruct-v0.1 生成的合成数据集,含超 3000 万文件、250 亿 token,旨在复现 Phi-1.5 的训练数据。
推荐理由:官方详解大规模预训练合成数据的构建流程,提示词策划、聚类与去污染方法均可迁移到类似的数据生成项目。
Hugging Face 教你在搭载 Intel Core Ultra 7 155H 的笔记本上本地运行 Microsoft Phi-2:用 Optimum Intel 集成的 OpenVINO 对模型权重做 4-bit 量化(80% 权重 4-bit、其余 8-bit),在 Meteor Lake 的 iGPU 上推理。
Hugging Face 博客介绍如何用 Optimum Intel、Intel Neural Compressor 和 IPEX 将 BGE small/base/large 嵌入模型量化为 int8 并在 Intel Xeon 上加速。
Hugging Face 展示如何在 Intel Gaudi 2 AI 加速器上,用 Optimum Habana 和自定义 pipeline 类运行 Llama 2 系列(7b、13b、70b)进行文本生成,几行代码即可完成。
Hugging Face 发布 AI 水印入门博客,讲解图像、文本和音频内容的加水印方法及优缺点。文中介绍生成时嵌入与生成后添加两大类方法、Nightshade 与 Glaze 等图像防滥用工具、基于红绿 token 的 LLM 文本水印,以及 AudioSeal 语音水印,并列出 Hub 上 IMATAG、Truepic 等相关工具,同时指出文本检测在文本较短或模型未知时可靠性有限。
Hugging Face 发文介绍 Matryoshka 嵌入模型,这种模型可产出多种维度的有用嵌入,将重要信息前置以便截断后仍保持性能。
推荐理由:原文讲清 Matryoshka 嵌入的训练与使用方法,并用对比实验说明截断到 8.3% 维度仍保留 98.37% 性能,方法可直接复用。
Hugging Face 发布 Gemma 模型微调教程,演示用 Transformers、PEFT 与 trl 的 SFTTrainer,通过 LoRA 和 4-bit QLoRA(bitsandbytes、nf4 量化)在 google/gemma-2b 上以 english_quotes 数据集训练模型按指定格式输出名言和作者。
推荐理由:Hugging Face 官方用 LoRA 和 4-bit QLoRA 给出 Gemma 微调的完整可复现代码,覆盖 GPU 和 TPU 两种路径。
Hugging Face 发布教程,展示用 Mixtral-8x7B-Instruct-v0.1 生成合成数据,再通过 AutoTrain 微调 RoBERTa-base 做金融新闻情绪分类。
推荐理由:原文给出可复用的合成数据蒸馏流程和成本对比数字,读者可以照此把自己的分类任务从 LLM API 迁到专用小模型。
Hugging Face 发布了用开源模型实现 Anthropic Constitutional AI 的端到端配方,并开源了基于 TGI 和 vLLM、在 Slurm 集群上做规模化合成数据生成的工具 llm-swarm。
推荐理由:原文给出了开源模型跑通 Constitutional AI 的完整配方与实验数据,读者可以照着复现自己的对齐流程。
Hugging Face 发布 PatchTST 模型上手教程,演示其在 Electricity 数据集上的时间序列预测训练,以及在 ETTh1 数据集上的零样本迁移学习能力,再通过线性探测和微调验证目标域预测性能。
Hugging Face 宣布 Text Generation Inference(TGI)在 AWS Inferentia2 和 Amazon SageMaker 上正式可用,用于大规模部署和提供 LLM 生产级服务。
Hugging Face 联合 Intel 展示了在第四代 Xeon(借助 AMX 加速)上优化 StarCoder-15B 推理的方法,通过 SmoothQuant 实现 Q8 量化,TTFT 加速约 2.19x、TPOT 加速约 2.20x 且精度无损失;再结合 4bit 权重唯一量化和 assisted generation,实现超过 7x 的推理加速。
Hugging Face 讲解 ReAct 智能体原理,并发布 ChatHuggingFace 封装让开源模型接入 LangChain。评测显示 Mixtral-8x7B 在含 HotpotQA、GSM8K、GAIA 子集的基准上超越 GPT-3.5,Zephyr-7b-beta 和 Llama2-70b 表现较差;团队建议针对函数调用微调 Mixtral 以冲击 GPT-4。
Hugging Face 发布教程,演示如何用 facebook/w2v-bert-2.0 checkpoint 和 CTC 在 Common Voice 16.0 约 14 小时的蒙古语数据上微调 Wav2Vec2-BERT。
Hugging Face 与 ONNX Runtime 团队介绍用 Olive 优化的 SD Turbo 和 SDXL Turbo 模型,在 NVIDIA GPU 上用 ONNX Runtime CUDA 和 TensorRT 执行提供者加速推理。
Hugging Face 发布教程,讲解如何把 ComfyUI 工作流转换成 Gradio 应用并部署到 Spaces 的 ZeroGPU 免费推理。
推荐理由:原文给出从导出 ComfyUI 工作流到在 Spaces ZeroGPU 免费部署的完整步骤,含模型映射和代码改动细节,可迁移到自己的工作流。
Vectara 基于开源的 Hugging Face leaderboard 模板发布了新的 HHEM 排行榜,用于评估 GPT-4、Google Gemini、Llama 2 等大语言模型在文档摘要中产生幻觉的频率。
Hugging Face 博客介绍社区开发的轻量微调库 Unsloth,与 Hub、transformers、PEFT、TRL 完全兼容,可配合 SFTTrainer、DPOTrainer、PPOTrainer 使用。
推荐理由:原文给出 Unsloth 与 TRL 的完整用法和 59 组基准数据,微调提速与显存收益可直接迁移到自己的 QLoRA 工作流。
Hugging Face 发布 SDXL Dreambooth LoRA 进阶训练社区指南,将 Replicate SDXL Cog trainer 的 Pivotal Tuning 与 Kohya trainer 使用的 Prodigy 优化器等多项优化组合,脚本已在 diffusers 开源并提供 Colab 与 Spaces 入口。
推荐理由:官方博客给出把 Pivotal Tuning 与 Prodigy 优化器组合进 SDXL Dreambooth LoRA 训练的完整做法与实验对比,参数可直接复用。
Hugging Face 博客演示如何用 speculative decoding 将 Whisper 语音转录推理时间降低约 2 倍,同时从数学上保证输出与原模型完全一致。
推荐理由:原文给出了完整的 speculative decoding 原理和实测代码,读者可以直接把它作为 Whisper 推理加速的替换方案。
Hugging Face 发布长文系统讲解 MoE(专家混合)架构,以 Mixtral 8x7B 的走红为背景,覆盖稀疏层、路由、负载均衡、Switch Transformers 等核心内容。文章指出 MoE 相同参数量下推理更快、预训练更省算力,但需加载全部参数(Mixtral 8x7B 需按 47B 稠密模型准备显存),且微调更易过拟合,指令微调等新方向有望缓解这一短板。
推荐理由:这篇解读把 MoE 的结构、路由、负载均衡和微调取舍讲成一条完整脉络,读完能自己判断何时该选稀疏 MoE 而非稠密模型。
Intel Labs 与 Hugging Face 推出 SetFitABSA,一个无需提示词的少样本方面级情感分析(ABSA)框架。方法分三步:spaCy 抽取候选方面、SetFit 二分类筛选方面、第二个 SetFit 模型为每个方面标注情感极性;训练数据只需简单的 text/span/label/ordinal 表格格式。
Hugging Face 在 Inference API 中实现 LoRA 适配器动态加载/卸载,保持基础模型常驻,使 Hub 上公开 Diffusion 模型的 LoRA 推理大幅提速。
Hugging Face 博客用 LoRA 在灾难推文二分类任务上对比 RoBERTa-large、Llama-2-7b 和 Mistral 7B,均在单张 48GB A6000 上微调。
Hugging Face 宣布 🤗 optimum-neuron 已支持在 AWS Inferentia2 上部署 LLM 进行文本生成,并以 Llama 2 7B 和 13B 为例演示。
Hugging Face 发布教程,介绍如何用 Hugging Face GitHub 公共仓库代码微调 bigcode/starcoder (15.5B) 等模型,打造个人编程助手 HugCoder。
推荐理由:原文完整给出从数据采集到部署的微调流程,并附 QLoRA 与全量微调的成本和评测对比,方法可迁移到自有代码库。
Hugging Face 官方博客介绍如何用一行 spotlight.show(ds) 代码,通过 Renumics Spotlight 交互式可视化 datasets 库中的数据集,无需复制或预处理数据。
Hugging Face 发布技术博客,复现 OpenAI 2019 年 RLHF 代码库 openai/lm-human-preferences,在情感和描述性等风格任务上匹配了原始学习曲线,并整理出实现细节清单。
Hugging Face Diffusers 团队发文讲解如何优化 SDXL 的推理速度和内存占用,测试在 A100(40GB)上进行,每轮生成 4 张图取第 3 次结果。
推荐理由:官方在 A100 上实测了多种 SDXL 推理优化手段并附完整数据表,读者可以按自己的显存和延迟需求直接选用对应技巧。
Hugging Face 展示如何通过 Inference Endpoints 与 Text Embeddings Inference(TEI)部署开源嵌入模型,用于 RAG 等检索增强场景。
Hugging Face 宣布 Diffusers 现已支持通过 JAX 在 Cloud TPU 上部署 Stable Diffusion XL(SDXL),实现高性能、低成本的推理。
Hugging Face 发布教程,介绍如何 fork 并配置 AI Comic Factory,通过 Inference API 部署到自己的私有 Space,避免长时间排队。
Hugging Face 介绍了如何通过 TRL 库新增的 DDPOTrainer,用强化学习方法 DDPO 微调 Stable Diffusion,使输出更符合人类审美。
Hugging Face 发布面向非工程师的教程,用 Spaces、AutoTrain 和 ChatUI 三个工具,无需写代码即可微调 Llama 2 并部署聊天应用。教程分三步:创建 AutoTrain Space、用 Alpaca 指令数据集微调模型(示例用 7b 基座模型)、再用 ChatUI 模板部署成可分享的聊天应用。
Hugging Face 发布了一项针对 Llama 2 在 Amazon SageMaker 上部署的基准测试,分析了 60 种不同部署配置。测试覆盖 7B、13B、70B 三种参数规模,在 g5 与 p4d 系列 EC2 实例上,以 1/5/10/20 并发请求,比较有无 GPTQ 4-bit 量化的延迟与吞吐。