最新精选
第 161–180 条 · 共 226 条- Hugging Face Blog精选AI 评分6868
Hugging Face 发布 SDXL Dreambooth LoRA 进阶训练社区指南,将 Replicate SDXL Cog trainer 的 Pivotal Tuning 与 Kohya trainer 使用的 Prodigy 优化器等多项优化组合,脚本已在 diffusers 开源并提供 Colab 与 Spaces 入口。
推荐理由:官方博客给出把 Pivotal Tuning 与 Prodigy 优化器组合进 SDXL Dreambooth LoRA 训练的完整做法与实验对比,参数可直接复用。
- Hugging Face Blog精选AI 评分6666
Hugging Face 博客演示如何用 speculative decoding 将 Whisper 语音转录推理时间降低约 2 倍,同时从数学上保证输出与原模型完全一致。
推荐理由:原文给出了完整的 speculative decoding 原理和实测代码,读者可以直接把它作为 Whisper 推理加速的替换方案。
- Hugging Face Blog精选AI 评分6666
Hugging Face 发布长文系统讲解 MoE(专家混合)架构,以 Mixtral 8x7B 的走红为背景,覆盖稀疏层、路由、负载均衡、Switch Transformers 等核心内容。文章指出 MoE 相同参数量下推理更快、预训练更省算力,但需加载全部参数(Mixtral 8x7B 需按 47B 稠密模型准备显存),且微调更易过拟合,指令微调等新方向有望缓解这一短板。
推荐理由:这篇解读把 MoE 的结构、路由、负载均衡和微调取舍讲成一条完整脉络,读完能自己判断何时该选稀疏 MoE 而非稠密模型。
- Hugging Face Blog精选AI 评分8080
Hugging Face 与 LCM 团队发布 LCM LoRA,通过训练少量 LoRA 适配层而非完整蒸馏模型,让 Stable Diffusion 和 SDXL 的推理步数从 25-50 步降到 4-8 步。
推荐理由:LCM LoRA 只训练少量适配层就能让任意 SDXL 微调模型 4 步出图,文中给出 diffusers 代码和多硬件基准,方法可直接复用。
- Hugging Face Blog精选AI 评分6666
Hugging Face 发布教程,介绍如何用 Hugging Face GitHub 公共仓库代码微调 bigcode/starcoder (15.5B) 等模型,打造个人编程助手 HugCoder。
推荐理由:原文完整给出从数据采集到部署的微调流程,并附 QLoRA 与全量微调的成本和评测对比,方法可迁移到自有代码库。
- Hugging Face Blog精选AI 评分6666
Hugging Face Diffusers 团队发文讲解如何优化 SDXL 的推理速度和内存占用,测试在 A100(40GB)上进行,每轮生成 4 张图取第 3 次结果。
推荐理由:官方在 A100 上实测了多种 SDXL 推理优化手段并附完整数据表,读者可以按自己的显存和延迟需求直接选用对应技巧。
- Hugging Face Blog精选AI 评分6262
Hugging Face 推出 @gradio/lite,通过 Pyodide 让 Gradio 应用直接在浏览器中运行,无需服务器端基础设施。开发者在 HTML 中引入 JS/CSS 并在 <gradio-lite> 标签内写 Python 代码即可,支持 <gradio-file> 多文件和 <gradio-requirements> 通过 micropip 安装依赖。
推荐理由:原文给出完整的上手代码和依赖、加载时间等限制说明,读者可直接照做评估浏览器端部署是否适合自己。
- Hugging Face Blog精选AI 评分7878
Hugging Face 宣布 tokenizers 新增 chat_template 属性,用于保存模型训练时的对话格式,避免因格式不匹配导致难以察觉的性能严重下降。
推荐理由:原文指出对话格式不匹配会导致静默性能下降,并给出将 Jinja 聊天模板随 tokenizer 保存和使用的具体做法。
- Hugging Face Blog精选AI 评分6767
Hugging Face 官方博客系统讲解 LLM 推理优化的三类技术:8-bit/4-bit 量化、Flash Attention 注意力算法,以及 RoPE、ALiBi、MQA、GQA 等架构改进。
推荐理由:Hugging Face 官方以实测代码系统讲解量化、Flash Attention 与模型架构三类 LLM 推理优化方法,可迁移到部署实践。
- Hugging Face Blog精选AI 评分6565
Hugging Face 发布 Würstchen,一种在高度压缩潜空间中工作的文生图扩散模型,实现 42x 空间压缩。生成速度明显快于 SDXL 且内存占用更低;Würstchen v2 训练用 24,602 GPU 小时,支持最高 1536 分辨率,已集成进 Diffusers,模型权重和 Demo 已在 Hub 上线。
推荐理由:42x 空间压缩带来的训练与推理成本对比有具体数字,适合想低成本跑文生图的读者参考。
- Hugging Face Blog精选AI 评分6161
Hugging Face Diffusers 团队与 T2I-Adapter 作者合作,为 Stable Diffusion XL 推出 T2I-Adapter 支持,并发布 sketch、canny、lineart、depth、openpose 五种条件的 checkpoints。
推荐理由:原文给出 T2I-Adapter-SDXL 与 ControlNet 的参数量对比、训练配置和完整用法代码,读者可以据此评估并直接上手使用。
- Hugging Face Blog精选AI 评分7171
TII 发布 Falcon 180B,为当时最大的开放语言模型,拥有 1800 亿参数,使用 RefinedWeb 数据集在 3.5 万亿 token 上完成预训练。
推荐理由:原文给出了参数量、训练规模、评测对比和完整部署硬件门槛,读者可以据此评估是否在自己的场景中采用这个开源模型。
- Hugging Face Blog精选AI 评分6767
Hugging Face 官方教程讲解如何在 🧨 Diffusers 中运行 AudioLDM 2 文生音频管线,并通过 Flash Attention、float16 半精度、torch.compile 编译 UNet、切换 DPMSolverMultistepScheduler 将 10 秒音频的生成时间从约 14 秒降到 1 秒以内,且音质几乎不降。
推荐理由:官方教程给出四种可复用的推理优化方法,把 10 秒音频的生成时间从约 14 秒压到 1 秒以内,可直接迁移到自己的管线。
- Hugging Face Blog精选AI 评分8383
Hugging Face 发布 Code Llama 系列开源代码模型集成,含 7B、13B、34B 三种规格,基于 Llama 2 在 500B token 代码数据上训练,提供 Python 特化版和指令微调版。
推荐理由:官方完整介绍了模型规格、上下文扩展原理和生态接入方式,读者可以直接据此选择规格并上手部署使用。
- Hugging Face Blog精选AI 评分7474
Hugging Face 宣布将 AutoGPTQ 库集成进 Transformers,用户可用 GPTQ 算法以 8、4、3 或 2-bit 精度量化和运行模型,4-bit 量化精度损失可忽略,小 batch 下推理速度接近 fp16 基线。
推荐理由:官方宣布 AutoGPTQ 集成进 Transformers,读者可据此了解 4-bit 量化 LLM 的内存收益、用法与局限。
- Hugging Face Blog精选AI 评分7171
Hugging Face 发布开源视觉语言模型 IDEFICS,是 DeepMind 未公开的 Flamingo 的开放复现,接受任意图像和文本序列输入并生成文本,在多个图像文本理解基准上与原闭源模型表现相当。
推荐理由:原文说明了 IDEFICS 基于 Flamingo 的复现路线、参数规模与完全公开数据的训练方式,适合关注开源多模态模型生态的读者。
- Hugging Face Blog精选AI 评分6565
Hugging Face 发布 swift-transformers 等 alpha 工具,帮助 Swift 开发者在 Apple 设备上用 Core ML 运行 Llama 2 等语言模型。
推荐理由:官方一手发布了在 Apple 设备上跑 LLM 的 Swift 工具链,并给出 Core ML 转换、优化和已知坑的实操经验。
- Hugging Face Blog精选AI 评分6767
Hugging Face 官方博客介绍 TRL 库新支持的 DPO 方法,无需奖励模型和 RL 步骤即可直接在偏好数据上优化语言模型。
推荐理由:原文提供了从 SFT 到 DPO 微调 Llama v2 的完整代码与训练脚本,读者可复用到自己的数据集上。
- Hugging Face Blog精选AI 评分7474
Apple 与 Hugging Face 将 Stable Diffusion XL 移植到 Core ML,发布完整 pipeline 和 mixed-bit palettization 量化版本,UNet 以平均 4.5 位压缩后体积从 4.8GB 降至 1.4GB(减少 71%)。
推荐理由:原文给出 Stable Diffusion XL 在 Mac 上的 Core ML 移植细节、压缩到 4.5 位后体积从 4.8GB 降到 1.4GB 的数据,以及可复用的混合位宽量化方法。
- Hugging Face Blog精选AI 评分9191
Meta 发布 Llama 2 系列开放模型,包含 7B、13B、70B 预训练及微调版本,采用可商用的 Llama 2 许可证,Hugging Face 同步完成集成并上线全部 12 个模型。
推荐理由:官方完整梳理了 Llama 2 的许可、规格与 HF 生态推理微调路径,读者可据此快速上手开源替代方案。