跳到正文

#部署/工程

今日 8 条
1月28日周二
  1. Hugging Face Blog67

    Hugging Face 在 Hub 推出 Inference Providers,集成 fal、Replicate、Sambanova、Together AI

    Hugging Face 在 Hub 模型页上线四家 serverless Inference Providers:fal、Replicate、Sambanova、Together AI,并集成 JS 和 Python SDK。调用分自定义 key 直连和由 HF 路由两种模式,路由请求按提供商标准费率计费、无额外加价,PRO 用户每月获 $2 推理额度。

    推荐理由:Hugging Face 官方宣布在 Hub 模型页集成四家 serverless 推理商,给出路由计费与 SDK 用法,读者可了解如何统一调用第三方推理。

1月27日周一
1月23日周四
1月22日周三
1月21日周二
1月16日周四
12月24日周二
  1. Hugging Face Blog69

    Hugging Face 教程:可视化并理解 PyTorch 训练中的 GPU 内存

    Hugging Face 发布教程,讲解如何用 torch.cuda.memory 快照工具可视化 PyTorch 训练各阶段的 GPU 内存占用。文章以 Qwen/Qwen2.5-1.5B 训练循环为例拆解参数、优化器状态、激活、梯度和优化器中间值的内存构成,并给出总内存估算公式与激活数量的线性启发式。

    推荐理由:原文用 PyTorch 内存快照工具拆解训练各阶段的显存构成,并给出可复用的总内存估算公式和启发式,便于读者定位显存瓶颈。

12月23日周一
  1. Hugging Face Blog63

    Hugging Face 博客详解如何用 NVIDIA LogitsProcessorZoo 控制大语言模型生成

    Hugging Face 博客介绍 NVIDIA 开源的 LogitsProcessorZoo,一组与 Transformers 的 generate 方法兼容的模块化 logits 处理器,通过直接修改输出概率分布来控制生成。

    推荐理由:原文给出四个 logits 处理器的参数、代码和实际输出对比,读者可以直接照着控制生成长度、引用、结尾短语和选择题格式。

12月17日周二
12月9日周一
12月5日周四
12月4日周三
11月26日周二
11月20日周三
11月7日周四
  1. Mistral AI44

    Mistral AI 发布内容审核 API,与 Le Chat 审核服务同源

    Mistral AI 发布内容审核 API,与 Le Chat 的审核服务使用同一 API。该模型是基于 LLM 的分类器,可将文本输入分为 9 个类别,提供原始文本和对话内容两个端点,原生支持阿拉伯语、中文、英语、法语等 11 种语言。API 可帮助用户针对具体应用场景定制安全标准,政策类别涵盖不合格建议和 PII 等模型生成危害。

10月29日周二
  1. Hugging Face Blog65

    Intel Labs 与 Hugging Face 推出 Universal Assisted Generation,跨模型家族加速解码 1.5x-2.0x

    Intel Labs 与 Hugging Face 推出 Universal Assisted Generation(UAG),通过双向 tokenizer 翻译让辅助生成不再要求目标模型与助手模型共享同一 tokenizer,可将任意 decoder 或 MoE 模型的推理加速 1.5x-2.0x 且几乎零开销。

    推荐理由:原文解释了跨 tokenizer 助手模型的实现原理并给出多组加速数据,还提供 Transformers 4.46.0 的可用代码。

10月23日周三
10月22日周二
  1. Hugging Face Blog46

    Outlines-core 0.1.0 发布:用 Rust 重写结构化生成核心算法

    dottxt 与 Hugging Face 合作推出 outlines-core 0.1.0,将 Outlines 结构化生成核心算法移植到 Rust 并提供 Python 绑定。索引编译速度平均提升 2x,且通过 Rust 提前编译消除了此前 Numba JIT 带来的首次运行延迟。该库轻量、关注点分离,未来可绑定到 Python 之外的语言,方便更多库集成结构化生成。

10月21日周一
10月16日周三
  1. Mistral AI60

    Mistral AI 发布 Ministral 3B 与 Ministral 8B 端侧模型

    Mistral AI 在 Mistral 7B 发布一周年之际推出端侧模型 Ministral 3B 和 Ministral 8B,主打设备端与边缘场景,官方称两者在 sub-10B 级别的知识、常识、推理、function-calling 和效率上达到新水平。

    推荐理由:官方公布了两个端侧模型的能力定位、上下文长度、API 定价与权重许可,读者可据此评估本地推理场景的选型。

10月10日周四
10月9日周三
10月8日周二
9月24日周二
9月20日周五
9月18日周三
9月13日周五
8月22日周四
  1. Hugging Face Blog64

    Hugging Face 五个常被忽视的实用工具详解

    Hugging Face 官方博客盘点 Hub 上五个常被忽视的工具:ZeroGPU(免费 A100 GPU,每工作负载 40GB vRAM)、多进程 Docker Space(用 supervisord)、Gradio API、Webhooks 和 Nomic Atlas 语义搜索。

    推荐理由:作者用免费语义搜索项目实际串起 ZeroGPU、多进程 Docker、Gradio API、Webhooks 和 Nomic Atlas 的用法,附可直接复用的代码示例。

8月21日周三
8月19日周一
8月13日周二
  1. Hugging Face Blog56

    Hugging Face 发布 ggml 入门教程

    Hugging Face 发布 ggml 入门教程,介绍这个专注于 Transformer 推理的 C/C++ 开源机器学习库。教程讲解 ggml_context、ggml_cgraph、ggml_backend 等核心概念,给出在 Ubuntu 上编译运行矩阵乘法示例的完整步骤,并演示了使用 backend、打印计算图和导出 graphviz 格式的方法。

8月8日周四
8月6日周二
7月30日周二
7月29日周一
7月23日周二
  1. Hugging Face Blog88

    Meta 发布 Llama 3.1(8B/70B/405B),支持 128K 上下文与多语言

    Meta 发布 Llama 3.1 系列,在 Hugging Face Hub 上线 8B、70B、405B 三个规模共 8 个开放权重模型,上下文长度提升至 128K tokens,支持 8 种语言和工具调用。

    推荐理由:官方发布说明覆盖了三个规模、内存需求和量化权重,读者可以据此选择适合自己硬件的部署与微调路径。

7月22日周一