跳到正文

#Hugging Face

今日 0 条
2月12日周三
2月11日周二
  1. Hugging Face Blog62

    Hugging Face Open R1 更新:发布 OpenR1-Math-220k 数学推理数据集

    Hugging Face Open R1 项目发布首个大规模数学推理数据集 OpenR1-Math-220k,在 512 张 H100 上用 DeepSeek R1 为 40 万道题生成 80 万条推理轨迹,经 Math Verify 和 Llama3.3-70B-Instruct 过滤后保留 22 万条正确轨迹。

    推荐理由:原文详述数学推理数据集的构建方法、过滤策略与消融结果,也覆盖社区在小样本微调和 CoT 长度控制上的进展。

2月10日周一
  1. Hugging Face Blog34

    Open Arabic LLM Leaderboard 2 发布

    Hugging Face 联合 2A2I、TII 推出的 Open Arabic LLM Leaderboard 即将升级为第二版。第一版上线不到 7 个月吸引超 46,000 访客、提交超 700 个模型(1B 至 70B+ 参数),覆盖 180 多个组织;其中 70% 以上为 chat 和微调模型,超 50% 的模型小于 7B。新版将针对社区反馈,加强阿拉伯语特定任务评测与基准透明度。

2月4日周二
  1. Hugging Face Blog66

    Hugging Face 24 小时开源复现 OpenAI Deep Research,GAIA 验证集达 55.15%

    Hugging Face 在 OpenAI 发布 Deep Research 后发起 24 小时复现任务,开源智能体框架并在 GAIA 验证集取得 55.15%,高于此前开源框架 SoTA Magentic-One 的约 46%。

    推荐理由:原文给出开源复现 Deep Research 的具体架构与 GAIA 得分对比,读者可迁移其 CodeAgent 方法到自己的智能体系统。

2月2日周日
1月31日周五
1月30日周四
1月28日周二
  1. Hugging Face Blog67

    Hugging Face 在 Hub 推出 Inference Providers,集成 fal、Replicate、Sambanova、Together AI

    Hugging Face 在 Hub 模型页上线四家 serverless Inference Providers:fal、Replicate、Sambanova、Together AI,并集成 JS 和 Python SDK。调用分自定义 key 直连和由 HF 路由两种模式,路由请求按提供商标准费率计费、无额外加价,PRO 用户每月获 $2 推理额度。

    推荐理由:Hugging Face 官方宣布在 Hub 模型页集成四家 serverless 推理商,给出路由计费与 SDK 用法,读者可了解如何统一调用第三方推理。

  2. Hugging Face Blog57

    Hugging Face 启动 Open-R1 项目,系统复现 DeepSeek-R1 训练流程

    Hugging Face 发布博客宣布启动 Open-R1 项目,目标是在开放环境下重建 DeepSeek-R1 的数据与训练流程。博客解释了 DeepSeek-R1 基于DeepSeek-V3 的两阶段训练方法,包括 R1-Zero 用 GRPO 纯强化学习训练和 R1 的冷启动微调加多轮 RL 提炼,并指出 DeepSeek 未公开训练数据、训练代码和超参数细节。

1月27日周一
1月24日周五
  1. Hugging Face Blog61

    smolagents 新增视觉支持,可原生接入视觉语言模型构建浏览器智能体

    Hugging Face 为 smolagents 加入视觉支持,使视觉语言模型可原生用于智能体流程。图像可在 agent.run 启动时传入,也可通过 step_callbacks 在每步动态写入 ActionStep 的 observations_images。

    推荐理由:官方详解视觉语言模型如何接入 smolagents 智能体流程,并给出可复用的截图回调和浏览器智能体完整代码。

1月23日周四
1月22日周三
1月16日周四
1月15日周三
  1. Hugging Face Blog67

    Hugging Face 用 Sentence Transformers 训练快 400 倍的静态嵌入模型并开源两个新模型

    Hugging Face 发布用 Sentence Transformers 训练静态嵌入模型的方法,新模型在 CPU 上比 all-mpnet-base-v2 等常见模型快 100 到 400 倍,同时保留至少 85% 的性能。

    推荐理由:原文完整公开了静态嵌入模型的训练配方、脚本和数据集清单,并给出与主流模型的性能对比,可复用于低成本嵌入场景。

1月13日周一
  1. Hugging Face Blog46

    AI 智能体已经到来,下一步怎么办?

    Hugging Face 概述了 AI 智能体的定义,并分析了其伦理权衡。文章提出,智能体的风险随自主性水平上升:用户让渡的控制越多,安全、隐私等风险越大,并建议不要开发能编写和执行自身代码的完全自主智能体,而半自主智能体的收益可能大于风险。

1月10日周五
1月9日周四
12月31日周二
  1. Hugging Face Blog75

    Hugging Face 发布 smolagents:用代码写动作的轻量智能体库

    Hugging Face 发布 smolagents,一个约几千行代码的极简智能体库,支持以代码形式编写动作的 CodeAgent,可通过 E2B 沙箱安全执行,并保留传统 JSON 调用的 ToolCallingAgent。

    推荐理由:官方发布并给出代码示例与基准对比,读者可以了解用代码写动作的智能体库如何上手以及何时该用智能体。

12月24日周二
  1. Hugging Face Blog69

    Hugging Face 教程:可视化并理解 PyTorch 训练中的 GPU 内存

    Hugging Face 发布教程,讲解如何用 torch.cuda.memory 快照工具可视化 PyTorch 训练各阶段的 GPU 内存占用。文章以 Qwen/Qwen2.5-1.5B 训练循环为例拆解参数、优化器状态、激活、梯度和优化器中间值的内存构成,并给出总内存估算公式与激活数量的线性启发式。

    推荐理由:原文用 PyTorch 内存快照工具拆解训练各阶段的显存构成,并给出可复用的总内存估算公式和启发式,便于读者定位显存瓶颈。

12月23日周一
  1. Hugging Face Blog63

    Hugging Face 博客详解如何用 NVIDIA LogitsProcessorZoo 控制大语言模型生成

    Hugging Face 博客介绍 NVIDIA 开源的 LogitsProcessorZoo,一组与 Transformers 的 generate 方法兼容的模块化 logits 处理器,通过直接修改输出概率分布来控制生成。

    推荐理由:原文给出四个 logits 处理器的参数、代码和实际输出对比,读者可以直接照着控制生成长度、引用、结尾短语和选择题格式。

12月19日周四
12月18日周三
12月17日周二
12月16日周一
  1. Hugging Face Blog66

    Hugging Face 发布 Synthetic Data Generator,用自然语言生成自定义数据集

    Hugging Face 发布 Synthetic Data Generator,一款无代码应用,通过三步流程(描述数据集、配置微调、生成推送)用 LLM 从自定义提示词生成数据集,底层由 distilabel 和免费 Hugging Face 文本生成 API 驱动。

    推荐理由:官方介绍这款无代码合成数据工具的完整流程与可配置项,读者可据此判断能否用自然语言快速搭建数据集和模型。

12月10日周二
12月9日周一
12月5日周四
  1. Hugging Face Blog62

    Google 发布视觉语言模型 PaliGemma 2,含 3B、10B、28B 三种规模

    Google 发布视觉语言模型 PaliGemma 2,将 SigLIP 图像编码器与 Gemma 2 语言模型结合,提供 3B、10B、28B 三种规模,支持 224x224、448x448 和 896x896 三种输入分辨率。

    推荐理由:Google 发布 PaliGemma 2 视觉语言模型,提供 3B、10B、28B 三种规模与多分辨率选择,并附 transformers 集成和微调脚本。

12月4日周三
  1. Hugging Face Blog30

    用 3C3H 重新思考 LLM 评测:AraGen 基准与排行榜

    Hugging Face 发布面向阿拉伯语 LLM 的生成式评测基准与排行榜 AraGen,并推出新的 NLG 评测指标 3C3H。3C3H 基于 LLM-as-judge,从正确性、完整性、简洁性、有用性、诚实性与无害性六个维度评估模型回答,兼顾事实性与可用性。排行榜采用动态评测:数据集和评测代码先私有盲测三个月,到期后公开并更换新数据集,以缓解数据污染问题。

12月3日周二
12月2日周一
11月26日周二