跳到正文

#开源生态

今日 2 条
9月16日周一
  1. Hugging Face Blog67

    HuggingChat 推出 Community Tools,可把任意 Space 变成模型可用工具

    Hugging Face 在 HuggingChat 上发布 Community Tools 功能,允许把任意公开 Space 转成模型可直接调用的工具,并借此扩展图像理解、视频生成和文本转语音等多模态能力。

    推荐理由:官方介绍了把任意 Space 转成 HuggingChat 工具的做法,覆盖创建、配置参数和打包进助手的完整流程,读者可以照着复用。

9月13日周五
9月4日周三
8月22日周四
  1. Hugging Face Blog64

    Hugging Face 五个常被忽视的实用工具详解

    Hugging Face 官方博客盘点 Hub 上五个常被忽视的工具:ZeroGPU(免费 A100 GPU,每工作负载 40GB vRAM)、多进程 Docker Space(用 supervisord)、Gradio API、Webhooks 和 Nomic Atlas 语义搜索。

    推荐理由:作者用免费语义搜索项目实际串起 ZeroGPU、多进程 Docker、Gradio API、Webhooks 和 Nomic Atlas 的用法,附可直接复用的代码示例。

8月19日周一
8月13日周二
  1. Hugging Face Blog56

    Hugging Face 发布 ggml 入门教程

    Hugging Face 发布 ggml 入门教程,介绍这个专注于 Transformer 推理的 C/C++ 开源机器学习库。教程讲解 ggml_context、ggml_cgraph、ggml_backend 等核心概念,给出在 Ubuntu 上编译运行矩阵乘法示例的完整步骤,并演示了使用 backend、打印计算图和导出 graphviz 格式的方法。

8月12日周一
  1. Hugging Face Blog61

    TII 发布首个无注意力 7B 强模型 Falcon Mamba

    阿布扎比 TII 基于 Mamba 架构发布开源模型 Falcon Mamba 7B,采用 TII Falcon Mamba 7B License 1.0,称在 LLM Leaderboard 两版基准上平均分领先多数同类 Transformer 与 SSM 模型。

    推荐理由:原文给出架构设计、训练数据和两版评测基准数字,读者可据此判断无注意力 7B 模型与主流 Transformer 的差距。

  2. Hugging Face Blog66

    Hugging Face 在 Transformers 中推出跨模型统一工具调用 API

    Hugging Face 宣布 Transformers 现已提供跨多个热门模型家族的统一工具调用 API,同一份代码可在 Mistral、Cohere、NousResearch 和 Llama 模型间基本无需修改地移植。

    推荐理由:原文给出统一工具调用 API 的设计思路和完整代码示例,开源开发者可以照搬接入多个模型家族。

8月8日周四
7月31日周三
  1. Hugging Face Blog68

    Google 发布 Gemma 2 2B、ShieldGemma 和 Gemma Scope

    Google 在 Gemma 2 发布一个月后推出三款新模型:2.6B 参数的 Gemma 2 2B(含 base 和 instruct 版本,适合端侧使用)、基于 Gemma 2 的安全分类器系列 ShieldGemma(2B/9B/27B)以及覆盖 Gemma 2 2B 和 9B 每一层的开源稀疏自编码器套件 Gemma Scope。

    推荐理由:原文详细给出 Gemma 2 2B 的端侧用法、辅助生成加速和两个配套工具的评测,对部署和模型解释研究都有可操作的参考价值。

7月23日周二
  1. Hugging Face Blog88

    Meta 发布 Llama 3.1(8B/70B/405B),支持 128K 上下文与多语言

    Meta 发布 Llama 3.1 系列,在 Hugging Face Hub 上线 8B、70B、405B 三个规模共 8 个开放权重模型,上下文长度提升至 128K tokens,支持 8 种语言和工具调用。

    推荐理由:官方发布说明覆盖了三个规模、内存需求和量化权重,读者可以据此选择适合自己硬件的部署与微调路径。

7月18日周四
  1. Mistral AI70

    Mistral 与 NVIDIA 联合发布 12B 开源模型 Mistral NeMo

    Mistral AI 与 NVIDIA 联合发布 12B 模型 Mistral NeMo,支持 128k 上下文窗口,以 Apache 2.0 许可发布 base 与 instruct 权重,官方称其推理、世界知识和编码精度在该规模中达到 SOTA,可作 Mistral 7B 的直接替代。

    推荐理由:官方原文给出 12B 规模、128k 上下文、Apache 2.0 权重和 Tekken 分词器的具体压缩数据,可据此评估其在 Mistral 7B 系统中的替换价值。

7月16日周二
  1. Mistral AI62

    Mistral 发布 Mamba 架构编码模型 Codestral Mamba

    Mistral AI 发布 Mamba 架构的 Codestral Mamba,在 Albert Gu 和 Tri Dao 协助下训练,具备线性时间推理和理论无限序列建模能力,已测试 256k token 的上下文检索,参数量 7,285,403,648。

    推荐理由:官方介绍了 Mamba 架构在线性推理和长序列上的特点、部署方式与许可证差异,读者可据此评估本地编码助手的可行性。

7月11日周四
7月10日周三
  1. Hugging Face Blog41

    Hugging Face 在 Dataset Hub 上试验基于 Presidio 的 PII 自动检测

    Hugging Face 正在 Dataset Hub 上试验一项新功能,使用开源 PII 检测工具 Presidio 自动生成数据集中个人身份信息(PII)的报告。报告可帮助开发者在训练前评估数据集的 PII 风险,也帮助数据集所有者在发布前验证其 PII 过滤流程。Hugging Face 还感谢法国 CNIL 在 GDPR 合规方面提供的指导。

7月9日周二
7月8日周一
6月27日周四
  1. Hugging Face Blog78

    Google 发布开源大语言模型 Gemma 2,Hugging Face 完成生态集成

    Google 发布开源大语言模型 Gemma 2,提供 9B 和 27B 两种参数规模,各有 base 与 instruction-tuned 版本,已上架 Hugging Face Hub。

    推荐理由:Hugging Face 官方介绍 Gemma 2 四个开放权重模型的技术细节与生态集成,并给出 transformers、TRL 微调和 Inference Endpoints 部署的可用方法。

6月25日周二
6月20日周四
6月19日周三
6月13日周四
6月12日周三
6月7日周五
6月5日周三
5月29日周三
5月28日周二
5月24日周五
5月21日周二
5月16日周四
5月14日周二
  1. Hugging Face Blog69

    Google 发布开源视觉语言模型 PaliGemma

    Google 发布 PaliGemma 视觉语言模型系列,采用 SigLIP-So400m 图像编码器加 Gemma-2B 文本解码器的架构,提供 pt、mix、ft 三类checkpoint,支持 224x224、448x448、896x896 三种分辨率和 bfloat16、float16、float32 三种精度。

    推荐理由:原文由官方介绍模型架构、三种checkpoint类型、基准分数和transformers推理微调用法,可作为上手PaliGemma的实用参考。