跳到正文

#Google

今日 3 条
12月17日周二
12月5日周四
  1. Hugging Face Blog62

    Google 发布视觉语言模型 PaliGemma 2,含 3B、10B、28B 三种规模

    Google 发布视觉语言模型 PaliGemma 2,将 SigLIP 图像编码器与 Gemma 2 语言模型结合,提供 3B、10B、28B 三种规模,支持 224x224、448x448 和 896x896 三种输入分辨率。

    推荐理由:Google 发布 PaliGemma 2 视觉语言模型,提供 3B、10B、28B 三种规模与多分辨率选择,并附 transformers 集成和微调脚本。

11月19日周二
10月23日周三
  1. Hugging Face Blog68

    Google DeepMind 与 Hugging Face 在 Transformers v4.46.0 中推出 SynthID Text 文本水印

    Google DeepMind 与 Hugging Face 在 Transformers v4.46.0 中发布 SynthID Text,可通过 g-function 与 tournament sampling 为任意 LLM 的 model.generate() 输出添加人眼不可见的水印。

    推荐理由:原文给出水印的实现方式、配置参数与检测训练流程,开发者可以据此把 SynthID Text 接入现有生成调用。

9月23日周一
8月19日周一
8月14日周三
7月31日周三
  1. Hugging Face Blog68

    Google 发布 Gemma 2 2B、ShieldGemma 和 Gemma Scope

    Google 在 Gemma 2 发布一个月后推出三款新模型:2.6B 参数的 Gemma 2 2B(含 base 和 instruct 版本,适合端侧使用)、基于 Gemma 2 的安全分类器系列 ShieldGemma(2B/9B/27B)以及覆盖 Gemma 2 2B 和 9B 每一层的开源稀疏自编码器套件 Gemma Scope。

    推荐理由:原文详细给出 Gemma 2 2B 的端侧用法、辅助生成加速和两个配套工具的评测,对部署和模型解释研究都有可操作的参考价值。

7月10日周三
7月9日周二
6月27日周四
  1. Hugging Face Blog78

    Google 发布开源大语言模型 Gemma 2,Hugging Face 完成生态集成

    Google 发布开源大语言模型 Gemma 2,提供 9B 和 27B 两种参数规模,各有 base 与 instruction-tuned 版本,已上架 Hugging Face Hub。

    推荐理由:Hugging Face 官方介绍 Gemma 2 四个开放权重模型的技术细节与生态集成,并给出 transformers、TRL 微调和 Inference Endpoints 部署的可用方法。

5月14日周二
  1. Hugging Face Blog69

    Google 发布开源视觉语言模型 PaliGemma

    Google 发布 PaliGemma 视觉语言模型系列,采用 SigLIP-So400m 图像编码器加 Gemma-2B 文本解码器的架构,提供 pt、mix、ft 三类checkpoint,支持 224x224、448x448、896x896 三种分辨率和 bfloat16、float16、float32 三种精度。

    推荐理由:原文由官方介绍模型架构、三种checkpoint类型、基准分数和transformers推理微调用法,可作为上手PaliGemma的实用参考。

5月3日周五
4月10日周三
4月9日周二
3月25日周一
1月25日周四
10月3日周二
4月26日周三
  1. Hugging Face Blog65

    如何在免费版 Google Colab 上用 🧨 diffusers 运行 DeepFloyd IF 文生图模型

    Hugging Face 官方博客演示用 🧨 diffusers 在免费版 Google Colab(13GB CPU 内存、T4 15GB 显存)上运行 DeepFloyd 的开源文生图模型 IF,并支持图像变化和局部重绘。

    推荐理由:官方博客给出在 13GB 内存免费 Colab 上跑通 40GB 参数 IF 的完整低显存方案,含可复用的代码和量化技巧。

12月9日周五
  1. Hugging Face Blog64

    Hugging Face 图解 RLHF:用人类反馈强化学习微调语言模型的完整流程

    Hugging Face 发布长文图解 RLHF,将其拆为预训练语言模型、训练奖励模型、用 PPO 微调三个核心步骤。文中说明人类偏好采用排序而非直接打分以降低噪声,奖励函数含 KL 惩罚以防止策略偏离初始模型,并介绍 TRL、TRLX、RL4LMs 等开源工具及代表性论文,同时指出人类标注成本高、标注者分歧等局限。

    推荐理由:这篇官方长文把 RLHF 拆解为预训练、奖励模型和 PPO 微调三步,并梳理开源工具与关键论文,适合建立完整认知。

10月13日周四
8月19日周五
8月11日周四
7月25日周一
3月23日周三
3月2日周三
2月11日周五
12月15日周三
  1. Hugging Face Blog47

    Perceiver IO:可扩展的全注意力模型,可处理任意模态

    Hugging Face 将 Perceiver IO 加入 Transformers 库,这是首个能处理文本、图像、音频、视频、点云等多种模态及其组合的 Transformer 神经网络。该模型在 256 或 512 个 latent 变量上执行自注意力,使计算量与输入大小呈线性关系而非平方依赖。官方提供了预测光流和图像分类的 Spaces 示例及多个 notebook。

10月25日周一
2月9日周二
3月6日周三
6月21日周二