跳到正文
原文
Hugging Face Blog·· 2024-05-14精选AI 评分69

Google 发布开源视觉语言模型 PaliGemma

PaliGemma – Google's Cutting-Edge Open Vision Language Model

AI 导读

Google 发布 PaliGemma 视觉语言模型系列,采用 SigLIP-So400m 图像编码器加 Gemma-2B 文本解码器的架构,提供 pt、mix、ft 三类checkpoint,支持 224x224、448x448、896x896 三种分辨率和 bfloat16、float16、float32 三种精度。

推荐理由

原文由官方介绍模型架构、三种checkpoint类型、基准分数和transformers推理微调用法,可作为上手PaliGemma的实用参考。

来源:Hugging Face Blog · huggingface.co