Hugging Face Blog·· 2024-05-14精选AI 评分69
Google 发布开源视觉语言模型 PaliGemma
PaliGemma – Google's Cutting-Edge Open Vision Language Model
AI 导读
Google 发布 PaliGemma 视觉语言模型系列,采用 SigLIP-So400m 图像编码器加 Gemma-2B 文本解码器的架构,提供 pt、mix、ft 三类checkpoint,支持 224x224、448x448、896x896 三种分辨率和 bfloat16、float16、float32 三种精度。
推荐理由
原文由官方介绍模型架构、三种checkpoint类型、基准分数和transformers推理微调用法,可作为上手PaliGemma的实用参考。
来源:Hugging Face Blog · huggingface.co