Google 基于 Gemini 构建 Fitbit 个人健康教练并开启公测
Google 推出由 Gemini 模型驱动的个人健康教练,从次日起向符合条件的美国 Fitbit Premium Android 用户开放自愿参与的公开预览,并将很快扩展到 iOS。系统采用多智能体框架(对话、数据科学、领域专家子智能体),基于 SHARP 评测框架进行验证,涉及超 100 万条人工标注和超 10 万小时专家评估。
Google 推出由 Gemini 模型驱动的个人健康教练,从次日起向符合条件的美国 Fitbit Premium Android 用户开放自愿参与的公开预览,并将很快扩展到 iOS。系统采用多智能体框架(对话、数据科学、领域专家子智能体),基于 SHARP 评测框架进行验证,涉及超 100 万条人工标注和超 10 万小时专家评估。
Google 发布 Google Earth AI 相关技术论文,介绍新的 Imagery 与 Population 基础模型,以及由 Gemini 驱动的 Geospatial Reasoning 智能体,用于多步地理空间问答。
推荐理由:官方同步放出技术论文和评测数字,读者可以据此了解跨模态地理空间推理的实际能力边界与应用案例。
Intel 与 Hugging Face 在 Google Cloud C4 VM(Intel Xeon 6,代号 Granite Rapids)上对开源 MoE 模型 GPT OSS 进行文本生成基准测试,结果显示相比上一代 C3 VM 实例 TCO 提升 1.7 倍。
BigCode 发布 BigCodeArena,一个通过真实执行来评判代码生成模型的人类投票平台,支持 10 种语言和 8 种执行环境,开放无需注册。上线 5 个月收集 14K 对话、4700+ 偏好投票,Elo 排名中 o3-mini 和 o1-mini 居首。
推荐理由:基于5个月社区执行评估数据发布代码生成评测平台,给出分语言和执行环境的模型表现差异与两个新基准。
Google 发布开源嵌入模型 EmbeddingGemma,308M 参数、2K 上下文窗口,支持超过 100 种语言,量化后内存占用低于 200 MB,适合端侧 RAG 和 Agent 场景。
推荐理由:官方博客给出架构、基准和各框架用法,还附完整微调示例,读者可以据此判断如何把它接入现有检索流程。
Hugging Face 发布开源基准 TimeScope,将约 5-10 秒的短视频"针"插入 1 分钟到 8 小时的基础视频中,评测局部检索、信息综合和细粒度时序感知三类能力。测试发现多数先进模型在真实时序任务上仍吃力,Gemini 2.5-Pro 是唯一在超过一小时视频上保持高准确率的模型,而扩大参数量并不能延长模型的有效时序范围。数据集、排行榜和 lmms-eval 评测框架均已开源。
Google Gemma 3n 正式开源,发布 E2B 和 E4B 两个尺寸、各含 base 与 instruct 版本,支持图像、文本、音频和视频输入。E2B/E4B 实际参数为 5B/8B,但借助 MatFormer 架构与 Per-Layer Embeddings,仅需 2GB/3GB GPU 内存即可运行,E4B 还在 LMArena 上取得 1300+ 分数。
推荐理由:原文给出模型的有效参数设计、显存需求和各开源库用法,端侧开发者可以据此选择部署方式。
Hugging Face 发布 nanoVLM,一个纯 PyTorch 的轻量工具包,可在免费 Colab 上启动视觉语言模型训练,灵感来自 Andrej Karpathy 的 nanoGPT。
推荐理由:原文拆解了 nanoVLM 的架构、训练与推理全流程,代码轻量可读,适合想从头理解 VLM 训练机制的读者上手实践。
Hugging Face 发布长文,回顾 2024 年 4 月以来视觉语言模型(VLM)的关键变化与趋势。
推荐理由:Hugging Face 系统梳理了过去一年 VLM 的新架构、多模态 RAG、智能体与安全模型,可作为领域入门与选型参考。
Google 发布 Gemma 3 系列开源模型,提供 1B/4B/12B/27B 四种尺寸,4B 及以上支持图文输入和 140+ 种语言,上下文窗口扩展到 128K(1B 为 32K)。
推荐理由:文章梳理了 Gemma 3 各尺寸能力变化并给出 transformers、llama.cpp、MLX 的推理用法,便于判断上手方式。
印度科学理工学院(IISc)与 ARTPARK 和 Hugging Face 合作,将开源多模态多语言数据集 Vaani 开放给全球开发者。
Google 发布 SigLIP 2 多语言视觉语言编码器家族,在 sigmoid 损失之上加入解码器、Global-Local 损失和 Masked Prediction 等训练目标。新模型在零样本分类、图文检索和为 VLM 提取视觉表征的迁移能力上全面超过旧版 SigLIP,并新增动态分辨率的 naflex 变体和 1B 参数的 Giant 系列,模型已在 Hugging Face 开放。
Google 发布 PaliGemma 2 mix 系列,这是在 PaliGemma 2 预训练模型基础上针对多种视觉语言任务微调的指令模型,基于 SigLIP 和 Gemma 2,提供 3B、10B、28B 三种规模。
Hugging Face Diffusers 团队发文综述当前开源视频生成模型现状,覆盖 CogVideoX、Mochi-1、HunyuanVideo、LTX Video 等模型及其高资源需求、泛化与延迟等局限。
推荐理由:Diffusers 团队原文梳理了开源视频生成模型现状,并给出实测内存数据和一套可复用的推理与微调优化方法。
Artificial Analysis 发布音频语言模型推理评测集 Big Bench Audio,从 Big Bench Hard 四个类别各选 250 题生成 1000 道音频题,并给出 GPT-4o 与 Gemini 1.5 系列在语音到语音、语音到文本、文本到语音、文本到文本四种配置下的 18 组实验结果。
Hugging Face 在 Google Cloud 两款 Xeon 实例上评测了 Agentic AI 的文本嵌入与文本生成两类负载。
Hugging Face 博客作者搭建了一个 Keras chatbot arena,用 Gradio、Spaces、JAX 和 TPU 测试 LLM 在对话中被指出错误后能否自行修复。
Google 发布视觉语言模型 PaliGemma 2,将 SigLIP 图像编码器与 Gemma 2 语言模型结合,提供 3B、10B、28B 三种规模,支持 224x224、448x448 和 896x896 三种输入分辨率。
推荐理由:Google 发布 PaliGemma 2 视觉语言模型,提供 3B、10B、28B 三种规模与多分辨率选择,并附 transformers 集成和微调脚本。
Hugging Face 与 Atla 推出 Judge Arena 平台,让用户对两个 LLM 评判模型在同一测试样本上的打分与理由进行投票,结果以 Elo 分数汇入每小时更新的公开排行榜。
Google DeepMind 与 Hugging Face 在 Transformers v4.46.0 中发布 SynthID Text,可通过 g-function 与 tournament sampling 为任意 LLM 的 model.generate() 输出添加人眼不可见的水印。
推荐理由:原文给出水印的实现方式、配置参数与检测训练流程,开发者可以据此把 SynthID Text 接入现有生成调用。
Hugging Face 发布 FineVideo 数据集,包含 43k 段视频共 3.4k 小时,附丰富描述、叙事细节、场景切分和 QA 对,并撰文披露完整构建流程。
这篇 Hugging Face 教程讲解如何在 Google Cloud A3 节点(8 x H100)上,用 TGI 的 Deep Learning Containers 在 Vertex AI 上部署 Meta Llama 3.1 405B 的 FP8 量化版 Meta-Llama-3.1-405B-Instruct-FP8。
Hugging Face 复现 Google 的 Infini-attention 论文后发现,压缩记忆次数越多,性能反而越差,90% 的时间花在调试收敛问题上。
Google 在 Gemma 2 发布一个月后推出三款新模型:2.6B 参数的 Gemma 2 2B(含 base 和 instruct 版本,适合端侧使用)、基于 Gemma 2 的安全分类器系列 ShieldGemma(2B/9B/27B)以及覆盖 Gemma 2 2B 和 9B 每一层的开源稀疏自编码器套件 Gemma Scope。
推荐理由:原文详细给出 Gemma 2 2B 的端侧用法、辅助生成加速和两个配套工具的评测,对部署和模型解释研究都有可操作的参考价值。
Hugging Face 宣布 Transformers 与 KerasHub 采用共享模型保存格式,KerasHub 现可直接加载 Hub 上 346,268 个 Transformers 库模型。
推荐理由:官方宣布 Transformers 与 KerasHub 共享模型保存格式,KerasHub 用户可直接加载 Hub 上 300K+ 模型并切换 TensorFlow、JAX 或 PyTorch 后端。
Hugging Face 宣布用户可在 Inference Endpoints 和 Spaces 上使用 Google Cloud TPU v5e 加速 AI 应用。
推荐理由:Hugging Face 官方宣布接入 Google TPU,给出了实例配置和价格,读者可据此评估推理部署的成本选项。
Google 发布开源大语言模型 Gemma 2,提供 9B 和 27B 两种参数规模,各有 base 与 instruction-tuned 版本,已上架 Hugging Face Hub。
推荐理由:Hugging Face 官方介绍 Gemma 2 四个开放权重模型的技术细节与生态集成,并给出 transformers、TRL 微调和 Inference Endpoints 部署的可用方法。
Google 发布 PaliGemma 视觉语言模型系列,采用 SigLIP-So400m 图像编码器加 Gemma-2B 文本解码器的架构,提供 pt、mix、ft 三类checkpoint,支持 224x224、448x448、896x896 三种分辨率和 bfloat16、float16、float32 三种精度。
推荐理由:原文由官方介绍模型架构、三种checkpoint类型、基准分数和transformers推理微调用法,可作为上手PaliGemma的实用参考。
Artificial Analysis 与 Hugging Face 合作上线 LLM Performance Leaderboard,覆盖 100 多个 serverless LLM API 端点的质量、价格与速度指标。
Hugging Face 宣布在 Hub 上推出 Deploy on Google Cloud 集成,可将数千个基础模型通过 Vertex AI 或 GKE 部署到用户自己的 Google Cloud 账户中。
Google 与 Hugging Face 合作发布 CodeGemma,包含专注代码填充的 2B 基座、混合代码与自然语言的 7B 基座,以及 7B Instruct 对话版本,均支持 8K 上下文。
推荐理由:原文给出三个模型规格、基准对比与 FIM 提示词格式,读者可以据此选择适合延迟、显存或对话场景的版本。
开源人形机器人 Reachy 的开发商 Pollen Robotics 发布开源库 pollen-vision,提供面向机器人的零样本视觉模型统一接口,无需训练即可开箱使用。
Hugging Face 发布 Gemma 模型微调教程,演示用 Transformers、PEFT 与 trl 的 SFTTrainer,通过 LoRA 和 4-bit QLoRA(bitsandbytes、nf4 量化)在 google/gemma-2b 上以 english_quotes 数据集训练模型按指定格式输出名言和作者。
推荐理由:Hugging Face 官方用 LoRA 和 4-bit QLoRA 给出 Gemma 微调的完整可复现代码,覆盖 GPU 和 TPU 两种路径。
Google 发布开源大语言模型家族 Gemma,包含 2B 与 7B 两种规模、各有 base 与 instruction-tuned 共四个模型,基于 Gemini 技术并支持 8K 上下文。
推荐理由:官方博客给出四个开源模型的尺寸、性能对比和 Hugging Face 生态集成方式,读者可据此评估部署与微调路径。
Hugging Face 宣布与 Google Cloud 建立战略合作伙伴关系,围绕开放科学、开源和云硬件展开合作。
推荐理由:来自当事方官方公告,讲清了合作的四个方向和具体落地场景,读者可了解 Hugging Face 模型在 Google Cloud 上的可用路径。
OpenAI 与 Anthropic、Google、Microsoft 共同宣布 Frontier Model Forum 的新任执行董事人选,并设立 1000 万美元的 AI 安全基金(AI Safety Fund)。该基金旨在支持 AI 安全领域相关工作,是四大公司推动前沿模型安全治理的最新举措。
Hugging Face 宣布 Diffusers 现已支持通过 JAX 在 Cloud TPU 上部署 Stable Diffusion XL(SDXL),实现高性能、低成本的推理。
Hugging Face 官方博客演示用 🧨 diffusers 在免费版 Google Colab(13GB CPU 内存、T4 15GB 显存)上运行 DeepFloyd 的开源文生图模型 IF,并支持图像变化和局部重绘。
推荐理由:官方博客给出在 13GB 内存免费 Colab 上跑通 40GB 参数 IF 的完整低显存方案,含可复用的代码和量化技巧。
Hugging Face 发布长文图解 RLHF,将其拆为预训练语言模型、训练奖励模型、用 PPO 微调三个核心步骤。文中说明人类偏好采用排序而非直接打分以降低噪声,奖励函数含 KL 惩罚以防止策略偏离初始模型,并介绍 TRL、TRLX、RL4LMs 等开源工具及代表性论文,同时指出人类标注成本高、标注者分歧等局限。
推荐理由:这篇官方长文把 RLHF 拆解为预训练、奖励模型和 PPO 微调三步,并梳理开源工具与关键论文,适合建立完整认知。
Diffusers 自 0.5.1 起支持 Flax,官方教程演示如何在 Google TPU 上用 FlaxStableDiffusionPipeline 运行 CompVis/stable-diffusion-v1-4 推理。