跳到正文

全部动态

今日 5 条
4月10日周五
4月9日周四
  1. Hugging Face Blog65

    Overworld 发布实时视频世界模型 Waypoint-1.5,消费级 GPU 可本地运行

    Overworld 发布实时视频世界模型 Waypoint-1.5,权重已上传 Hugging Face。在 RTX 3090 至 5090 桌面硬件上可实时生成最高 720p、60 FPS 的交互环境,另提供面向游戏笔记本等更广消费级硬件的 360p 档位,Apple Silicon 支持即将推出。

    推荐理由:原文给出两档模型的具体硬件门槛、帧率分辨率和约百倍数据训练规模,读者可据此判断自己的设备能否本地运行。

  2. Hugging Face Blog71

    Sentence Transformers v5.4 发布,支持文本、图像、音频和视频的多模态嵌入与重排

    Hugging Face 发布 Sentence Transformers v5.4,用户可用同一套 API 对文本、图像、音频和视频进行嵌入编码与相关性重排。

    推荐理由:官方教程给出 v5.4 多模态嵌入与重排的完整用法、代码示例和支持模型清单,读者可以直接照着搭建跨模态检索或 RAG 流程。

4月8日周三
4月6日周一
4月3日周五
  1. Google DeepMind79

    Google DeepMind 发布 Gemma 4 开源模型,E2B/E4B/26B MoE/31B 四尺寸

    Google DeepMind 发布 Gemma 4 开源模型,基于 Gemini 3 技术,主打高级推理和智能体工作流。提供 E2B、E4B、26B MoE(推理时仅激活 3.8B 参数)和 31B Dense 四种尺寸,31B 在 Arena AI 文本排行榜上位列全球开源模型第 3,采用 Apache 2.0 许可,支持 128K-256K 上下文窗口、原生多模态和 140+ 语言。

    推荐理由:原文给出了四个尺寸、基准排名和部署细节,读者可以据此判断在本地和端侧硬件上的可用性。

4月2日周四
  1. OpenAI News43

    OpenAI 收购 TBPN

    OpenAI 宣布收购科技媒体 TBPN,以加速全球范围内围绕 AI 的对话并支持独立媒体,拓展与开发者、企业及更广泛科技社区的交流。

  2. Hugging Face Blog82

    Google DeepMind 发布 Gemma 4 多模态模型系列并登陆 Hugging Face

    Google DeepMind 发布 Gemma 4 多模态模型系列,共五个尺寸(E2B、E4B、12B Unified、31B、26B A4B MoE),采用 Apache 2.0 许可,支持图像、文本和音频输入,上下文窗口最高 256K。

    推荐理由:Hugging Face 官方详解 Gemma 4 架构、多模态能力与全生态部署方式,还覆盖 DiffusionGemma 和推理加速等上手细节。

4月1日周三
  1. Hugging Face Blog62

    TII 发布 Falcon Perception 0.6B 早融合感知模型及 0.3B Falcon OCR

    TII Falcon Vision 团队发布 Falcon Perception,一个 0.6B 参数的早融合 Transformer,用混合注意力掩码处理图像块与文本,做自然语言提示的开放词汇定位与分割,在 SA-Co 上达到 68.0 Macro-F1(SAM 3 为 62.3),但在 presence calibration 上落后(MCC 0.64 vs 0.82)。

    推荐理由:TII 自述用单一早融合 Transformer 做开放词汇感知,读者可以看到架构、数据配方和 SA-Co 与 PBench 上的具体对比依据。

  2. Hugging Face Blog66

    Gradio 推出 gradio.Server,支持任意自定义前端搭配 Gradio 后端

    Hugging Face 发布 gradio.Server,一个扩展自 FastAPI 的类,让开发者用 React、Svelte 或原生 HTML/JS 等任意前端框架,同时保留 Gradio 的排队、并发管理、SSE 流式、gradio_client 兼容和 Spaces 上的 ZeroGPU 支持。

    推荐理由:官方介绍了 gradio.Server 如何让任意自定义前端继续复用 Gradio 的排队、MCP 和 ZeroGPU 能力,并附完整代码示例。

3月31日周二
  1. OpenAI News74

    OpenAI 完成 1220 亿美元新一轮融资

    OpenAI 宣布获得 1220 亿美元新融资,用于在全球扩展前沿 AI、投资下一代算力,并满足 ChatGPT、Codex 和企业 AI 日益增长的需求。

    推荐理由:OpenAI 官方公布融资规模和三项资金投向,读者可以据此了解其下一步资源布局。

  2. Hugging Face Blog32

    OpenMed 用 165 美元跨 25 物种训练 mRNA 语言模型

    OpenMed 构建了覆盖结构预测、序列设计与密码子优化的端到端蛋白质 AI 流水线。在对比多种 transformer 架构后,CodonRoBERTa-large-v2 胜出,困惑度 4.10、Spearman CAI 相关性 0.40,显著超过 ModernBERT;团队随后扩展到 25 个物种,用 55 GPU 小时训练了 4 个生产模型,建立了其他开源项目没有的物种条件化系统。

3月30日周一
3月29日周日
  1. Google DeepMind60

    Google DeepMind 探索 AI 指针,将指向交互带入 Chrome 与 Googlebook

    Google DeepMind 发布由 Gemini 驱动的 AI 指针实验项目,提出维持心流、展示即告知、善用 this/that、把像素变成可操作实体四项交互原则,让用户通过指向和语音代替复杂提示词。

    推荐理由:原文给出了AI指针的四项交互原则和落地场景,读者可以据此了解指向加语音如何替代复杂提示词。

3月28日周六
3月27日周五
3月26日周四
  1. Google DeepMind66

    Google DeepMind 发布 Gemini 3.1 Flash Live 语音模型

    Google DeepMind 发布实时语音模型 Gemini 3.1 Flash Live,称其为迄今最高质量的音频模型,延迟更低、对话更自然。在 ComplexFuncBench Audio 上得分 90.8%,在开启 thinking 的 Scale AI Audio MultiChallenge 上得分 36.1%,均领先前代模型。

    推荐理由:官方给出两项音频基准分数和多产品开放入口,读者可以据此评估它对语音智能体开发的实际改进。

  2. Google DeepMind60

    Google DeepMind 发布衡量 AI 有害操纵的实证评估工具包

    Google DeepMind 发布关于 AI 有害操纵的新研究,称建立了首个经实证验证的评估工具包,用于测量 AI 以负面和欺骗性方式改变人类思想与行为的能力,并公开运行人类被试研究所需的全部材料。

    推荐理由:原文给出覆盖三国万余名参与者的实验设计和效能与倾向双维度框架,为理解和测量 AI 有害操纵风险提供了可复用的方法入口。

3月25日周三
  1. Google Research43

    Google Research 推出 S2Vec:用自监督嵌入学习城市建成环境的“语言”

    Google Research 在 Earth AI 计划下推出 S2Vec,一个自监督框架,将建成环境栅格化为多层级特征图像,再用 masked autoencoding 学习通用地理位置嵌入。评测显示 S2Vec 在零样本地理外推任务(如全美人口密度、中位收入预测)上通常是表现最好的单一模型,与图像嵌入做多模态融合后整体优于任一单一模态,但在树冠覆盖、海拔等环境类任务上仍需改进。

3月24日周二