Google 推出 StreetReaderAI:用情境感知多模态 AI 让街景对视障用户可用
Google Research 在 UIST'25 上发布 StreetReaderAI,一个基于 Gemini 的无障碍街景概念验证原型,可为盲人和低视力用户提供实时 AI 场景描述与对话导航。
Google Research 在 UIST'25 上发布 StreetReaderAI,一个基于 Gemini 的无障碍街景概念验证原型,可为盲人和低视力用户提供实时 AI 场景描述与对话导航。
Hugging Face 发布长文分析全球算力格局变化,指出中国开源权重模型的进展正与国产 AI 芯片的快速发展相互推动。近几个月华为昇腾、寒武纪等国产芯片已开始支撑热门开源模型的推理,蚂蚁集团、百度等开始在国产硬件上训练模型。
推荐理由:文章把美国出口管制与中国芯片进展、开源模型效率创新放在同一条线索里梳理,帮助读者理解算力格局变化的来龙去脉。
OpenAI 发布 gpt-oss-safeguard-120b 和 gpt-oss-safeguard-20b 两个开放权重推理模型,由 gpt-oss 模型后训练而来,可根据给定策略推理并对内容进行标注。技术报告描述了其能力,并以底层 gpt-oss 模型为基线提供了安全评估结果。
推荐理由:原文给出两个安全审核模型的训练思路和基线安全评估来源,读者可以据此了解其按策略标注内容的能力定位。
OpenAI 发布 gpt-oss-safeguard,是用于安全分类的开源权重推理模型。开发者可以在其上应用并迭代自定义安全策略。
推荐理由:原文说明这是面向安全分类的开源权重推理模型,开发者可自定义安全策略并迭代,适合关注安全工程的人参考。
NVIDIA Isaac for Healthcare v0.4 提供 SO-ARM 入门工作流,帮助开发者构建自主手术助理机器人,覆盖数据采集、训练与部署全流程。
NVIDIA 推出的 Isaac for Healthcare v0.4 提供 SO-ARM 起始工作流,可端到端构建自主手术辅助机器人:用 SO-ARM101 和 LeRobot 采集仿真与真实遥操作数据,post-train GR00T N1.5,在 Isaac Lab 评估后部署到真实硬件。
DNP 在十大核心部门全面部署 ChatGPT Enterprise,三个月内取得显著成效。专利研究速度提升 95%,处理量达到 10 倍,自动化率达 87%,知识复用率达 70%。
IBM 发布 Granite 4.0 Nano,这是 Granite 4.0 家族中参数最小的模型,含 Granite 4.0 H 1B(约 1.5B)、Granite 4.0 H 350M(约 350M)及对应传统 transformer 版本,采用 Apache 2.0 许可。
安全公司 Doppel 使用 GPT-5 和强化微调来阻止 deepfake 与身份冒充攻击,在攻击扩散前完成拦截。该系统将分析师工作量减少 80%,并把响应时间从数小时缩短到数分钟。
Microsoft 与 OpenAI 签署新协议,强化双方长期合作伙伴关系。公告称新协议将扩大创新并确保负责任的 AI 进展。
OpenAI 宣布完成资本重组,强化以使命为导向的治理结构。此举旨在扩大资源投入,确保 AI 造福所有人,同时负责任地推进创新。
Hugging Face 在博客中提出 voice consent gate 概念,只有说话人朗读并经 ASR 识别出明确的同意语句后,语音克隆 TTS 才能启动。文中给出包含演示 Space 的示例代码,说明用语言模型按随机日常话题生成同意句与音素多样性句的组合,并指出该设计仍可被其他 TTS 伪造,未来可探索音频溯源等验证手段。
Google 推出由 Gemini 模型驱动的个人健康教练,从次日起向符合条件的美国 Fitbit Premium Android 用户开放自愿参与的公开预览,并将很快扩展到 iOS。系统采用多智能体框架(对话、数据科学、领域专家子智能体),基于 SHARP 评测框架进行验证,涉及超 100 万条人工标注和超 10 万小时专家评估。
OpenAI 向白宫提交意见书,阐述如何抓住 AI 机遇。文件提出需对能源和基础设施进行战略投资,通过扩大容量和培养劳动力就绪度,维持美国在 AI 领域的领导地位与经济增长。
OpenAI 与 170 多位心理健康专家合作,提升 ChatGPT 识别心理困扰、做出共情回应并引导用户寻求现实支持的能力。此举将不安全回应减少最多 80%。
OpenAI 发布 GPT-5 系统卡附录,说明 GPT-5 在敏感对话处理上的改进。新增针对情感依赖、心理健康和越狱抵抗力的基准。
Hugging Face 发布 huggingface_hub v1.0,该库现支持 20 万依赖库,并提供超过 200 万公开模型、50 万公开数据集和 100 万公开 Spaces 的访问。
推荐理由:官方完整梳理了 huggingface_hub 五年演进与 v1.0 的破坏性变更,含兼容性影响和迁移指引,对依赖该库的开发者有直接参考价值。
Steuerrecht.com 使用 ChatGPT Business 简化法律工作流程、自动化税务研究,为律所更快产出可直接交付客户的分析。
Hugging Face 发布 datasets 与 huggingface_hub 库的流式加载优化,一行 streaming=True 即可免下载训练多 TB 数据集。
推荐理由:官方给出 streaming 后端的具体优化指标和可复现代码,适合据此评估是否直接用流式替代本地下载来训练大规模数据集。
Mistral 发布 Mistral AI Studio,将支撑其自身大规模系统的基础设施打包给企业团队,用于在生产环境构建、评估和运行 AI。平台由三大支柱组成:Observability、基于 Temporal 的 Agent Runtime 和 AI Registry,提供评估、可追溯反馈回路、版本管理与治理能力,并支持混合、专用和自托管部署。
Hugging Face 团队发布 LeRobot v0.4.0,引入支持超过 400GB 数据集的 LeRobotDataset v3.0 分块格式与流式加载,并集成 Physical Intelligence 的 pi0、pi0.5 和 NVIDIA 的 GR00T N1.5 等 VLA 模型。
推荐理由:Hugging Face 官方详述 LeRobot v0.4.0 各项升级,读者可以据此评估新的数据格式、VLA 模型集成和硬件插件如何用于自己的机器人学习项目。
OpenAI 宣布收购 Software Applications Incorporated,该公司开发了 Mac 上的自然语言界面应用 Sky。OpenAI 计划把 Sky 深度整合 macOS 的能力融入 ChatGPT,让 AI 在桌面端更直观、更懂上下文、更能直接执行操作。
Consensus 基于 GPT-5 和 OpenAI Responses API 构建多智能体研究助手,可在几分钟内读取、分析并综合文献证据。该平台已帮助超过 800 万研究人员加速科学发现。
Google 发布 Google Earth AI 相关技术论文,介绍新的 Imagery 与 Population 基础模型,以及由 Gemini 驱动的 Geospatial Reasoning 智能体,用于多步地理空间问答。
推荐理由:官方同步放出技术论文和评测数字,读者可以据此了解跨模态地理空间推理的实际能力边界与应用案例。
OpenAI 的 Korea Economic Blueprint 阐述韩国如何通过主权能力与战略合作扩展可信 AI,以驱动经济增长。该蓝图聚焦建设可信 AI 与主权能力两个方向,并强调战略伙伴关系的作用。
Meta-PyTorch 与 Hugging Face 联合推出 OpenEnv Hub,一个共享开放的智能体环境社区平台,同时发布 OpenEnv 0.1 规范(RFC)征集社区反馈。
OpenAI 推出 Company knowledge 功能,将应用中的公司上下文带入 ChatGPT,生成贴合业务的具体回答并附清晰引用。功能面向 Business、Enterprise 和 Edu 用户开放,同时提供安全、隐私和管理员控制选项。
OpenAI 与英国司法部达成新协议,为公务员提供 ChatGPT,进一步拓展其在英国的合作伙伴关系。同时 OpenAI 为 ChatGPT Enterprise、ChatGPT Edu 和 API Platform 推出英国数据驻留(UK data residency),以支持可信、安全的 AI 应用。
Sentence Transformers(SBERT)正式从 TU Darmstadt 的 UKP Lab 移交至 Hugging Face,由 2023 年底起接手维护的 Tom Aarsen 继续领导。该开源库自 2019 年由 Nils Reimers 创建,Hub 上已有超过 16,000 个模型,月独立用户超百万。项目将继续以 Apache 2.0 许可证保持社区驱动的开源模式。
Hugging Face 与威胁情报平台 VirusTotal 合作,对 Hub 上 220 万个以上的公开模型和数据集仓库进行持续安全扫描。访问仓库或文件页面时会自动比对文件哈希与 VirusTotal 威胁情报数据库,返回检测结果和威胁情报元数据,且不共享文件原始内容以保护隐私。用户可在下载前查看文件是否被标记,企业也能将检测集成到 CI/CD 流程中。
OpenAI 发布日本经济蓝图,阐述日本如何借助 AI 提升创新能力、增强竞争力,并实现可持续、包容性的增长。该蓝图来自 OpenAI News,聚焦 AI 对日本经济发展的政策方向。
ChatGPT 将于 2026 年 1 月 15 日后不再在 WhatsApp 上可用。OpenAI 指引用户将 ChatGPT 账号与设备关联,以便在多个设备上继续此前的对话。
OpenAI 发布内置 ChatGPT 的浏览器 ChatGPT Atlas。原文仅作发布介绍,且注明该产品此后已被弃用;feed 未提供完整正文,更多细节以原文链接为准。
Hugging Face 宣布其开源无代码工具 AI Sheets 新增视觉支持,可在表格中分析图片、提取结构化数据、从文本生成图像并用 Qwen-Image-Edit 等模型编辑图像。
推荐理由:官方发布带来图像提取、生成与编辑能力,教程演示了手写菜谱数字化等具体用法,便于读者评估是否引入自己的数据工作流。
Hugging Face 发布开源 OCR 模型指南,新增 Chandra 和 OlmOCR-2 及其 OlmOCR Benchmark 得分。
推荐理由:指南基于 OlmOCR Benchmark 等公开基准对比了 9 个开源 OCR 模型的格式、大小与成本,并给出按使用场景选型的具体方法。
全球约 2.2 亿人受食物过敏困扰,Hugging Face 发起 AI for Food Allergies 项目,打造首个社区驱动的研究实验室,探索 AI 如何推进食物过敏研究。该项目计划以开放协作的方式桥接 AI 与生物医学,涵盖过敏原预测、药物靶点建模、临床诊断与标签识别等方向,让研究者、临床医生和患者共同受益。
Intel 与 Hugging Face 在 Google Cloud C4 VM(Intel Xeon 6,代号 Granite Rapids)上对开源 MoE 模型 GPT OSS 进行文本生成基准测试,结果显示相比上一代 C3 VM 实例 TCO 提升 1.7 倍。
Plex Coffee 使用 ChatGPT Business 集中管理知识、加快员工培训,并在扩张的同时保持与顾客的个人连接,实现快速个性化服务。
Hugging Face 发布教程,介绍用 Optimum Intel 和 OpenVINO 在无 GPU 的 Intel CPU 上本地部署 SmolVLM2-256M-Video-Instruct 的三个步骤:模型转换、量化(权重量化或静态量化)和推理。
OpenAI 成立 Well-Being and AI 专家委员会,汇集心理学家、临床医生和研究人员,指导 ChatGPT 如何支持情绪健康,尤其是青少年群体。其见解将帮助塑造更安全、更有关怀的 AI 体验。