理解提示词注入:AI 前沿安全挑战
提示词注入是 AI 系统面临的前沿安全挑战。OpenAI 介绍了这类攻击的运作方式,并说明其如何通过推进相关研究、训练模型和构建安全防护来保护用户。
提示词注入是 AI 系统面临的前沿安全挑战。OpenAI 介绍了这类攻击的运作方式,并说明其如何通过推进相关研究、训练模型和构建安全防护来保护用户。
Google Research 推出 DS-STAR 数据科学智能体,通过数据文件分析模块、LLM 判官验证和顺序规划迭代三项创新,支持 JSON、非结构化文本等异构数据格式。
OpenAI 推出青少年安全蓝图,为负责任地构建 AI 提供路线图。该方案涵盖安全防护措施、适龄设计以及多方协作,旨在保护并赋能线上青少年群体。
OpenAI 发文表示 AI 正在快速进步,人类有机会塑造其发展方向。文章呼吁引导 AI 走向科学发现、安全保障和更美好的未来。
CRED 与 OpenAI 合作,使用 GPT 驱动的工具提升印度高端客户体验,提高客服支持准确率、缩短响应时间并提升客户满意度。
Google DeepMind 发布三项生物圈研究:与 World Resources Institute 合作建立基于 vision transformers 的森林砍伐风险预测模型,分辨率达 1km²、预测可细至 30 米,覆盖 2000-2024 年,并发布预测基准数据集。
Google Research 与 World Resources Institute 合作发布 ForestCast,一个基于纯卫星数据、用 vision transformers 预测森林砍伐风险的深度学习模型,准确度可持平或超过依赖道路等专用输入的现有方法。
Chime CMO Vineet Mehra 分享了 AI 如何将营销重塑为智能体驱动模式。他认为优先提升 AI 素养并审慎推进落地的领导者将带动业务增长。
全球已有超过 100 万商业客户使用 OpenAI。ChatGPT 和 OpenAI 的 API 正在医疗健康、生命科学、金融服务等行业推动智能化的 AI 工作方式。
Google 发布预印论文,提出 Project Suncatcher 计划,设想在晨昏太阳同步低地球轨道部署搭载 TPU、以自由空间光链路互联的太阳能卫星星座来扩展 AI 算力。
推荐理由:Google 官方给出太空 AI 算力设想的关键数据与验证进展,读者可据此了解星载 TPU、星间光链路与发射成本的具体可行性分析。
OpenAI 推出 IndQA,一个用于评测 AI 系统在印度语言表现的基准。该基准由领域专家参与构建,覆盖 12 种语言和 10 个知识领域,考察模型的文化理解与推理能力。
OpenAI 与 AWS 达成 380 亿美元多年战略合作,用于扩展先进 AI 工作负载。AWS 将为 OpenAI 下一代模型提供基础设施和算力。
推荐理由:合作由当事方官方宣布,读者可以据此了解 OpenAI 后续模型的算力供给来源。
这篇 Berkeley AI Research 博客介绍一种基于分治而非 TD learning 的 off-policy RL 价值学习范式。
Google Research 在 Mountain View 的 Research@ 活动上汇总多项进展。
OpenAI 宣布将 Stargate 项目扩展至密歇根州,新建一座 1 吉瓦(one-gigawatt)规模的 AI 基础设施园区。该项目将创造就业机会、带动投资,并促进美国中西部地区的经济增长。
OpenAI 推出 Aardvark,一个能自主发现、验证并协助修复软件漏洞的 AI 安全研究员。该系统目前处于 private beta 阶段,用户可报名参加早期测试。
Google 发布 provably private insights(PPI)系统,结合 LLM、差分隐私和可信执行环境分析 GenAI 使用数据,保证个体数据不可查看、聚合结果匿名。
MiniMax 团队成员分享 MiniMax M2 后训练中智能体对齐的关键经验。结论包括:智能体需要 Interleaved Thinking,思考可在任务任意阶段发生以应对工具输出等外部扰动。
OpenAI 深入解析了为 ChatGPT Atlas 浏览器打造的新架构 OWL。OWL 将 Chromium 解耦,实现快速启动和丰富 UI,并支持与 ChatGPT 结合的 agentic 浏览体验。
Google Research 在 UIST'25 上发布 StreetReaderAI,一个基于 Gemini 的无障碍街景概念验证原型,可为盲人和低视力用户提供实时 AI 场景描述与对话导航。
Hugging Face 发布长文分析全球算力格局变化,指出中国开源权重模型的进展正与国产 AI 芯片的快速发展相互推动。近几个月华为昇腾、寒武纪等国产芯片已开始支撑热门开源模型的推理,蚂蚁集团、百度等开始在国产硬件上训练模型。
推荐理由:文章把美国出口管制与中国芯片进展、开源模型效率创新放在同一条线索里梳理,帮助读者理解算力格局变化的来龙去脉。
OpenAI 发布 gpt-oss-safeguard-120b 和 gpt-oss-safeguard-20b 两个开放权重推理模型,由 gpt-oss 模型后训练而来,可根据给定策略推理并对内容进行标注。技术报告描述了其能力,并以底层 gpt-oss 模型为基线提供了安全评估结果。
推荐理由:原文给出两个安全审核模型的训练思路和基线安全评估来源,读者可以据此了解其按策略标注内容的能力定位。
OpenAI 发布 gpt-oss-safeguard,是用于安全分类的开源权重推理模型。开发者可以在其上应用并迭代自定义安全策略。
推荐理由:原文说明这是面向安全分类的开源权重推理模型,开发者可自定义安全策略并迭代,适合关注安全工程的人参考。
NVIDIA Isaac for Healthcare v0.4 提供 SO-ARM 入门工作流,帮助开发者构建自主手术助理机器人,覆盖数据采集、训练与部署全流程。
NVIDIA 推出的 Isaac for Healthcare v0.4 提供 SO-ARM 起始工作流,可端到端构建自主手术辅助机器人:用 SO-ARM101 和 LeRobot 采集仿真与真实遥操作数据,post-train GR00T N1.5,在 Isaac Lab 评估后部署到真实硬件。
DNP 在十大核心部门全面部署 ChatGPT Enterprise,三个月内取得显著成效。专利研究速度提升 95%,处理量达到 10 倍,自动化率达 87%,知识复用率达 70%。
IBM 发布 Granite 4.0 Nano,这是 Granite 4.0 家族中参数最小的模型,含 Granite 4.0 H 1B(约 1.5B)、Granite 4.0 H 350M(约 350M)及对应传统 transformer 版本,采用 Apache 2.0 许可。
安全公司 Doppel 使用 GPT-5 和强化微调来阻止 deepfake 与身份冒充攻击,在攻击扩散前完成拦截。该系统将分析师工作量减少 80%,并把响应时间从数小时缩短到数分钟。
Microsoft 与 OpenAI 签署新协议,强化双方长期合作伙伴关系。公告称新协议将扩大创新并确保负责任的 AI 进展。
OpenAI 宣布完成资本重组,强化以使命为导向的治理结构。此举旨在扩大资源投入,确保 AI 造福所有人,同时负责任地推进创新。
Hugging Face 在博客中提出 voice consent gate 概念,只有说话人朗读并经 ASR 识别出明确的同意语句后,语音克隆 TTS 才能启动。文中给出包含演示 Space 的示例代码,说明用语言模型按随机日常话题生成同意句与音素多样性句的组合,并指出该设计仍可被其他 TTS 伪造,未来可探索音频溯源等验证手段。
Google 推出由 Gemini 模型驱动的个人健康教练,从次日起向符合条件的美国 Fitbit Premium Android 用户开放自愿参与的公开预览,并将很快扩展到 iOS。系统采用多智能体框架(对话、数据科学、领域专家子智能体),基于 SHARP 评测框架进行验证,涉及超 100 万条人工标注和超 10 万小时专家评估。
OpenAI 向白宫提交意见书,阐述如何抓住 AI 机遇。文件提出需对能源和基础设施进行战略投资,通过扩大容量和培养劳动力就绪度,维持美国在 AI 领域的领导地位与经济增长。
OpenAI 与 170 多位心理健康专家合作,提升 ChatGPT 识别心理困扰、做出共情回应并引导用户寻求现实支持的能力。此举将不安全回应减少最多 80%。
OpenAI 发布 GPT-5 系统卡附录,说明 GPT-5 在敏感对话处理上的改进。新增针对情感依赖、心理健康和越狱抵抗力的基准。
Hugging Face 发布 huggingface_hub v1.0,该库现支持 20 万依赖库,并提供超过 200 万公开模型、50 万公开数据集和 100 万公开 Spaces 的访问。
推荐理由:官方完整梳理了 huggingface_hub 五年演进与 v1.0 的破坏性变更,含兼容性影响和迁移指引,对依赖该库的开发者有直接参考价值。
Steuerrecht.com 使用 ChatGPT Business 简化法律工作流程、自动化税务研究,为律所更快产出可直接交付客户的分析。
Hugging Face 发布 datasets 与 huggingface_hub 库的流式加载优化,一行 streaming=True 即可免下载训练多 TB 数据集。
推荐理由:官方给出 streaming 后端的具体优化指标和可复现代码,适合据此评估是否直接用流式替代本地下载来训练大规模数据集。
Mistral 发布 Mistral AI Studio,将支撑其自身大规模系统的基础设施打包给企业团队,用于在生产环境构建、评估和运行 AI。平台由三大支柱组成:Observability、基于 Temporal 的 Agent Runtime 和 AI Registry,提供评估、可追溯反馈回路、版本管理与治理能力,并支持混合、专用和自托管部署。
Hugging Face 团队发布 LeRobot v0.4.0,引入支持超过 400GB 数据集的 LeRobotDataset v3.0 分块格式与流式加载,并集成 Physical Intelligence 的 pi0、pi0.5 和 NVIDIA 的 GR00T N1.5 等 VLA 模型。
推荐理由:Hugging Face 官方详述 LeRobot v0.4.0 各项升级,读者可以据此评估新的数据格式、VLA 模型集成和硬件插件如何用于自己的机器人学习项目。