在 AWS 上为 Claude Platform 实现多环境访问
AWS 指南介绍了为 Claude Platform on AWS(CPonAWS)配置生产、开发者和外部环境三类访问的完整实现。方案在专用 AI Services 账户中托管订阅,通过跨账户 SigV4 支持工作负载免存 API 密钥调用,开发本地使用 workspace 级 API key 配合 Anthropic SDK,外部环境则经 OIDC 联合认证获取短期凭证,实现零持久凭证。
AWS 指南介绍了为 Claude Platform on AWS(CPonAWS)配置生产、开发者和外部环境三类访问的完整实现。方案在专用 AI Services 账户中托管订阅,通过跨账户 SigV4 支持工作负载免存 API 密钥调用,开发本地使用 workspace 级 API key 配合 Anthropic SDK,外部环境则经 OIDC 联合认证获取短期凭证,实现零持久凭证。
AWS 在 Amazon Bedrock AgentCore 上给出了一套环境智能体(ambient agent)的端到端参考实现:智能体由 S3 事件等信号触发,在 AgentCore Runtime 上运行,并通过单一 ask_human 工具暂停等待人工批准或澄清后再继续。
这篇教程展示如何在 NVIDIA NeMo Agent Toolkit(NAT,测试版本 1.6)中把 Amazon S3 Vectors 实现为自定义持久记忆提供者,并部署在 Amazon EKS 上,以多智能体投资研究为示例。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络防御者开放,后续面向开发者、企业和消费者推出。
推荐理由:官方公布的能力、价格与安全机制信息完整,读者可以据此判断 Gemini 4 Argon 在编码、知识工作和网防上的实际变化。
Amazon Bedrock Knowledge Bases 可为保险理赔文件构建对话式查询助手,通过 AgenticRetrieveStream API 将多部分问题拆解为子查询并多轮检索,直至证据充分后生成带引用的答案。
AWS 博客发布实操教程,用 Amazon Bedrock AgentCore Runtime Instances 部署三个智能体(作曲、交付、合规)协作的音乐制作流水线。
CoreWeave 宣布 NVIDIA Vera Rubin NVL72 系统配套 Spectrum-X 102.4T 以太网在 CoreWeave Cloud 开放可用,Cognition 成为首个在生产中运行 Vera Rubin 的客户,早期测试显示其在 SWE-2 推理工作负载上相比 GB200 NVL72 token 总吞吐最高提升 4.8 倍。
GPT-6.1 Sol 现已在 Amazon Bedrock 正式可用,作为 GPT-6 Sol 的重大升级,面向智能体编码、计算机使用和专业工作负载提供更强推理。
推荐理由:官方公告给出 GPT-6.1 Sol 上架 Bedrock 后的代理编码、成本对比与数据安全控制,读者可评估生产部署的可行性。
AWS 撰文逐组件解析 Amazon Quick 的提示词写法:Quick Research 需明确目标、受众和关注领域,并从 200+ 新闻源及 S&P Global。
AWS 展示了一套合同智能平台架构,将数百份合同 PDF 转为结构化、可查询数据,解决 RAG 无法跨全量数据聚合的问题。平台由 Claude Sonnet 驱动的提取 agent 抽取八个关键字段,Claude Haiku 驱动的验证 agent 独立复核,签名分歧时由 Amazon Textract 做确定性裁定,结果存入 Amazon Aurora PostgreSQL。
Microsoft Research 推出 Quine,一个结合生物学多模态世界模型与连接科学工具、文献和 wet lab 的交互 harness 的 AI 研究系统。
推荐理由:官方介绍 Quine 的世界模型与工具环路设计,并给出胰腺癌化合物筛选的湿实验验证结果,读者可据此评估 AI 驱动生物研究的路径。
Hugging Face 论文提出 ProvenanceGuard,一个针对 MCP 智能体的生成后验证层,专门检测「跨来源混淆」——事实存在但被归因到错误来源的回答,且无需重新训练 Agent,流程含声明分解、来源路由、支持性校验、归因比对与 RARR 式修复。
OpenAI 推出 dots,定位为可在复杂项目和日常任务中持续推进工作的主动式助手。官方说明 dots 在工作推进的同时帮助用户保持掌控,详情见 https://openai.com/index/introducing-dots。
Microsoft Research Asia – Singapore 于 2025 年 7 月 24 日成立,是 Microsoft 在东南亚的首个研究实验室,成立一年间围绕下一代 AI 模型与智能体系统、面向实际应用的领域 AI、AI 原生研究实践、生态与人才培养四大方向开展工作。
AWS 在 Machine Learning Blog 上展示了用 Amazon Nova Act 与 Amazon Bedrock AgentCore 构建智能体驱动的合成监控方案,模拟登录、结账等关键用户旅程,替代依赖 DOM 选择器、易因 UI 变化失效的 Selenium/Playwright 脚本。
Hcompany 发布 Holo4 智能体系列模型,含 27B dense 和 35B-A3B MoE 两个尺寸,并更新发布 Holotron4 Nano。模型可通过 GUI、代码、MCP 和 API 多种接口操作软件,在 OSWorld 2.0 上 Holo4 27B 得分 61.7%(Opus 5.5 为 81.8%),35B-A3B 达 30.9%,参数量和成本显著更低。
推荐理由:原文给出 OSWorld 2.0 等基准分数、成本对比和全部轨迹开源信息,读者可以据此评估这款多接口智能体模型是否适配自己的业务工作流。
GitHub Copilot app 的 canvases 功能让用户用 /create-canvas 技能以自然语言描述生成看板、清单等自定义界面,无需编码。画布是双向共享的,用户和 Agent 可同时操作并实时同步状态,创建后可作为扩展保存供个人或团队复用,社区还通过 Awesome Copilot 提供了现成的 canvas 扩展。
聊天仍是与 LLM 交互的主要方式,但作者认为在多数场景下 chat 并非合适的 UI。GitHub Copilot app 中的 canvas 是一个可与 agent 双向通信的全栈小应用,既能调用第三方 API,也能在本地执行代码,文中演示了用它玩 Connect 4、管理 Winget 包、操作 SQLite 数据库以及自动化开发工作流。
Google Research 发布 AI 视频 Co-Director 研究,在 Gemini 与 Veo 之上构建统一多智能体框架,通过全局优化与世界状态追踪生成连贯的分钟级多镜头视频。
GitHub Security Lab 的 Antonio Morales 发布开源 Fuzzing Taskflow,基于 Taskflow Agent 为 C/C++ 项目提供自主模糊测试流水线。
推荐理由:作者亲述设计取舍,读者可以照着跑起来,并理解 LLM 智能体如何接管模糊测试中重复的人工环节。
NVIDIA 于 9 月 22-23 日在新加坡举办 AI Day,与合作伙伴展示东南亚地区的 AI 进展。
NVIDIA 在多伦多 ROSCon 大会上发布 Isaac ROS 5.0,新增面向智能体的工作流、Isaac skills 和对 ROS Lyrical 与 Ubuntu 24.04 的支持。
NVIDIA 提出 AI 安全应作为工程问题来对待,需要明确的防护要求、可执行的控制措施、指定负责人和防护有效的证据。安全防护应覆盖模型、harness 和运行环境的完整 Agent 技术栈,NVIDIA 开源的 OpenShell 提供了在 Agent 之外执行策略的沙箱运行时,Cisco 的 DefenseClaw 和 JFrog 在其上构建治理与技能扫描能力。
GitHub Podcast 最新一期逐条拆解五个常见 AI 观点:AI 生成代码仍需人工审查,但注意力应放在高风险处;Skills 与 MCP 解决不同问题,前者提供打包的专业知识、后者提供工具与数据接入标准,二者可组合使用;RAG 也没有死,好的检索能让模型更接近答案,与 Agent、skills、MAG 等可共存于同一工作流。
GitHub 用 Copilot agent 将 Copilot agent runtime 从 TypeScript 完整重写为 832,378 行生产 Rust,AI 编写了大部分代码,历时约 14.5 周、128 个 PR,采用原地逐组件替换而非一次性切换,性能有数量级提升。
推荐理由:一手复盘给出原地迁移策略、缓存命中率与子会话协作细节,对规划大规模 agent 辅助重写有可借鉴方法。
Google DeepMind 于 2026 年 9 月 15 日发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两款语音对话模型。
推荐理由:官方公布了两个语音模型的能力定位、多项基准成绩和可用入口,读者可以据此评估是否接入自己的语音应用。
IBM Research 在 ALTK-Evolve 中推出 Consistency Analyzer 和一致性指南,针对智能体重复执行同一任务的稳定性问题。
Perplexity 将 GPT-6 Astra 用于端到端系统,包括撰写沟通内容、修改软件和监控生产系统。与使用早期模型相比,Perplexity 的人工检查频率显著降低。
GitHub 日本和韩国营销负责人分享如何用 GitHub Copilot 将活动运营自动化,从单个 GitHub Issue 出发完成建页、邀请邮件、报名筛选和会后报告,把原本需数天的手工流程压缩到几分钟。
Google Research 在 ACL 2026 提出 ToolGrad,先生成真实工具调用链再标注用户查询的“answer-first”范式,替代传统 DFS 探索式数据生成,通过 propose、execute、select、update 四个模块迭代构建 API 工作流。
GitHub Copilot app 新增 diff、terminal 和 browser 三个内置面板,让用户在不离开应用的情况下审查 AI 智能体的代码改动、运行命令并预览效果。
Mistral 帮助一家欧洲能源运营商把 40 万行 Fortran 77 油藏模拟器中的首期 4 万行迁移到 C++,先搭建数值对齐校验框架导出 Fortran 状态并用 C++ 测试框架验证。
OpenAI 发布 GPT-6 Astra,称其为面向商业的最强模型。该模型具备高级推理、计算机使用能力,写作和设计判断也更强。
GitHub 推出 Project HydraFusion 研究预览,通过运行时多模型编排提供前沿级编码智能,所有 GitHub Copilot 计划用户可在 Copilot CLI 中通过 /experimental 使用,按各模型标准费率计费。
推荐理由:原文给出三种执行模式和跨基准的成本质量数据,读者可以据此判断多模型编排对编码工作流的实际取舍。
GitHub Copilot app 支持同时运行多个 AI 智能体,各会话相互独立、互不干扰。每个会话可运行在各自的 Git worktree 上并保留独立上下文,并行执行不同任务。开发者可在 sessions 视图跟踪进度,把时间花在审查和决策上,无需逐个等待任务完成。
Hugging Face 发布开源工具 funes,为 Claude Code、Codex、pi、Hermes 等编码智能体提供持久记忆层,基于机器上已有的会话记录构建,本地索引与检索,一条 funes add 命令即可接入。
推荐理由:官方介绍这款本地优先的智能体记忆层,给出了安装方式、检索管线设计和跨机器共享机制,可评估是否纳入自己的编码工作流。
Google DeepMind 推出 Fairwind 计划,向政府机构和受信任的合作伙伴开放先进的网络防御能力。该计划将 Gemini 3.8 Flash Cyber 模型与 CodeMender 结合,可自主查找、验证并修复漏洞,在几分钟内生成就绪的补丁,初始访问面向政府、关键基础设施运营商和核心技术平台。
Google DeepMind 发布 Gemini 3.8 Flash 和 3.8 Flash Cyber,称其为迄今最佳推理与编码模型,定价与 3.7 Flash 相同(每百万输入 token $0.75、输出 $3.75)。
推荐理由:官方公布了两个变体的基准数字、定价和 Cyber 版的申请入口,读者可据此评估升级成本与实际收益。
Polimill 利用 OpenAI GPT 模型和 Codex,帮助日本地方政府(municipalities)检索和使用行政知识,同时加速开发。该方案面向日本公共部门,构建新一代公共 AI 基础设施。
Google 在 Earth AI 计划下推出实验性研究能力行星预测引擎(PPE),可从自然语言查询出发自主完成数据发现、清洗、特征工程、模型训练与评估。