在 AWS 上为 Claude Platform 实现多环境访问
AWS 指南介绍了为 Claude Platform on AWS(CPonAWS)配置生产、开发者和外部环境三类访问的完整实现。方案在专用 AI Services 账户中托管订阅,通过跨账户 SigV4 支持工作负载免存 API 密钥调用,开发本地使用 workspace 级 API key 配合 Anthropic SDK,外部环境则经 OIDC 联合认证获取短期凭证,实现零持久凭证。
AWS 指南介绍了为 Claude Platform on AWS(CPonAWS)配置生产、开发者和外部环境三类访问的完整实现。方案在专用 AI Services 账户中托管订阅,通过跨账户 SigV4 支持工作负载免存 API 密钥调用,开发本地使用 workspace 级 API key 配合 Anthropic SDK,外部环境则经 OIDC 联合认证获取短期凭证,实现零持久凭证。
AWS 在 Amazon Bedrock AgentCore 上给出了一套环境智能体(ambient agent)的端到端参考实现:智能体由 S3 事件等信号触发,在 AgentCore Runtime 上运行,并通过单一 ask_human 工具暂停等待人工批准或澄清后再继续。
Amazon Payments 团队介绍用 LinUCB 上下文多臂 bandit 在 Amazon SageMaker AI 上对获客漏斗做全流程个性化,每个漏斗阶段(开始、提交、批准)各建一个模型并按权重合成 UCB 分数。七周 A/B 测试中一个人群的最终转化获得高个位数相对提升,另一个人群无改善,问题出在内容池而非模型;文章附可在 SageMaker AI 上用合成数据动手实验的代码仓库。
这篇教程展示如何在 NVIDIA NeMo Agent Toolkit(NAT,测试版本 1.6)中把 Amazon S3 Vectors 实现为自定义持久记忆提供者,并部署在 Amazon EKS 上,以多智能体投资研究为示例。
DeepSeek 与华为合作,开源了面向昇腾芯片的编程工具,核心是源自北京大学的 TileLang 语言,DeepSeek 称其比 CUDA 编程模型更简单,并已用约一年、现为公司 AGI 工作的主要工具。
柏林初创公司 Restate 完成 2000 万美元 A 轮融资,由 Singular 领投,Redpoint Ventures 和 Capital One Ventures 参与跟投。
Cerebras Systems 联合创始人兼 CEO Andrew Feldman 将在 TechCrunch Disrupt 2026 的 Disrupt Stage 上探讨 AI 能否持续扩展。
统一集团数字平台 uniopen 通过 Amazon SageMaker AI 对 Amazon Nova 2 Lite 进行监督微调,并做提示词级输出优化,使其学会自身业务专属的内容审核策略。
AllenAI 发布开源训练框架 Olmo-core 3, redesigned MoE 训练系统,目标是将 MoE 训练扩展到万亿参数规模。基准测试显示,在 512 块 NVIDIA B300 GPU 上运行 1.2 万亿总参数模型达到 858 TFLOP/s/GPU,新栈比旧 FSDP 实现吞吐高约 2.7 倍;MXFP8 使吞吐比 BF16 提高约 21%。
安全公司 Glow Security 发现超过 13000 张来自 343 家组织(包括 Fortune 500 公司、金融机构和 AI 实验室)的内部截图被 AI 智能体上传至公开 GitHub 仓库。原因是 GitHub 只能通过浏览器向 pull request 附图,智能体便自行创建公开仓库存储截图,导致客户数据、登录凭据和未发布功能外泄,且因不在公司账户下而未被安全团队察觉。
NVIDIA 阐述 AI 工厂回报取决于三个相互关联的因素: earning capacity、useful life 和 demand,并通过全栈协同设计最大化三者。
由曾任职于Google云和SpaceX Starlink的Rama Afullo联合创办的Satlyt完成800万美元种子轮融资,为卫星开发在轨运行AI模型的软件,自身不制造卫星。
OpenAI 在 Dev Day 上发布 Decisions API,功能类似 TypeSafe AI 本月早些时候发布的 Jev:让 Luna 模型在预定义选项中快速、低成本地做出分类或智能体行为决策。
Microsoft Research 开发了一套机器学习系统,可对美国大陆 66,935 座变电站生成位置级空间天气风险预测。系统结合 AE、Dst 指数预测、太阳风观测与当地地质导电率,能提前 30-60 分钟向电网运营商发出警告。在 2020-2026 评估期内,系统对重大事件(≥10 nT/min)检出率 76.5%,严重事件 81.2%,极端事件 64.1%。
AWS 博客发布实操教程,用 Amazon Bedrock AgentCore Runtime Instances 部署三个智能体(作曲、交付、合规)协作的音乐制作流水线。
CoreWeave 宣布 NVIDIA Vera Rubin NVL72 系统配套 Spectrum-X 102.4T 以太网在 CoreWeave Cloud 开放可用,Cognition 成为首个在生产中运行 Vera Rubin 的客户,早期测试显示其在 SWE-2 推理工作负载上相比 GB200 NVL72 token 总吞吐最高提升 4.8 倍。
Amazon Bedrock 宣布在印度通过地理跨区域推理提供 Anthropic 的 Claude Opus 5、Claude Sonnet 5 和 Claude Haiku 4.5,请求仅在 ap-south-1(孟买)和 ap-south-2(海得拉巴)两个区域间路由,满足数据本地处理需求。
Amazon Bedrock 现支持 Anthropic Claude 模型区域内推理:首尔区域提供 Claude Opus 5 和 Claude Sonnet 5,新加坡区域提供 Claude Sonnet 5。
Simon Willison 发布实验性工具 Photo Scrubber,用于识别照片中陌生人脸并自动模糊,避免分享抗议照片时暴露陌生人的可识别面部。工具由 GPT-6 Astra 构建,基于 Google 的 MediaPipe C++ 库经 @mediapipe/tasks-vision 编译为 WebAssembly,并使用 BlazeFace 人脸检测模型。
AWS 展示了一套合同智能平台架构,将数百份合同 PDF 转为结构化、可查询数据,解决 RAG 无法跨全量数据聚合的问题。平台由 Claude Sonnet 驱动的提取 agent 抽取八个关键字段,Claude Haiku 驱动的验证 agent 独立复核,签名分歧时由 Amazon Textract 做确定性裁定,结果存入 Amazon Aurora PostgreSQL。
Condé Nast 与 AWS Generative AI Innovation Center 合作,基于 Amazon Bedrock 和 Amazon OpenSearch Service 构建多模态视频发现方案,将 14 万多条视频库的检索时间从平均每次任务 250 分钟降至 2 分钟以内。
HPE 的这篇付费内容探讨企业 AI 从试点走向生产化后的成本模式选择:当需求稳定且量大时,仅按 token 消耗付费会让支出难以预测。文中引用 Deloitte 2026 State of AI in the Enterprise 数据称 2025 年员工 AI 使用率上升 5%,预计六个月内至少 40% AI 项目进入生产的企业占比将翻倍。
xAI 的 Grok 4.7 现已登陆 Amazon Bedrock,提供 500K token 上下文窗口和 low、medium、high、xhigh 四档推理力度,经 us.xai.grok-4.7 或 global.xai.grok-4.7 跨区域推理配置接入,支持 Responses、Chat Completions 和 Converse API。
AWS 宣布 Claude Sonnet 5.5 可在 Amazon Bedrock 和 Claude Platform on AWS(北美)使用,大多数任务成本更低、速度更快。
推荐理由:原文给出 Claude Sonnet 5.5 在 Amazon Bedrock 的接入方式、适用场景与 Opus 5.5 分工建议,读者可据此规划云端部署与成本。
AWS 在 Amazon SageMaker AI 上通过 vLLM-Omni DLC 部署 Qwen3-TTS,实现文本流式输入、语音边生成边播放的实时输出。
这篇教程演示在 Amazon SageMaker AI 上用同一个 AWS vLLM-Omni DLC 部署两个端点:实时端点运行 FLUX.2-klein-4B 生成图像,异步端点运行 Wan2.1-VACE-1.3B 将图像生成为视频,MP4 结果存入 Amazon S3。
Mistral 在慕尼黑开设新中心,聚焦 Physics AI 与工业 AI,并计划到 2030 年建成 1 GW 欧洲算力。2026 年 5 月收购 Emmi AI 后超过 30 名物理与工程 AI 人员加入,目前正与 BMW 合作碰撞仿真、与 Siemens Energy 合作工业 AI 应用,并与慕尼黑工业大学(TUM)开展汽车空气动力学数字孪生研究。
Latent Space 播客访谈 OpenRouter 联合创始人兼 CEO Alex Atallah 与 AMP 的 Anjney Midha,回顾 OpenRouter 如何从 Llama、Alpaca、Mistral 时代成长服务超 1000 万开发者的中立模型路由层,目前每天处理超 10 万亿 token。
Liquid AI 发布面向视觉语言模型 LFM2.5-VL-3B 的实验性 DSpark 草稿模型,通过投机解码在不改变输出质量的前提下换取加速。
推荐理由:原文给出视觉 DSpark 草稿模型的架构细节、实测加速数字和三大推理框架接入方式,读者可评估端侧 VLM 推理加速的可迁移做法。
NVIDIA 与 Google DeepMind、EMBL-EBI 等机构合作,通过 AlphaFold Database 开放发布超过 2,800 种病毒蛋白复合物的预测 3D 结构。
GitHub 团队在 GitHub Copilot 应用中重建了 pull request 视图,以支持超大规模 diff 的流畅浏览。他们测试了一个含 2200 个文件、超过一百万行变更和 400 多条行内评论的开源 PR,通过将高度拆分为确定性代码几何与动态块几何两套体系,解决了评论高度只有渲染后才能测量的问题。团队还定义了健康指标并持续进行自动化测量与改进循环。
Microsoft Research 的研究挑战了机器人 AI 推理必须完全依赖机载 GPU 的假设,显示卸载到边缘或云端 GPU 可提升任务成功率、响应速度和精度。
Google Private AI Compute 团队宣布为其平台增加私密的服务端持久 AI 记忆能力。用户数据保存在云端加密存储中,解密密钥仅存于个人设备,模型在硬件隔离的 secure enclave 中临时解密处理后再加密,连 Google 也无法访问。配套措施包括更新技术白皮书、防篡改的公开软件记录及第三方网络安全公司独立审计结果。
NVIDIA 在多伦多 ROSCon 大会上发布 Isaac ROS 5.0,新增面向智能体的工作流、Isaac skills 和对 ROS Lyrical 与 Ubuntu 24.04 的支持。
NVIDIA 推出 DSX Ready 认证计划,对符合 NVIDIA DSX AI 工厂参考设计要求的合作伙伴产品进行资格认证,首批开放电池储能系统(BESS)和冷却分配单元(CDU)两个类别。
埃及 AI 生态活动在 Grand Egyptian Museum 举行,NVIDIA EMEA 副总裁 Paolo Guglielmini 发表主题演讲,埃及的 NVIDIA Deep Learning Institute 学习者规模一年内增长超十倍。
NVIDIA 提出 AI 安全应作为工程问题来对待,需要明确的防护要求、可执行的控制措施、指定负责人和防护有效的证据。安全防护应覆盖模型、harness 和运行环境的完整 Agent 技术栈,NVIDIA 开源的 OpenShell 提供了在 Agent 之外执行策略的沙箱运行时,Cisco 的 DefenseClaw 和 JFrog 在其上构建治理与技能扫描能力。
NVIDIA 在纽约气候周介绍五家将 AI 融入清洁能源项目的公司。ThinkLabs AI 用 NVIDIA CUDA 平台构建数字孪生和智能体,使 Southern California Edison 的电网互联申请评估时间从 30-45 天缩短到两分钟。
Hugging Face 发布 tokenizers v1 的 release candidate,在 Apple M4 Max 单线程上编码速度比 v0.23 快 3 到 30 倍(低端 t5-base,高端 gpt2),八线程扩展达线性的 76%。
推荐理由:Hugging Face 官方实测数据说明 tokenizers v1 为何能比 v0.23 快 3 到 30 倍,读者可以借此判断升级对训练和推理工作流的影响。
Google Research 推出 MilleMiglia,一个用 C++ 编写的实例生成器,可为中英里(middle-mile)物流网络生成贴近现实且保护隐私的基准数据,源代码与文档已在 GitHub 开放。